只需一张角色图和一段驱动视频,Wan2.2 Animate 就能让静态人物动起来,也能直接把现有视频中的演员替换成你的角色,同时尽量保留原场景。它是阿里巴巴推出的开源 14B 角色动画模型,于 2025 年 9 月 19 日以 Apache-2.0 协议发布,可通过 ComfyUI 或官方 CLI 在本地运行。不过,最终成片是否干净,关键不只是点击生成:FPS 匹配、姿态对齐和遮罩质量都会直接影响结果。
Wan2.2 Animate 到底是什么?
Wan-AI 的 Wan2.2-Animate-14B,是基于 Wan2.2 I2V-A14B 图生视频模型打造的 MoE 角色动画变体。按照模型卡说明,每个去噪步骤约有 14B 参数处于激活状态,两个专家合计为 27B 参数。模型需要两项输入:一张角色图像和一段驱动/参考视频。根据所选模式,它可以让图中角色复现视频里的动作,也可以让该角色直接替换原视频中的演员。
官方权重采用 BF16 格式;而 ComfyUI 工作流使用的 FP8 量化版本,即 Wan2_2-Animate-14B_fp8 文件,则以 8 位精度保存权重,而非 16 位。这样能将权重显存占用减半,让消费级 GPU 也有机会运行该模型。
Move 和 Mix:同一模型的两种用法
Wan2.2 Animate 提供两种工作模式。ComfyUI 中分别称为Move和Mix,CLI 及官方文档则使用animation和replacement这两个名称。二者共用同一套处理流程,包括骨架提取、隐式面部特征提取,以及将角色图作为视觉参考;区别在于,究竟保留什么、替换什么。
Move 模式(animation):将驱动视频中的肢体动作和面部表情迁移到角色图上。角色图决定主体形象,视频则提供表演内容。静态肖像可以跳舞,概念角色也能复现视频中的编舞。身体动作由空间对齐的骨架信号驱动,源演员的表情则会被重定向到角色上。
Mix 模式(replacement):反过来处理:用角色图替换既有视频中的演员,同时保留原始场景。专用的Relighting LoRA会让插入角色适应源视频的光照与色调,避免合成效果像是生硬贴上去的。
| 对比项 | Move(动画) | Mix(替换) |
|---|---|---|
| 改变的内容 | 让静态图像动起来 | 替换视频中的演员 |
| 保留的内容 | 图像中的角色身份 | 视频的场景、光照和色彩 |
| 驱动输入 | 视频提供动作和表情 | 视频提供表演 |
| CLI 参数 | --retarget_flag --use_flux | --replace_flag --use_relighting_lora |
| 姿态重定向 | 建议开启,可应对身体比例差异 | 默认关闭,避免影响角色与环境的交互 |
| 适用场景 | 概念角色、虚拟形象动画 | 演员替换、品牌角色植入 |
系统与硬件要求
官方仓库位于 GitHub 的 Wan-Video/Wan2.2,要求 PyTorch ≥2.4.0。FlashAttention 能提升速度;如果第一次安装失败,可以最后再单独处理。官方没有公布固定的最低显存要求,因此对于消费级 GPU,更现实的路径是采用 FP8 权重配合模型卸载;下载前应先核对具体 ComfyUI 工作流中的显存说明。
模型卡中的效率测试以图表呈现,没有给出文字化的结论。单 GPU 运行依赖模型卸载和数据类型转换。社区测试只能作为部分参考:一位 r/comfyui 用户曾在 RTX 3070 上借助遮罩和局部重绘生成人物舞蹈动画;另一个相关变体则宣称支持 8 GB VRAM 编辑。但这些都不是完整 Animate-14B 流水线的测试结果。
本地运行 Wan2.2 Animate
本地部署有两条路线:官方 CLI 和 ComfyUI。无论选择哪一种,都需要先下载权重:
git clone https://github.com/Wan-Video/Wan2.2
huggingface-cli download Wan-AI/Wan2.2-Animate-14B --local-dir ./Wan2.2-Animate-14B
使用官方 CLI
CLI 路线需要先预处理驱动视频,提取骨架与面部关键点,再执行推理。不同模式对应不同的预处理参数,完整参数列表可查看模型卡的运行说明:
- 动画(Move):
--retarget_flag --use_flux - 替换(Mix):
--replace_flag --use_relighting_lora --iterations 3 --k 7 --w_len 1 --h_len 1
根据模型卡示例命令,单 GPU 运行应使用 --refert_num 1。模型卡还特别提醒:“不建议使用基于 Wan2.2 训练的 LoRA 模型。”第三方 LoRA 对权重的改动,可能导致动画流程出现不可预期的行为。
使用 ComfyUI
ComfyUI 原生工作流需要将以下模型文件放入对应目录:
| 文件 | 目录 | 用途 |
|---|---|---|
Wan2_2-Animate-14B_fp8_e4m3fn_scaled_KJ.safetensors | diffusion_models/ | Kijai FP8 主权重 |
umt5_xxl_fp8_e4m3fn_scaled.safetensors | text_encoders/ | UMT5 XXL 文本编码器(FP8) |
clip_vision_h.safetensors | clip_visions/ | CLIP Vision 编码器 |
wan_2.1_vae.safetensors | vae/ | Wan2.1 VAE |
lightx2v_I2V_14B_480p_cfg_step_distill_rank64_bf16.safetensors | loras/ | LightX2V 4 步加速 LoRA |
还需要两个自定义节点:ComfyUI-KJNodes和comfyui_controlnet_aux,后者提供用于骨架预处理的 DWPose Estimator。实际操作中有两点限制:输出宽度或高度必须能被 16 整除;对于超过基础生成长度的视频,每增加一个Video Extend节点,就会增加 77 帧,约 4.8 秒。启用 Mix 模式时保留所有连接;切换到 Move 模式,则需要断开输出子图节点中的 background_video 与 character_mask 连接。
各托管 API 的价格怎么计算
如果本地部署的门槛太高,也可以选择按量付费的 Wan2.2 Animate 托管服务。表面上看,各家的价格接近,但实际计费方式不同,最终账单可能相差不少:
| 服务商 | 480p | 720p | 计费方式 | 时长限制 |
|---|---|---|---|---|
| fal.ai | $0.04/s | $0.08/s | 帧数按16 fps归一化;高 FPS 源视频费用更高 | — |
| WaveSpeed | $0.20 / 5s | $0.40 / 5s | 按单次输出计费,以 5 秒为一档 | 5–120s |
| APIXO | $0.04/s | $0.08/s | 按检测到的参考视频秒数计费 | 最低 5s,上限 120s |
| Replicate | — | — | $3 per 1,000 inference-seconds(按计算时间,而非输出时长) | — |
WaveSpeed 按 5 秒分档后,实际费率与其他服务一致:480p 为 $0.04/s,720p 为 $0.08/s。因此,fal.ai、WaveSpeed 和 APIXO 的标价基本具备竞争力。真正需要注意的是计量标准:fal.ai 会把帧数归一化到 16 fps,因此 30 fps 驱动视频每秒实际花费会高于表面费率。Replicate 按 GPU 推理时间收费,而非输出视频时长:生成 10 秒视频如果消耗 40 秒计算时间,费用就是 $0.12。提交任务前也应确认各端点开放了哪些模式;上方 fal.ai 链接专门指向 Move/动画端点。
实际效果:哪些场景靠谱,哪些容易翻车
官方展示视频相当精致,但社区实测表明,首次本地运行的结果与演示效果之间仍可能存在差距:
“秘诀是什么?后期处理,还是插帧?” — u/Grand-Summer9946, r/comfyui
结合该讨论串及官方预处理指南,以下是较为明确的适用边界。
表现较好的情况:单人跳舞和动作迁移视频,尤其是角色在相对静态背景中运动的场景。源视频中人物正面清晰、表演明确时,面部表情复现的效果也较好。
容易出问题的情况:
- 多人场景。遮罩提取仅面向单人视频设计,常见问题是跟踪到了错误的姿态。
- 身体比例不一致。角色图与驱动视频的人物比例差异较大时,Mix 模式容易出现伪影和变形。
- FPS 不匹配。驱动视频与工作流配置的 FPS 不一致时,可能出现卡顿、慢动作或缩放伪影。
- 遮罩精度取舍。较粗的遮罩能保留更多背景,但可能造成轮廓泄漏;较细的遮罩会限制生成,又可能导致背景不一致。
原始输出足以用于预览和概念验证。若要达到制作级质量,可能还需叠加遮罩、局部重绘和插帧处理,前述社区讨论也提到了这些环节。
Wan2.2 Animate 与其他 Wan 模型的区别
Wan 模型家族更新很快,版本命名也容易让人混淆。根据模型卡,Wan2.2 Animate 在整个产品线中的位置如下:
| 模型 | 主要能力 | 与本文的关系 |
|---|---|---|
| Wan2.2-Animate-14B | 角色动画 + 演员替换(视频转视频) | 本文主题 |
| Wan-Animate-2 | 社区报道中的后继模型 | r/LocalLLaMA 中的讨论(2026) |
| Wan 2.7 Image Pro | 图像生成与编辑,不处理视频 | 不同模态:静态图像 |
| Wan 3 | 通用文生视频/图生视频 | 更新的通用视频模型,没有专门的角色动画模式 |
| Wan2.2-S2V-14B | 语音转视频,由音频驱动动画 | 用于音频驱动动作的配套模型 |
常见问题
Wan2.2 Animate 能同时处理多个角色吗?
不能。官方预处理指南中的遮罩提取面向单人视频,因此两种模式都只支持每次运行一个角色。多人输入可能导致失败,或跟踪到错误姿态。如需处理多个角色,应分别处理后再进行后期合成。
支持哪些分辨率?
工作流支持的分辨率为480p 和 720p;官方预处理示例使用 1280×720。官方没有说明高于 720p 的支持情况,因此更高分辨率需要作为独立步骤进行放大。
生成内容适用什么许可证?
模型代码和权重均采用Apache-2.0协议。Wan-AI 声明不对生成内容主张权利,但用户须对合法、无害地使用模型负责。模型卡禁止生成违法内容、针对弱势群体的内容,以及恶意使用个人数据的行为。
Wan2.2 Animate 能生成音频吗?
不能。Animate 只生成视频。若需要由语音驱动动画,例如根据语音进行口型同步,应使用独立的Wan2.2-S2V-14B模型。根据 Wan2.2 模型卡的更新日志,该模型于2025 年 9 月 5 日加入了 CosyVoice TTS 支持。
结论:静态图驱动动画选 Move,替换视频演员选 Mix。有 GPU 和 ComfyUI 使用经验就适合本地运行;追求省时可选托管 API,fal.ai、WaveSpeed 和 APIXO 的价格为 $0.04–0.08/s,但要把 fal.ai 的 16 fps 归一化计费,以及 Replicate 按计算时间收费的规则纳入预算。