AIREITER

Wan2.2 Animate 详解:模式、规格、API 价格与部署方法

最后更新: 2026-08-14 01:25:15

只需一张角色图和一段驱动视频,Wan2.2 Animate 就能让静态人物动起来,也能直接把现有视频中的演员替换成你的角色,同时尽量保留原场景。它是阿里巴巴推出的开源 14B 角色动画模型,于 2025 年 9 月 19 日以 Apache-2.0 协议发布,可通过 ComfyUI 或官方 CLI 在本地运行。不过,最终成片是否干净,关键不只是点击生成:FPS 匹配、姿态对齐和遮罩质量都会直接影响结果。

Wan2.2 Animate 到底是什么?

Wan-AI 的 Wan2.2-Animate-14B,是基于 Wan2.2 I2V-A14B 图生视频模型打造的 MoE 角色动画变体。按照模型卡说明,每个去噪步骤约有 14B 参数处于激活状态,两个专家合计为 27B 参数。模型需要两项输入:一张角色图像和一段驱动/参考视频。根据所选模式,它可以让图中角色复现视频里的动作,也可以让该角色直接替换原视频中的演员。

官方权重采用 BF16 格式;而 ComfyUI 工作流使用的 FP8 量化版本,即 Wan2_2-Animate-14B_fp8 文件,则以 8 位精度保存权重,而非 16 位。这样能将权重显存占用减半,让消费级 GPU 也有机会运行该模型。

Move 和 Mix:同一模型的两种用法

Wan2.2 Animate 提供两种工作模式。ComfyUI 中分别称为Move和Mix,CLI 及官方文档则使用animation和replacement这两个名称。二者共用同一套处理流程,包括骨架提取、隐式面部特征提取,以及将角色图作为视觉参考;区别在于,究竟保留什么、替换什么。

Move 模式(animation):将驱动视频中的肢体动作和面部表情迁移到角色图上。角色图决定主体形象,视频则提供表演内容。静态肖像可以跳舞,概念角色也能复现视频中的编舞。身体动作由空间对齐的骨架信号驱动,源演员的表情则会被重定向到角色上。

Mix 模式(replacement):反过来处理:用角色图替换既有视频中的演员,同时保留原始场景。专用的Relighting LoRA会让插入角色适应源视频的光照与色调,避免合成效果像是生硬贴上去的。

对比项Move(动画)Mix(替换)
改变的内容让静态图像动起来替换视频中的演员
保留的内容图像中的角色身份视频的场景、光照和色彩
驱动输入视频提供动作和表情视频提供表演
CLI 参数--retarget_flag --use_flux--replace_flag --use_relighting_lora
姿态重定向建议开启,可应对身体比例差异默认关闭,避免影响角色与环境的交互
适用场景概念角色、虚拟形象动画演员替换、品牌角色植入

系统与硬件要求

官方仓库位于 GitHub 的 Wan-Video/Wan2.2,要求 PyTorch ≥2.4.0。FlashAttention 能提升速度;如果第一次安装失败,可以最后再单独处理。官方没有公布固定的最低显存要求,因此对于消费级 GPU,更现实的路径是采用 FP8 权重配合模型卸载;下载前应先核对具体 ComfyUI 工作流中的显存说明。

模型卡中的效率测试以图表呈现,没有给出文字化的结论。单 GPU 运行依赖模型卸载和数据类型转换。社区测试只能作为部分参考:一位 r/comfyui 用户曾在 RTX 3070 上借助遮罩和局部重绘生成人物舞蹈动画;另一个相关变体则宣称支持 8 GB VRAM 编辑。但这些都不是完整 Animate-14B 流水线的测试结果。

本地运行 Wan2.2 Animate

本地部署有两条路线:官方 CLI 和 ComfyUI。无论选择哪一种,都需要先下载权重:

git clone https://github.com/Wan-Video/Wan2.2
huggingface-cli download Wan-AI/Wan2.2-Animate-14B --local-dir ./Wan2.2-Animate-14B

使用官方 CLI

CLI 路线需要先预处理驱动视频,提取骨架与面部关键点,再执行推理。不同模式对应不同的预处理参数,完整参数列表可查看模型卡的运行说明:

  • 动画(Move):--retarget_flag --use_flux
  • 替换(Mix):--replace_flag --use_relighting_lora --iterations 3 --k 7 --w_len 1 --h_len 1

根据模型卡示例命令,单 GPU 运行应使用 --refert_num 1。模型卡还特别提醒:“不建议使用基于 Wan2.2 训练的 LoRA 模型。”第三方 LoRA 对权重的改动,可能导致动画流程出现不可预期的行为。

使用 ComfyUI

ComfyUI 原生工作流需要将以下模型文件放入对应目录:

文件目录用途
Wan2_2-Animate-14B_fp8_e4m3fn_scaled_KJ.safetensorsdiffusion_models/Kijai FP8 主权重
umt5_xxl_fp8_e4m3fn_scaled.safetensorstext_encoders/UMT5 XXL 文本编码器(FP8)
clip_vision_h.safetensorsclip_visions/CLIP Vision 编码器
wan_2.1_vae.safetensorsvae/Wan2.1 VAE
lightx2v_I2V_14B_480p_cfg_step_distill_rank64_bf16.safetensorsloras/LightX2V 4 步加速 LoRA

还需要两个自定义节点:ComfyUI-KJNodes和comfyui_controlnet_aux,后者提供用于骨架预处理的 DWPose Estimator。实际操作中有两点限制:输出宽度或高度必须能被 16 整除;对于超过基础生成长度的视频,每增加一个Video Extend节点,就会增加 77 帧,约 4.8 秒。启用 Mix 模式时保留所有连接;切换到 Move 模式,则需要断开输出子图节点中的 background_video 与 character_mask 连接。

各托管 API 的价格怎么计算

如果本地部署的门槛太高,也可以选择按量付费的 Wan2.2 Animate 托管服务。表面上看,各家的价格接近,但实际计费方式不同,最终账单可能相差不少:

服务商480p720p计费方式时长限制
fal.ai$0.04/s$0.08/s帧数按16 fps归一化;高 FPS 源视频费用更高—
WaveSpeed$0.20 / 5s$0.40 / 5s按单次输出计费,以 5 秒为一档5–120s
APIXO$0.04/s$0.08/s按检测到的参考视频秒数计费最低 5s,上限 120s
Replicate——$3 per 1,000 inference-seconds(按计算时间,而非输出时长)—

WaveSpeed 按 5 秒分档后,实际费率与其他服务一致:480p 为 $0.04/s,720p 为 $0.08/s。因此,fal.ai、WaveSpeed 和 APIXO 的标价基本具备竞争力。真正需要注意的是计量标准:fal.ai 会把帧数归一化到 16 fps,因此 30 fps 驱动视频每秒实际花费会高于表面费率。Replicate 按 GPU 推理时间收费,而非输出视频时长:生成 10 秒视频如果消耗 40 秒计算时间,费用就是 $0.12。提交任务前也应确认各端点开放了哪些模式;上方 fal.ai 链接专门指向 Move/动画端点。

实际效果:哪些场景靠谱,哪些容易翻车

官方展示视频相当精致,但社区实测表明,首次本地运行的结果与演示效果之间仍可能存在差距:

“秘诀是什么?后期处理,还是插帧?” — u/Grand-Summer9946, r/comfyui

结合该讨论串及官方预处理指南,以下是较为明确的适用边界。

表现较好的情况:单人跳舞和动作迁移视频,尤其是角色在相对静态背景中运动的场景。源视频中人物正面清晰、表演明确时,面部表情复现的效果也较好。

容易出问题的情况:

  • 多人场景。遮罩提取仅面向单人视频设计,常见问题是跟踪到了错误的姿态。
  • 身体比例不一致。角色图与驱动视频的人物比例差异较大时,Mix 模式容易出现伪影和变形。
  • FPS 不匹配。驱动视频与工作流配置的 FPS 不一致时,可能出现卡顿、慢动作或缩放伪影。
  • 遮罩精度取舍。较粗的遮罩能保留更多背景,但可能造成轮廓泄漏;较细的遮罩会限制生成,又可能导致背景不一致。

原始输出足以用于预览和概念验证。若要达到制作级质量,可能还需叠加遮罩、局部重绘和插帧处理,前述社区讨论也提到了这些环节。

Wan2.2 Animate 与其他 Wan 模型的区别

Wan 模型家族更新很快,版本命名也容易让人混淆。根据模型卡,Wan2.2 Animate 在整个产品线中的位置如下:

模型主要能力与本文的关系
Wan2.2-Animate-14B角色动画 + 演员替换(视频转视频)本文主题
Wan-Animate-2社区报道中的后继模型r/LocalLLaMA 中的讨论(2026)
Wan 2.7 Image Pro图像生成与编辑,不处理视频不同模态:静态图像
Wan 3通用文生视频/图生视频更新的通用视频模型,没有专门的角色动画模式
Wan2.2-S2V-14B语音转视频,由音频驱动动画用于音频驱动动作的配套模型

常见问题

Wan2.2 Animate 能同时处理多个角色吗?

不能。官方预处理指南中的遮罩提取面向单人视频,因此两种模式都只支持每次运行一个角色。多人输入可能导致失败,或跟踪到错误姿态。如需处理多个角色,应分别处理后再进行后期合成。

支持哪些分辨率?

工作流支持的分辨率为480p 和 720p;官方预处理示例使用 1280×720。官方没有说明高于 720p 的支持情况,因此更高分辨率需要作为独立步骤进行放大。

生成内容适用什么许可证?

模型代码和权重均采用Apache-2.0协议。Wan-AI 声明不对生成内容主张权利,但用户须对合法、无害地使用模型负责。模型卡禁止生成违法内容、针对弱势群体的内容,以及恶意使用个人数据的行为。

Wan2.2 Animate 能生成音频吗?

不能。Animate 只生成视频。若需要由语音驱动动画,例如根据语音进行口型同步,应使用独立的Wan2.2-S2V-14B模型。根据 Wan2.2 模型卡的更新日志,该模型于2025 年 9 月 5 日加入了 CosyVoice TTS 支持。


结论:静态图驱动动画选 Move,替换视频演员选 Mix。有 GPU 和 ComfyUI 使用经验就适合本地运行;追求省时可选托管 API,fal.ai、WaveSpeed 和 APIXO 的价格为 $0.04–0.08/s,但要把 fal.ai 的 16 fps 归一化计费,以及 Replicate 按计算时间收费的规则纳入预算。