想讓一張角色設定圖跳舞、表演,或直接把影片裡的演員換成自家角色,Wan2.2 Animate 就是為這類需求而生。這款由阿里巴巴推出的開源 14B 角色動畫模型,能以同一套框架完成兩件事:從驅動影片擷取動作,賦予靜態角色生命;或保留原始場景,將片中演員替換成指定角色。它在 2025 年 9 月 19 日以 Apache-2.0 授權釋出,可透過 ComfyUI 或官方 CLI 在本機執行。不過,成品是否自然,關鍵不只是按下生成鍵,而是 FPS、姿勢對齊與遮罩處理是否到位。
Wan2.2 Animate 是什麼?
Wan-AI 推出的 Wan2.2-Animate-14B,是以 Wan2.2 I2V-A14B 圖生影片模型為基礎打造的 MoE 角色動畫變體。依模型卡說明,每個去噪步驟約有 14B 參數會啟用,兩個專家模型合計則為 27B 參數。
它需要兩項輸入:一張角色圖片與一段驅動/參考影片。選擇不同模式後,模型可以讓圖片中的角色重現影片裡的動作,也可以用該角色取代原影片中的演員。
官方權重提供 BF16 版本;而 ComfyUI 工作流所使用的 FP8 量化版本,檔名為 Wan2_2-Animate-14B_fp8。FP8 將權重從 16 位元精度降為 8 位元,權重記憶體用量可減半,讓消費級 GPU 也有機會負擔。
Move 與 Mix:同一模型的兩種用途
Wan2.2 Animate 提供兩種運作模式。ComfyUI 稱為 Move 與 Mix,官方 CLI 和文件則分別稱作 animation 與 replacement。兩者都會使用骨架擷取、隱式臉部特徵擷取,以及角色圖片作為視覺參考;真正的差別在於哪些元素會被保留、哪些元素會被替換。
Move 模式(animation):將驅動影片中的肢體動作與臉部表情轉移到角色圖片上。圖片決定角色主體,影片提供演出內容。一張靜態肖像可以變成跳舞的虛擬角色,概念設計角色也能直接套用影片中的編舞。肢體動作由空間對齊的骨架訊號驅動,表情則從來源演員重新定向至角色臉部。
Mix 模式(replacement):方向正好相反:它會將既有影片中的演員換成角色圖片,同時保留原場景。專用的 Relighting LoRA 會讓插入的角色適應來源影片的光線與色調,避免看起來像硬貼上去的素材。
| 項目 | Move(動畫) | Mix(替換) |
|---|---|---|
| 改變的內容 | 讓靜態圖片動起來 | 替換影片中的演員 |
| 保留的內容 | 圖片中的角色身分 | 影片的場景、光線與色彩 |
| 驅動來源 | 影片中的動作與表情 | 影片中的表演內容 |
| CLI 參數 | --retarget_flag --use_flux | --replace_flag --use_relighting_lora |
| 姿勢重定向 | 建議啟用,可處理身材比例差異 | 預設關閉,以降低角色與環境互動出錯的風險 |
| 適用情境 | 概念角色、虛擬分身動畫 | 演員替換、品牌角色植入 |
系統需求與硬體條件
官方程式庫位於 GitHub 的 Wan-Video/Wan2.2,需要 PyTorch ≥2.4.0。FlashAttention 是提升速度所需的元件;若第一次安裝失敗,可以最後再處理它。官方沒有公布明確的最低 VRAM 門檻,因此若使用消費級 GPU,建議走 FP8 權重搭配模型卸載的路線,下載前也應確認目標 ComfyUI 工作流的記憶體說明。
模型卡中的效率測試以圖表呈現,沒有提供文字數據。單 GPU 執行時會用到模型卸載與資料型別轉換。社群則提供了一些不完整的實測參考:一位 r/comfyui 使用者透過遮罩與 inpainting,在 RTX 3070 上生成舞蹈動畫;另有一個相關變體宣稱可在 8 GB VRAM 下進行編輯。不過,這些並不是完整 Animate-14B 管線的測試結果。
本機執行 Wan2.2 Animate
本機部署可分為官方 CLI 與 ComfyUI 兩條路線。兩者都得先下載權重:
git clone https://github.com/Wan-Video/Wan2.2
huggingface-cli download Wan-AI/Wan2.2-Animate-14B --local-dir ./Wan2.2-Animate-14B
使用官方 CLI
流程會先預處理驅動影片,擷取骨架與臉部特徵點,再進行推論。不同模式會對應不同的預處理參數,完整參數列表可見模型卡的執行章節:
- 動畫(Move):
--retarget_flag --use_flux - 替換(Mix):
--replace_flag --use_relighting_lora --iterations 3 --k 7 --w_len 1 --h_len 1
依模型卡範例,單 GPU 執行時需使用 --refert_num 1。模型卡同時明確提醒:「不建議使用為 Wan2.2 訓練的 LoRA 模型。」第三方 LoRA 對權重造成的變動,可能導致動畫管線出現非預期行為。
透過 ComfyUI 執行
ComfyUI 原生工作流需要將下列模型檔案放入對應目錄:
| 檔案 | 目錄 | 用途 |
|---|---|---|
Wan2_2-Animate-14B_fp8_e4m3fn_scaled_KJ.safetensors | diffusion_models/ | Kijai FP8 主權重 |
umt5_xxl_fp8_e4m3fn_scaled.safetensors | text_encoders/ | UMT5 XXL 文字編碼器(FP8) |
clip_vision_h.safetensors | clip_visions/ | CLIP Vision 編碼器 |
wan_2.1_vae.safetensors | vae/ | Wan2.1 VAE |
lightx2v_I2V_14B_480p_cfg_step_distill_rank64_bf16.safetensors | loras/ | LightX2V 4 步加速 LoRA |
此外還需要兩個自訂節點:ComfyUI-KJNodes 與 comfyui_controlnet_aux;後者提供用於骨架預處理的 DWPose Estimator。實作上有兩項限制:輸出寬度或高度必須可被 16 整除;若影片長度超過基礎生成範圍,每增加一個 Video Extend 節點,就會增加 77 幀,約 4.8 秒。啟用 Mix 模式時保留所有連線;若要使用 Move 模式,則要從輸出子圖節點中斷開 background_video 與 character_mask。
託管 API 方案與價格比較
如果本機部署的門檻太高,現在也有多家服務商託管 Wan2.2 Animate,按使用量計費。表面上的單價相近,但實際帳單會受到各家計費方式影響:
| 服務商 | 480p | 720p | 計費方式 | 片長限制 |
|---|---|---|---|---|
| fal.ai | $0.04/秒 | $0.08/秒 | 影格數統一換算為16 fps;高 FPS 來源影片費用較高 | — |
| WaveSpeed | $0.20/5 秒 | $0.40/5 秒 | 每次輸出計費,按 5 秒級距計算 | 5–120 秒 |
| APIXO | $0.04/秒 | $0.08/秒 | 按偵測到的參考影片秒數計費 | 最低 5 秒,上限 120 秒 |
| Replicate | — | — | 每 1,000 推論秒 $3,依運算時間而非輸出長度計費 | — |
WaveSpeed 以 5 秒為一級距,換算後的有效費率與其他服務相同:480p 為 $0.04/秒、720p 為 $0.08/秒。因此,fal.ai、WaveSpeed 與 APIXO 的表面價格具競爭力;真正要留意的是計量單位。fal.ai 會將影格數換算為 16 fps,所以 30 fps 驅動影片的每實際秒成本,會高於表面費率所暗示的價格。Replicate 則依 GPU 推論時間計費,而不是輸出影片時長:若生成 10 秒影片需要 40 秒運算,費用就是 $0.12。正式採用前,應先確認各端點提供哪些模式;上述 fal.ai URL 對應的是 Move/動畫端點。
實際效果:哪些情境穩定、哪些容易翻車?
官方展示影片的完成度很高,但社群實作經驗顯示,第一次在本機跑出的效果,往往與展示成果有一段落差:
「祕訣是什麼?後製處理,還是影格插補?」— u/Grand-Summer9946, r/comfyui
綜合該討論串與官方預處理指南,以下是較可靠與較容易出問題的情況。
表現較好的情境:單人跳舞或動作轉移影片,尤其是單一角色搭配相對靜態背景。當來源影片的人臉清晰、正面表演時,臉部表情重演的效果也相當不錯。
常見問題:
- 多人場景。遮罩擷取僅針對單人影片設計,因此很容易追蹤到錯誤的姿勢。
- 身材比例不一致。角色圖片與驅動影片中的人物比例差異過大時,Mix 模式可能出現瑕疵與變形。
- FPS 不匹配。驅動影片 FPS 與工作流設定不一致時,容易出現卡頓、慢動作或縮放異常。
- 遮罩精細度。較粗的遮罩能保留更多背景,但可能發生形狀外溢;較細的遮罩會限制生成空間,增加背景不一致的風險。
原始輸出適合用於預覽與概念測試。若目標是製作品質,可能還得如前述社群討論般,加入遮罩、inpainting 與影格插補等後續處理。
Wan2.2 Animate 與其他 Wan 模型的差異
Wan 模型家族迭代很快,版本命名也容易讓人混淆。依模型卡資訊,Wan2.2 Animate 在產品線中的位置如下:
| 模型 | 功能 | 與本文的關係 |
|---|---|---|
| Wan2.2-Animate-14B | 角色動畫與演員替換(影片轉影片) | 本文主角 |
| Wan-Animate-2 | 社群提及的後繼模型 | r/LocalLLaMA 討論串(2026) |
| Wan 2.7 Image Pro | 圖片生成與編輯,不支援影片 | 不同模態:靜態圖片 |
| Wan 3 | 通用文字轉影片/圖片轉影片 | 較新的通用影片模型,沒有專屬角色動畫模式 |
| Wan2.2-S2V-14B | 語音轉影片,以音訊驅動動畫 | 用於音訊驅動動作的配套模型 |
常見問題
Wan2.2 Animate 能同時處理多個角色嗎?
不能。官方預處理指南中的遮罩擷取是為單人影片設計,因此兩種模式都只支援每次處理一名角色。多人輸入可能失敗,也可能追蹤到錯誤姿勢。若需要處理多名角色,應分別生成後再於後製階段合成。
支援哪些解析度?
工作流支援的解析度為480p 與 720p;官方預處理範例使用 1280×720。目前沒有超過 720p 的官方文件,因此更高解析度需要另外進行放大處理。
生成內容適用什麼授權?
模型程式碼與權重均採用Apache-2.0授權。Wan-AI 表示不主張生成內容的權利,但使用者必須自行確保用途合法且不具傷害性。模型卡禁止生成違法內容、針對弱勢族群的內容,以及惡意使用個人資料的行為。
Wan2.2 Animate 能生成音訊嗎?
不能。Animate 只產生影片。若需要由語音驅動動畫,例如以語音進行唇形同步,應使用另一款 Wan2.2-S2V-14B 模型。根據 Wan2.2 模型卡更新紀錄,該模型在2025 年 9 月 5 日加入 CosyVoice TTS 支援。
結論:要讓靜態角色動起來就選 Move;要替換影片演員則用 Mix。有 GPU 與 ComfyUI 操作經驗的使用者可在本機執行;若以便利與速度為優先,可選擇託管 API。fal.ai、WaveSpeed、APIXO 的價格為 $0.04–0.08/秒,但要將 fal.ai 的 16 fps 正規化計費,以及 Replicate 依運算時間計費的方式納入預算。