Wan2.2 Animate — открытая 14B-модель Alibaba для задач, которые обычно требуют разных инструментов: она оживляет персонажа по референсному видео или заменяет актёра в готовом ролике, сохраняя исходную сцену. Модель вышла 19 сентября 2025 года под лицензией Apache-2.0 и запускается локально через ComfyUI либо официальный CLI. Однако результат определяется не одной кнопкой Generate: важны совпадение FPS, корректное выравнивание позы и качество масок.
Что умеет Wan2.2 Animate
Wan2.2-Animate-14B — MoE-вариант модели Wan-AI для анимации персонажей, построенный на image-to-video-модели Wan2.2 I2V-A14B. Согласно model card, на каждом шаге денойзинга активно примерно 14B параметров, хотя суммарно у двух экспертов их 27B. На вход подаются два файла: изображение персонажа и ведущее/референсное видео. Выбранный режим определяет результат: персонаж повторяет движения из ролика либо заменяет в нём исходного актёра.
Официальные веса поставляются в BF16. FP8-квантованная версия — файл Wan2_2-Animate-14B_fp8, используемый в воркфлоу ComfyUI, — хранит веса с 8-битной, а не 16-битной точностью. Это вдвое сокращает память, занятую весами, и позволяет запускать модель на потребительских GPU.
Move и Mix: анимация или замена актёра
У Wan2.2 Animate есть два режима работы. В ComfyUI они называются Move и Mix, а в CLI и официальной документации — animation и replacement. Основа у них общая: извлечение скелета, неявное выделение черт лица и изображение персонажа как визуальный референс. Но сохраняют и заменяют они разные части материала.
Move (animation). Этот режим переносит движения тела и мимику из ведущего видео на изображение персонажа. Картинка задаёт героя, ролик — его игру. Так статичный портрет превращается в танцующий аватар, а концепт-арт наследует хореографию клипа. Движения тела передаются через пространственно выровненные сигналы скелета, а мимика ретаргетируется с исходного актёра.
Mix (replacement). Здесь, наоборот, персонаж с изображения подменяет актёра в существующем видео, а сцена остаётся прежней. Специальная Relighting LoRA подстраивает добавленного героя под освещение и цветовой тон исходного ролика, чтобы он не выглядел вклеенным поверх кадра.
| Параметр | Move (анимация) | Mix (замена) |
|---|---|---|
| Что меняется | Статичное изображение оживает | Актёр в видео заменяется |
| Что сохраняется | Идентичность персонажа с изображения | Сцена, освещение и цвет из видео |
| Источник движения | Движения и мимика из видео | Исполнение из видео |
| Флаг CLI | --retarget_flag --use_flux | --replace_flag --use_relighting_lora |
| Ретаргетинг позы | Рекомендован: компенсирует разницу в пропорциях тела | По умолчанию отключён: есть риск ошибок во взаимодействии персонажа с окружением |
| Лучшее применение | Анимация концепт-персонажей и аватаров | Замена актёра и брендированная интеграция |
Требования к системе и GPU
Официальный репозиторий — Wan-Video/Wan2.2 на GitHub; для него нужен PyTorch ≥2.4.0. FlashAttention необходим для скорости, но если пакет не ставится с первого раза, его можно установить позже. Разработчики не публикуют фиксированный минимум видеопамяти, поэтому для пользовательских GPU стоит ориентироваться на FP8-версию с выгрузкой модели из памяти и до скачивания свериться с примечаниями о памяти в конкретном воркфлоу ComfyUI.
Данные об эффективности в model card приведены в графиках, а не текстом. Запуски на одной GPU используют выгрузку модели и преобразование dtype. В сообществе есть лишь частичные ориентиры: один пользователь r/comfyui получил танцевальную анимацию на RTX 3070 с масками и инпейтингом, а связанный вариант заявляет редактирование при 8 GB VRAM. Это не замеры полного пайплайна Animate-14B, а частичные конфигурации.
Как запустить Wan2.2 Animate локально
Локально доступны два пути: официальный CLI и ComfyUI. В обоих случаях сначала нужно скачать веса:
git clone https://github.com/Wan-Video/Wan2.2
huggingface-cli download Wan-AI/Wan2.2-Animate-14B --local-dir ./Wan2.2-Animate-14B
Запуск через CLI
Сначала ведущее видео обрабатывается для извлечения скелета и лицевых ориентиров, после чего запускается инференс. Набор флагов препроцессинга зависит от режима; полные списки аргументов есть в разделе запуска model card:
- Анимация (Move):
--retarget_flag --use_flux - Замена (Mix):
--replace_flag --use_relighting_lora --iterations 3 --k 7 --w_len 1 --h_len 1
Для запуска на одной GPU в примерах из model card используется --refert_num 1. Там же есть предупреждение: «Мы не рекомендуем использовать LoRA-модели, обученные на Wan2.2». Изменение весов сторонними LoRA может привести к непредсказуемому поведению анимационного пайплайна.
Запуск через ComfyUI
Для нативного воркфлоу ComfyUI понадобятся следующие файлы, разложенные по соответствующим каталогам:
| Файл | Каталог | Назначение |
|---|---|---|
Wan2_2-Animate-14B_fp8_e4m3fn_scaled_KJ.safetensors | diffusion_models/ | Основные FP8-веса Kijai |
umt5_xxl_fp8_e4m3fn_scaled.safetensors | text_encoders/ | Текстовый энкодер UMT5 XXL (FP8) |
clip_vision_h.safetensors | clip_visions/ | Энкодер CLIP Vision |
wan_2.1_vae.safetensors | vae/ | Wan2.1 VAE |
lightx2v_I2V_14B_480p_cfg_step_distill_rank64_bf16.safetensors | loras/ | LoRA LightX2V для ускорения до 4 шагов |
Также нужны две кастомные ноды: ComfyUI-KJNodes и comfyui_controlnet_aux, которая предоставляет DWPose Estimator для подготовки скелета. Есть два практических ограничения: ширина либо высота результата должна делиться на 16, а каждая нода Video Extend добавляет 77 кадров, то есть примерно 4,8 секунды, если ролик длиннее базовой генерации. Для Mix сохраняются все соединения; для Move у выходной ноды подграфа нужно отключить background_video и character_mask.
Цены облачных API
Если локальная установка слишком требовательна, Wan2.2 Animate можно использовать у нескольких провайдеров с оплатой по факту использования. На первый взгляд ставки похожи, но способы биллинга заметно влияют на итоговую сумму:
| Провайдер | 480p | 720p | Модель биллинга | Ограничения по длительности |
|---|---|---|---|---|
| fal.ai | $0.04/с | $0.08/с | Кадры нормализуются к 16 fps; исходник с высоким FPS стоит дороже | — |
| WaveSpeed | $0.20 / 5 с | $0.40 / 5 с | За один запуск, ступенями по 5 секунд | 5–120 с |
| APIXO | $0.04/с | $0.08/с | За каждую обнаруженную секунду референсного видео | Минимум 5 с, максимум 120 с |
| Replicate | — | — | $3 за 1 000 секунд инференса — это вычислительное, а не выходное время | — |
Блоки WaveSpeed по 5 секунд в итоге дают ту же эффективную ставку: $0.04/с для 480p и $0.08/с для 720p. Поэтому по заявленной цене fal.ai, WaveSpeed и APIXO сопоставимы. Разница — в том, что именно измеряется. fal.ai нормализует число кадров до 16 fps, так что ведущее видео с 30 fps обойдётся дороже за секунду реального хронометража, чем можно предположить по тарифу. Replicate тарифицирует время GPU-инференса, а не длительность ролика: 10-секундный результат, на вычисление которого ушло 40 секунд, стоит $0.12. Перед выбором проверьте, какие режимы доступны у нужного endpoint: приведённая выше ссылка fal.ai ведёт именно на endpoint Move/animation.
Что получается на практике, а где начинаются проблемы
Демонстрации модели выглядят аккуратно, но опыт сообщества показывает разницу между витринным результатом и первой локальной генерацией:
«В чём секрет: постобработка, интерполяция кадров?» — u/Grand-Summer9946, r/comfyui
По этому обсуждению и официальному руководству по препроцессингу можно выделить рабочие сценарии и типичные сбои.
Что работает хорошо: ролики с танцем и переносом движений для одного человека на относительно статичном фоне. Повторение мимики особенно удаётся, когда в исходном видео лицо хорошо видно и оно обращено к камере.
Что ломается:
- Сцены с несколькими людьми. Извлечение маски рассчитано только на видео с одним человеком, поэтому система нередко отслеживает не ту позу.
- Несовпадение пропорций тела. Разница между персонажем на изображении и человеком в ведущем ролике даёт артефакты и деформации в режиме Mix.
- Несовпадение FPS. Если FPS ведущего видео не совпадает с настройками воркфлоу, возможны рывки, замедление или артефакты масштабирования.
- Детализация маски. Грубая маска оставляет больше фона, но может пропускать контуры объекта; слишком точная сильнее ограничивает генерацию и создаёт риск несогласованности фона.
Сырой результат подходит для превью и проверки концепта. Для продакшен-качества могут потребоваться маски, инпейтинг и интерполяция кадров поверх базовой генерации — именно это обсуждается в приведённой ветке сообщества.
Чем Wan2.2 Animate отличается от других моделей Wan
Семейство Wan развивается быстро, и в названиях версий легко запутаться. Согласно model card, место Wan2.2 Animate в линейке выглядит так:
| Модель | Что делает | Связь с этой статьёй |
|---|---|---|
| Wan2.2-Animate-14B | Анимация персонажа и замена актёра (video-to-video) | Главная тема статьи |
| Wan-Animate-2 | Модель-преемник, о которой сообщает сообщество | Обсуждается на r/LocalLLaMA (2026) |
| Wan 2.7 Image Pro | Генерация и редактирование изображений, не видео | Другая модальность: статичные картинки |
| Wan 3 | Универсальная text-to-video / image-to-video модель | Более новая универсальная видеомодель без отдельного режима анимации персонажей |
| Wan2.2-S2V-14B | Speech-to-video, анимация от аудио | Сопутствующая модель для движений, управляемых звуком |
FAQ
Wan2.2 Animate умеет работать сразу с несколькими персонажами?
Нет. В официальном руководстве по препроцессингу извлечение маски рассчитано на ролики с одним человеком, поэтому оба режима поддерживают одного персонажа за запуск. Видео с несколькими людьми может обработаться с ошибкой или привести к отслеживанию неверной позы. Для нескольких персонажей нужно обработать каждого отдельно и собрать сцену на постпродакшене.
Какие разрешения поддерживаются?
В воркфлоу поддерживаются разрешения 480p и 720p; в официальных примерах препроцессинга используется 1280×720. Разрешения выше 720p не документированы, поэтому апскейл нужно выполнять отдельным шагом.
Какая лицензия распространяется на результат?
Код и веса модели выпускаются под Apache-2.0. Wan-AI не заявляет прав на сгенерированный контент, однако ответственность за законное и безопасное использование возлагает на пользователя. Model card запрещает генерировать незаконный контент, нацеливаться на уязвимые группы населения и злонамеренно использовать персональные данные.
Wan2.2 Animate генерирует аудио?
Нет. Animate создаёт только видео. Для анимации, управляемой звуком, включая липсинк по речи, предназначена отдельная модель Wan2.2-S2V-14B. Как указано в журнале обновлений Wan2.2 model card, 5 сентября 2025 года в неё добавили поддержку CosyVoice TTS.
Итог: для анимации статичных изображений выбирайте Move, для замены актёра — Mix. Локальный запуск разумен, если у вас есть GPU и опыт работы с ComfyUI; для быстрого старта подойдут облачные API — fal.ai, WaveSpeed и APIXO за $0.04–0.08/с. Но учитывайте нормализацию к 16 fps у fal.ai и биллинг по вычислительному времени у Replicate.