AIREITER

Wan2.2 Animate: режимы, требования, API-тарифы и запуск

Последнее обновление: 2026-08-14 01:26:50

Wan2.2 Animate — открытая 14B-модель Alibaba для задач, которые обычно требуют разных инструментов: она оживляет персонажа по референсному видео или заменяет актёра в готовом ролике, сохраняя исходную сцену. Модель вышла 19 сентября 2025 года под лицензией Apache-2.0 и запускается локально через ComfyUI либо официальный CLI. Однако результат определяется не одной кнопкой Generate: важны совпадение FPS, корректное выравнивание позы и качество масок.

Что умеет Wan2.2 Animate

Wan2.2-Animate-14B — MoE-вариант модели Wan-AI для анимации персонажей, построенный на image-to-video-модели Wan2.2 I2V-A14B. Согласно model card, на каждом шаге денойзинга активно примерно 14B параметров, хотя суммарно у двух экспертов их 27B. На вход подаются два файла: изображение персонажа и ведущее/референсное видео. Выбранный режим определяет результат: персонаж повторяет движения из ролика либо заменяет в нём исходного актёра.

Официальные веса поставляются в BF16. FP8-квантованная версия — файл Wan2_2-Animate-14B_fp8, используемый в воркфлоу ComfyUI, — хранит веса с 8-битной, а не 16-битной точностью. Это вдвое сокращает память, занятую весами, и позволяет запускать модель на потребительских GPU.

Move и Mix: анимация или замена актёра

У Wan2.2 Animate есть два режима работы. В ComfyUI они называются Move и Mix, а в CLI и официальной документации — animation и replacement. Основа у них общая: извлечение скелета, неявное выделение черт лица и изображение персонажа как визуальный референс. Но сохраняют и заменяют они разные части материала.

Move (animation). Этот режим переносит движения тела и мимику из ведущего видео на изображение персонажа. Картинка задаёт героя, ролик — его игру. Так статичный портрет превращается в танцующий аватар, а концепт-арт наследует хореографию клипа. Движения тела передаются через пространственно выровненные сигналы скелета, а мимика ретаргетируется с исходного актёра.

Mix (replacement). Здесь, наоборот, персонаж с изображения подменяет актёра в существующем видео, а сцена остаётся прежней. Специальная Relighting LoRA подстраивает добавленного героя под освещение и цветовой тон исходного ролика, чтобы он не выглядел вклеенным поверх кадра.

ПараметрMove (анимация)Mix (замена)
Что меняетсяСтатичное изображение оживаетАктёр в видео заменяется
Что сохраняетсяИдентичность персонажа с изображенияСцена, освещение и цвет из видео
Источник движенияДвижения и мимика из видеоИсполнение из видео
Флаг CLI--retarget_flag --use_flux--replace_flag --use_relighting_lora
Ретаргетинг позыРекомендован: компенсирует разницу в пропорциях телаПо умолчанию отключён: есть риск ошибок во взаимодействии персонажа с окружением
Лучшее применениеАнимация концепт-персонажей и аватаровЗамена актёра и брендированная интеграция

Требования к системе и GPU

Официальный репозиторий — Wan-Video/Wan2.2 на GitHub; для него нужен PyTorch ≥2.4.0. FlashAttention необходим для скорости, но если пакет не ставится с первого раза, его можно установить позже. Разработчики не публикуют фиксированный минимум видеопамяти, поэтому для пользовательских GPU стоит ориентироваться на FP8-версию с выгрузкой модели из памяти и до скачивания свериться с примечаниями о памяти в конкретном воркфлоу ComfyUI.

Данные об эффективности в model card приведены в графиках, а не текстом. Запуски на одной GPU используют выгрузку модели и преобразование dtype. В сообществе есть лишь частичные ориентиры: один пользователь r/comfyui получил танцевальную анимацию на RTX 3070 с масками и инпейтингом, а связанный вариант заявляет редактирование при 8 GB VRAM. Это не замеры полного пайплайна Animate-14B, а частичные конфигурации.

Как запустить Wan2.2 Animate локально

Локально доступны два пути: официальный CLI и ComfyUI. В обоих случаях сначала нужно скачать веса:

git clone https://github.com/Wan-Video/Wan2.2
huggingface-cli download Wan-AI/Wan2.2-Animate-14B --local-dir ./Wan2.2-Animate-14B

Запуск через CLI

Сначала ведущее видео обрабатывается для извлечения скелета и лицевых ориентиров, после чего запускается инференс. Набор флагов препроцессинга зависит от режима; полные списки аргументов есть в разделе запуска model card:

  • Анимация (Move): --retarget_flag --use_flux
  • Замена (Mix): --replace_flag --use_relighting_lora --iterations 3 --k 7 --w_len 1 --h_len 1

Для запуска на одной GPU в примерах из model card используется --refert_num 1. Там же есть предупреждение: «Мы не рекомендуем использовать LoRA-модели, обученные на Wan2.2». Изменение весов сторонними LoRA может привести к непредсказуемому поведению анимационного пайплайна.

Запуск через ComfyUI

Для нативного воркфлоу ComfyUI понадобятся следующие файлы, разложенные по соответствующим каталогам:

ФайлКаталогНазначение
Wan2_2-Animate-14B_fp8_e4m3fn_scaled_KJ.safetensorsdiffusion_models/Основные FP8-веса Kijai
umt5_xxl_fp8_e4m3fn_scaled.safetensorstext_encoders/Текстовый энкодер UMT5 XXL (FP8)
clip_vision_h.safetensorsclip_visions/Энкодер CLIP Vision
wan_2.1_vae.safetensorsvae/Wan2.1 VAE
lightx2v_I2V_14B_480p_cfg_step_distill_rank64_bf16.safetensorsloras/LoRA LightX2V для ускорения до 4 шагов

Также нужны две кастомные ноды: ComfyUI-KJNodes и comfyui_controlnet_aux, которая предоставляет DWPose Estimator для подготовки скелета. Есть два практических ограничения: ширина либо высота результата должна делиться на 16, а каждая нода Video Extend добавляет 77 кадров, то есть примерно 4,8 секунды, если ролик длиннее базовой генерации. Для Mix сохраняются все соединения; для Move у выходной ноды подграфа нужно отключить background_video и character_mask.

Цены облачных API

Если локальная установка слишком требовательна, Wan2.2 Animate можно использовать у нескольких провайдеров с оплатой по факту использования. На первый взгляд ставки похожи, но способы биллинга заметно влияют на итоговую сумму:

Провайдер480p720pМодель биллингаОграничения по длительности
fal.ai$0.04/с$0.08/сКадры нормализуются к 16 fps; исходник с высоким FPS стоит дороже—
WaveSpeed$0.20 / 5 с$0.40 / 5 сЗа один запуск, ступенями по 5 секунд5–120 с
APIXO$0.04/с$0.08/сЗа каждую обнаруженную секунду референсного видеоМинимум 5 с, максимум 120 с
Replicate——$3 за 1 000 секунд инференса — это вычислительное, а не выходное время—

Блоки WaveSpeed по 5 секунд в итоге дают ту же эффективную ставку: $0.04/с для 480p и $0.08/с для 720p. Поэтому по заявленной цене fal.ai, WaveSpeed и APIXO сопоставимы. Разница — в том, что именно измеряется. fal.ai нормализует число кадров до 16 fps, так что ведущее видео с 30 fps обойдётся дороже за секунду реального хронометража, чем можно предположить по тарифу. Replicate тарифицирует время GPU-инференса, а не длительность ролика: 10-секундный результат, на вычисление которого ушло 40 секунд, стоит $0.12. Перед выбором проверьте, какие режимы доступны у нужного endpoint: приведённая выше ссылка fal.ai ведёт именно на endpoint Move/animation.

Что получается на практике, а где начинаются проблемы

Демонстрации модели выглядят аккуратно, но опыт сообщества показывает разницу между витринным результатом и первой локальной генерацией:

«В чём секрет: постобработка, интерполяция кадров?» — u/Grand-Summer9946, r/comfyui

По этому обсуждению и официальному руководству по препроцессингу можно выделить рабочие сценарии и типичные сбои.

Что работает хорошо: ролики с танцем и переносом движений для одного человека на относительно статичном фоне. Повторение мимики особенно удаётся, когда в исходном видео лицо хорошо видно и оно обращено к камере.

Что ломается:

  • Сцены с несколькими людьми. Извлечение маски рассчитано только на видео с одним человеком, поэтому система нередко отслеживает не ту позу.
  • Несовпадение пропорций тела. Разница между персонажем на изображении и человеком в ведущем ролике даёт артефакты и деформации в режиме Mix.
  • Несовпадение FPS. Если FPS ведущего видео не совпадает с настройками воркфлоу, возможны рывки, замедление или артефакты масштабирования.
  • Детализация маски. Грубая маска оставляет больше фона, но может пропускать контуры объекта; слишком точная сильнее ограничивает генерацию и создаёт риск несогласованности фона.

Сырой результат подходит для превью и проверки концепта. Для продакшен-качества могут потребоваться маски, инпейтинг и интерполяция кадров поверх базовой генерации — именно это обсуждается в приведённой ветке сообщества.

Чем Wan2.2 Animate отличается от других моделей Wan

Семейство Wan развивается быстро, и в названиях версий легко запутаться. Согласно model card, место Wan2.2 Animate в линейке выглядит так:

МодельЧто делаетСвязь с этой статьёй
Wan2.2-Animate-14BАнимация персонажа и замена актёра (video-to-video)Главная тема статьи
Wan-Animate-2Модель-преемник, о которой сообщает сообществоОбсуждается на r/LocalLLaMA (2026)
Wan 2.7 Image ProГенерация и редактирование изображений, не видеоДругая модальность: статичные картинки
Wan 3Универсальная text-to-video / image-to-video модельБолее новая универсальная видеомодель без отдельного режима анимации персонажей
Wan2.2-S2V-14BSpeech-to-video, анимация от аудиоСопутствующая модель для движений, управляемых звуком

FAQ

Wan2.2 Animate умеет работать сразу с несколькими персонажами?

Нет. В официальном руководстве по препроцессингу извлечение маски рассчитано на ролики с одним человеком, поэтому оба режима поддерживают одного персонажа за запуск. Видео с несколькими людьми может обработаться с ошибкой или привести к отслеживанию неверной позы. Для нескольких персонажей нужно обработать каждого отдельно и собрать сцену на постпродакшене.

Какие разрешения поддерживаются?

В воркфлоу поддерживаются разрешения 480p и 720p; в официальных примерах препроцессинга используется 1280×720. Разрешения выше 720p не документированы, поэтому апскейл нужно выполнять отдельным шагом.

Какая лицензия распространяется на результат?

Код и веса модели выпускаются под Apache-2.0. Wan-AI не заявляет прав на сгенерированный контент, однако ответственность за законное и безопасное использование возлагает на пользователя. Model card запрещает генерировать незаконный контент, нацеливаться на уязвимые группы населения и злонамеренно использовать персональные данные.

Wan2.2 Animate генерирует аудио?

Нет. Animate создаёт только видео. Для анимации, управляемой звуком, включая липсинк по речи, предназначена отдельная модель Wan2.2-S2V-14B. Как указано в журнале обновлений Wan2.2 model card, 5 сентября 2025 года в неё добавили поддержку CosyVoice TTS.


Итог: для анимации статичных изображений выбирайте Move, для замены актёра — Mix. Локальный запуск разумен, если у вас есть GPU и опыт работы с ComfyUI; для быстрого старта подойдут облачные API — fal.ai, WaveSpeed и APIXO за $0.04–0.08/с. Но учитывайте нормализацию к 16 fps у fal.ai и биллинг по вычислительному времени у Replicate.