AIREITER

Wan2.2 Animate: modos, requisitos, precios de API y configuración

Última actualización: 2026-08-14 01:23:41

Wan2.2 Animate es el modelo open source de Alibaba, con 14B de parámetros activos, para animar personajes y reemplazar actores en vídeo. Puede dar movimiento a una imagen fija a partir de un vídeo de referencia o insertar ese personaje en una grabación existente sin alterar la escena. Se publicó el 19 de septiembre de 2025 bajo licencia Apache-2.0 y puede ejecutarse en local con ComfyUI o mediante la CLI oficial. Eso sí: el resultado no depende solo de pulsar generar; cuadrar los FPS, alinear bien la pose y trabajar las máscaras marca una diferencia enorme.

Qué es Wan2.2 Animate

Wan2.2-Animate-14B es la variante MoE de Wan-AI para animación de personajes, basada en el modelo de imagen a vídeo Wan2.2 I2V-A14B. Según la ficha del modelo, activa alrededor de 14B de parámetros en cada paso de denoising, aunque suma 27B entre sus dos expertos. Trabaja con dos entradas: una imagen del personaje y un vídeo conductor o de referencia. El modo elegido determina si el personaje reproduce el movimiento del vídeo o si sustituye al actor original dentro de esa escena.

Los pesos oficiales se distribuyen en BF16. También existe una versión cuantizada a FP8 —el archivo Wan2_2-Animate-14B_fp8 empleado en el workflow de ComfyUI— que almacena los pesos con precisión de 8 bits en lugar de 16. Reduce a la mitad la memoria dedicada a los pesos y acerca el modelo a las GPU de consumo.

Move y Mix: cuándo usar cada modo

Wan2.2 Animate reúne dos funciones en el mismo modelo. En ComfyUI se llaman Move y Mix; la CLI y la documentación oficial hablan de animation y replacement. Ambos comparten la misma base: extracción de esqueleto, análisis implícito de rasgos faciales y una imagen de personaje que sirve de referencia visual. La diferencia está en qué elemento se conserva y cuál se transforma.

Move (animación) transfiere los movimientos corporales y las expresiones del vídeo conductor a la imagen del personaje. La imagen define al sujeto y el vídeo aporta la interpretación: un retrato estático puede convertirse en un avatar que baila, o un personaje conceptual puede adoptar la coreografía del clip. El cuerpo se guía mediante señales de esqueleto espacialmente alineadas, mientras que las expresiones faciales se redirigen desde el actor de origen.

Mix (sustitución) hace lo contrario: reemplaza al actor de un vídeo por el personaje de la imagen, manteniendo la escena original. Una Relighting LoRA específica adapta la iluminación y el tono de color del personaje insertado al metraje de referencia para evitar el efecto de elemento pegado encima.

AspectoMove (animación)Mix (sustitución)
Qué cambiaSe anima una imagen fijaSe sustituye al actor del vídeo
Qué se conservaLa identidad del personaje de la imagenLa escena, la luz y el color del vídeo
Entrada conductoraMovimiento y expresiones del vídeoInterpretación del vídeo
Flag de CLI--retarget_flag --use_flux--replace_flag --use_relighting_lora
Retargeting de poseRecomendado para compensar diferencias de proporciones corporalesDesactivado por defecto por el riesgo de afectar a la interacción entre personaje y entorno
Mejor paraAnimar personajes conceptuales y avataresSustituir actores e insertar personajes de marca

Requisitos del sistema y hardware

El repositorio oficial es Wan-Video/Wan2.2 en GitHub y exige PyTorch ≥2.4.0. FlashAttention es necesario para ganar velocidad, aunque conviene dejar su instalación para el final si falla en el primer intento. No hay un mínimo oficial de VRAM publicado: la combinación de FP8 y model offload es la vía orientada a GPU de consumo, pero antes de descargar conviene revisar las notas de memoria del workflow concreto de ComfyUI.

Los resultados de eficiencia de la ficha del modelo aparecen como gráficos, no como cifras en texto. Las ejecuciones con una sola GPU recurren a model offload y conversión de dtype. Los informes de la comunidad aportan referencias parciales: un usuario de r/comfyui generó animaciones de baile en una RTX 3070 usando máscaras e inpainting, y una variante enlazada anuncia edición con 8 GB de VRAM. Son configuraciones parciales, no la canalización completa de Animate-14B.

Cómo ejecutar Wan2.2 Animate en local

Hay dos vías para usarlo en local: la CLI oficial y ComfyUI. En ambos casos hay que descargar primero los pesos:

git clone https://github.com/Wan-Video/Wan2.2
huggingface-cli download Wan-AI/Wan2.2-Animate-14B --local-dir ./Wan2.2-Animate-14B

Opción 1: CLI oficial

Primero hay que preprocesar el vídeo conductor para extraer esqueletos y puntos faciales; después se ejecuta la inferencia. El modo seleccionado define los flags de preprocesado. La lista completa de argumentos está en la sección de ejecución de la ficha del modelo:

  • Animación (Move): --retarget_flag --use_flux
  • Sustitución (Mix): --replace_flag --use_relighting_lora --iterations 3 --k 7 --w_len 1 --h_len 1

Para una ejecución con una sola GPU, los ejemplos de la ficha del modelo usan --refert_num 1. También incluye una advertencia clara: "We do not recommend using LoRA models trained on Wan2.2." Cambiar los pesos con LoRAs de terceros puede provocar comportamientos inesperados en la canalización de animación.

Opción 2: ComfyUI

El workflow nativo de ComfyUI requiere estos archivos en sus directorios correspondientes:

ArchivoDirectorioFunción
Wan2_2-Animate-14B_fp8_e4m3fn_scaled_KJ.safetensorsdiffusion_models/Pesos principales FP8 de Kijai
umt5_xxl_fp8_e4m3fn_scaled.safetensorstext_encoders/Codificador de texto UMT5 XXL en FP8
clip_vision_h.safetensorsclip_visions/Codificador CLIP Vision
wan_2.1_vae.safetensorsvae/VAE de Wan2.1
lightx2v_I2V_14B_480p_cfg_step_distill_rank64_bf16.safetensorsloras/LoRA LightX2V de aceleración a 4 pasos

También hacen falta dos nodos personalizados: ComfyUI-KJNodes y comfyui_controlnet_aux, que incluye DWPose Estimator para el preprocesado del esqueleto. Hay dos límites prácticos: el ancho o el alto de salida debe ser divisible entre 16, y cada nodo Video Extend añade 77 fotogramas, unos 4,8 segundos, cuando el clip supera la generación base. Para activar Mix se mantienen todas las conexiones; para Move hay que desconectar background_video y character_mask del nodo de subgrafo de salida.

Precios de las APIs alojadas

Si preparar el entorno local resulta demasiado pesado, varios proveedores alojan Wan2.2 Animate con pago por uso. Las tarifas pueden parecer equivalentes a primera vista, pero el método de facturación cambia y puede influir de forma notable en el coste final:

Proveedor480p720pModelo de facturaciónLímites de duración
fal.ai$0.04/s$0.08/sFotogramas normalizados a 16 fps; una fuente con FPS altos cuesta más—
WaveSpeed$0.20 / 5s$0.40 / 5sPor ejecución de salida, en bloques de 5 segundos5–120s
APIXO$0.04/s$0.08/sPor segundo detectado del vídeo de referenciaMínimo 5s, máximo 120s
Replicate——$3 por cada 1.000 segundos de inferencia (tiempo de cómputo, no de salida)—

Los bloques de 5 segundos de WaveSpeed equivalen a la misma tarifa efectiva: $0.04/s a 480p y $0.08/s a 720p. Por tanto, fal.ai, WaveSpeed y APIXO compiten en precio sobre el titular. La clave es qué mide cada una: fal.ai normaliza los fotogramas a 16 fps, así que un vídeo conductor a 30 fps cuesta más por segundo real de duración de lo que parece indicar la tarifa. Replicate factura el tiempo de inferencia en GPU, no la duración del resultado: una salida de 10 segundos que necesite 40 segundos de cómputo cuesta $0.12. Antes de elegir proveedor, confirma qué modos expone cada endpoint; la URL de fal.ai anterior corresponde específicamente al endpoint Move/animación.

Qué funciona de verdad y dónde falla

Las demos promocionales tienen un acabado muy pulido, pero la experiencia de la comunidad deja ver una distancia entre esos ejemplos y el primer resultado generado en local:

"what's the secret, is it post processing, frame interpolation" — u/Grand-Summer9946, r/comfyui

A partir de ese hilo y de la guía oficial de preprocesado, esto es lo que responde bien y lo que suele romperse.

Lo que funciona mejor: clips de baile y transferencia de movimiento con una sola persona, especialmente si el personaje se mueve ante un fondo relativamente estático. La recreación de expresiones faciales funciona bien cuando el vídeo de origen muestra una interpretación nítida y frontal.

Problemas habituales:

  • Escenas con varias personas. La extracción de máscaras está diseñada para vídeos de una sola persona; es habitual que siga la pose equivocada.
  • Proporciones corporales distintas. Las diferencias entre la imagen del personaje y el vídeo conductor generan artefactos y deformaciones en el modo Mix.
  • FPS desajustados. Si los FPS del vídeo conductor no coinciden con los configurados en el workflow, pueden aparecer tirones, cámara lenta o artefactos de zoom.
  • Detalle de la máscara. Una máscara más amplia conserva más fondo, pero puede dejar que se filtren formas; una más precisa restringe la generación y puede provocar incoherencias en el fondo.

La salida en bruto sirve para previsualizaciones y pruebas conceptuales. Para llegar a un acabado de producción puede ser necesario añadir máscaras, inpainting e interpolación de fotogramas, como se comenta en el hilo de la comunidad citado.

Wan2.2 Animate frente a otros modelos Wan

La familia Wan evoluciona rápido y su nomenclatura puede resultar confusa. Según la ficha del modelo, esta es la posición de Wan2.2 Animate dentro de la gama:

ModeloQué haceRelación con este artículo
Wan2.2-Animate-14BAnimación de personajes y sustitución de actores, de vídeo a vídeoEl modelo analizado aquí
Wan-Animate-2Modelo sucesor mencionado por la comunidadComentado en r/LocalLLaMA (2026)
Wan 2.7 Image ProGeneración y edición de imágenes, no vídeoOtra modalidad: imágenes estáticas
Wan 3Texto a vídeo e imagen a vídeo de propósito generalVídeo general más reciente, sin un modo específico de animación de personajes
Wan2.2-S2V-14BVídeo a partir de voz, con animación guiada por audioModelo complementario para movimiento dirigido por audio

Preguntas frecuentes

¿Wan2.2 Animate puede trabajar con varios personajes a la vez?

No. La guía oficial de preprocesado prepara la extracción de máscaras para vídeos de una sola persona, así que ambos modos admiten un personaje por ejecución. Una entrada con varias personas puede fallar o seguir la pose equivocada. Para trabajar con varios personajes, hay que procesarlos por separado y componerlos en posproducción.

¿Qué resoluciones admite?

Las resoluciones admitidas por el workflow son 480p y 720p; los ejemplos oficiales de preprocesado utilizan 1280×720. No hay documentación sobre resoluciones superiores a 720p, así que el escalado a mayor resolución debe hacerse como un paso independiente.

¿Qué licencia se aplica al contenido generado?

El código y los pesos del modelo se distribuyen bajo Apache-2.0. Wan-AI no reclama derechos sobre el contenido generado, pero responsabiliza al usuario de emplearlo de forma legal y no perjudicial. La ficha del modelo prohíbe generar contenido ilícito, dirigirse a poblaciones vulnerables o usar datos personales con fines maliciosos.

¿Wan2.2 Animate genera audio?

No. Animate solo genera vídeo. Si necesitas animación guiada por audio, como sincronización labial a partir de voz, el modelo independiente es Wan2.2-S2V-14B, que, según el registro de actualizaciones de la ficha de Wan2.2, añadió compatibilidad con CosyVoice TTS el 5 de septiembre de 2025.


En resumen: usa Move para imágenes fijas y Mix para sustituir actores. Ejecútalo en local si cuentas con GPU y experiencia con ComfyUI; si priorizas rapidez, recurre a una API alojada —fal.ai, WaveSpeed o APIXO, a $0.04–0.08/s—, pero considera la normalización a 16 fps de fal.ai y la facturación por tiempo de cómputo de Replicate.