Wan2.2 Animate es el modelo open source de Alibaba, con 14B de parámetros activos, para animar personajes y reemplazar actores en vídeo. Puede dar movimiento a una imagen fija a partir de un vídeo de referencia o insertar ese personaje en una grabación existente sin alterar la escena. Se publicó el 19 de septiembre de 2025 bajo licencia Apache-2.0 y puede ejecutarse en local con ComfyUI o mediante la CLI oficial. Eso sí: el resultado no depende solo de pulsar generar; cuadrar los FPS, alinear bien la pose y trabajar las máscaras marca una diferencia enorme.
Qué es Wan2.2 Animate
Wan2.2-Animate-14B es la variante MoE de Wan-AI para animación de personajes, basada en el modelo de imagen a vídeo Wan2.2 I2V-A14B. Según la ficha del modelo, activa alrededor de 14B de parámetros en cada paso de denoising, aunque suma 27B entre sus dos expertos. Trabaja con dos entradas: una imagen del personaje y un vídeo conductor o de referencia. El modo elegido determina si el personaje reproduce el movimiento del vídeo o si sustituye al actor original dentro de esa escena.
Los pesos oficiales se distribuyen en BF16. También existe una versión cuantizada a FP8 —el archivo Wan2_2-Animate-14B_fp8 empleado en el workflow de ComfyUI— que almacena los pesos con precisión de 8 bits en lugar de 16. Reduce a la mitad la memoria dedicada a los pesos y acerca el modelo a las GPU de consumo.
Move y Mix: cuándo usar cada modo
Wan2.2 Animate reúne dos funciones en el mismo modelo. En ComfyUI se llaman Move y Mix; la CLI y la documentación oficial hablan de animation y replacement. Ambos comparten la misma base: extracción de esqueleto, análisis implícito de rasgos faciales y una imagen de personaje que sirve de referencia visual. La diferencia está en qué elemento se conserva y cuál se transforma.
Move (animación) transfiere los movimientos corporales y las expresiones del vídeo conductor a la imagen del personaje. La imagen define al sujeto y el vídeo aporta la interpretación: un retrato estático puede convertirse en un avatar que baila, o un personaje conceptual puede adoptar la coreografía del clip. El cuerpo se guía mediante señales de esqueleto espacialmente alineadas, mientras que las expresiones faciales se redirigen desde el actor de origen.
Mix (sustitución) hace lo contrario: reemplaza al actor de un vídeo por el personaje de la imagen, manteniendo la escena original. Una Relighting LoRA específica adapta la iluminación y el tono de color del personaje insertado al metraje de referencia para evitar el efecto de elemento pegado encima.
| Aspecto | Move (animación) | Mix (sustitución) |
|---|---|---|
| Qué cambia | Se anima una imagen fija | Se sustituye al actor del vídeo |
| Qué se conserva | La identidad del personaje de la imagen | La escena, la luz y el color del vídeo |
| Entrada conductora | Movimiento y expresiones del vídeo | Interpretación del vídeo |
| Flag de CLI | --retarget_flag --use_flux | --replace_flag --use_relighting_lora |
| Retargeting de pose | Recomendado para compensar diferencias de proporciones corporales | Desactivado por defecto por el riesgo de afectar a la interacción entre personaje y entorno |
| Mejor para | Animar personajes conceptuales y avatares | Sustituir actores e insertar personajes de marca |
Requisitos del sistema y hardware
El repositorio oficial es Wan-Video/Wan2.2 en GitHub y exige PyTorch ≥2.4.0. FlashAttention es necesario para ganar velocidad, aunque conviene dejar su instalación para el final si falla en el primer intento. No hay un mínimo oficial de VRAM publicado: la combinación de FP8 y model offload es la vía orientada a GPU de consumo, pero antes de descargar conviene revisar las notas de memoria del workflow concreto de ComfyUI.
Los resultados de eficiencia de la ficha del modelo aparecen como gráficos, no como cifras en texto. Las ejecuciones con una sola GPU recurren a model offload y conversión de dtype. Los informes de la comunidad aportan referencias parciales: un usuario de r/comfyui generó animaciones de baile en una RTX 3070 usando máscaras e inpainting, y una variante enlazada anuncia edición con 8 GB de VRAM. Son configuraciones parciales, no la canalización completa de Animate-14B.
Cómo ejecutar Wan2.2 Animate en local
Hay dos vías para usarlo en local: la CLI oficial y ComfyUI. En ambos casos hay que descargar primero los pesos:
git clone https://github.com/Wan-Video/Wan2.2
huggingface-cli download Wan-AI/Wan2.2-Animate-14B --local-dir ./Wan2.2-Animate-14B
Opción 1: CLI oficial
Primero hay que preprocesar el vídeo conductor para extraer esqueletos y puntos faciales; después se ejecuta la inferencia. El modo seleccionado define los flags de preprocesado. La lista completa de argumentos está en la sección de ejecución de la ficha del modelo:
- Animación (Move):
--retarget_flag --use_flux - Sustitución (Mix):
--replace_flag --use_relighting_lora --iterations 3 --k 7 --w_len 1 --h_len 1
Para una ejecución con una sola GPU, los ejemplos de la ficha del modelo usan --refert_num 1. También incluye una advertencia clara: "We do not recommend using LoRA models trained on Wan2.2." Cambiar los pesos con LoRAs de terceros puede provocar comportamientos inesperados en la canalización de animación.
Opción 2: ComfyUI
El workflow nativo de ComfyUI requiere estos archivos en sus directorios correspondientes:
| Archivo | Directorio | Función |
|---|---|---|
Wan2_2-Animate-14B_fp8_e4m3fn_scaled_KJ.safetensors | diffusion_models/ | Pesos principales FP8 de Kijai |
umt5_xxl_fp8_e4m3fn_scaled.safetensors | text_encoders/ | Codificador de texto UMT5 XXL en FP8 |
clip_vision_h.safetensors | clip_visions/ | Codificador CLIP Vision |
wan_2.1_vae.safetensors | vae/ | VAE de Wan2.1 |
lightx2v_I2V_14B_480p_cfg_step_distill_rank64_bf16.safetensors | loras/ | LoRA LightX2V de aceleración a 4 pasos |
También hacen falta dos nodos personalizados: ComfyUI-KJNodes y comfyui_controlnet_aux, que incluye DWPose Estimator para el preprocesado del esqueleto. Hay dos límites prácticos: el ancho o el alto de salida debe ser divisible entre 16, y cada nodo Video Extend añade 77 fotogramas, unos 4,8 segundos, cuando el clip supera la generación base. Para activar Mix se mantienen todas las conexiones; para Move hay que desconectar background_video y character_mask del nodo de subgrafo de salida.
Precios de las APIs alojadas
Si preparar el entorno local resulta demasiado pesado, varios proveedores alojan Wan2.2 Animate con pago por uso. Las tarifas pueden parecer equivalentes a primera vista, pero el método de facturación cambia y puede influir de forma notable en el coste final:
| Proveedor | 480p | 720p | Modelo de facturación | Límites de duración |
|---|---|---|---|---|
| fal.ai | $0.04/s | $0.08/s | Fotogramas normalizados a 16 fps; una fuente con FPS altos cuesta más | — |
| WaveSpeed | $0.20 / 5s | $0.40 / 5s | Por ejecución de salida, en bloques de 5 segundos | 5–120s |
| APIXO | $0.04/s | $0.08/s | Por segundo detectado del vídeo de referencia | Mínimo 5s, máximo 120s |
| Replicate | — | — | $3 por cada 1.000 segundos de inferencia (tiempo de cómputo, no de salida) | — |
Los bloques de 5 segundos de WaveSpeed equivalen a la misma tarifa efectiva: $0.04/s a 480p y $0.08/s a 720p. Por tanto, fal.ai, WaveSpeed y APIXO compiten en precio sobre el titular. La clave es qué mide cada una: fal.ai normaliza los fotogramas a 16 fps, así que un vídeo conductor a 30 fps cuesta más por segundo real de duración de lo que parece indicar la tarifa. Replicate factura el tiempo de inferencia en GPU, no la duración del resultado: una salida de 10 segundos que necesite 40 segundos de cómputo cuesta $0.12. Antes de elegir proveedor, confirma qué modos expone cada endpoint; la URL de fal.ai anterior corresponde específicamente al endpoint Move/animación.
Qué funciona de verdad y dónde falla
Las demos promocionales tienen un acabado muy pulido, pero la experiencia de la comunidad deja ver una distancia entre esos ejemplos y el primer resultado generado en local:
"what's the secret, is it post processing, frame interpolation" — u/Grand-Summer9946, r/comfyui
A partir de ese hilo y de la guía oficial de preprocesado, esto es lo que responde bien y lo que suele romperse.
Lo que funciona mejor: clips de baile y transferencia de movimiento con una sola persona, especialmente si el personaje se mueve ante un fondo relativamente estático. La recreación de expresiones faciales funciona bien cuando el vídeo de origen muestra una interpretación nítida y frontal.
Problemas habituales:
- Escenas con varias personas. La extracción de máscaras está diseñada para vídeos de una sola persona; es habitual que siga la pose equivocada.
- Proporciones corporales distintas. Las diferencias entre la imagen del personaje y el vídeo conductor generan artefactos y deformaciones en el modo Mix.
- FPS desajustados. Si los FPS del vídeo conductor no coinciden con los configurados en el workflow, pueden aparecer tirones, cámara lenta o artefactos de zoom.
- Detalle de la máscara. Una máscara más amplia conserva más fondo, pero puede dejar que se filtren formas; una más precisa restringe la generación y puede provocar incoherencias en el fondo.
La salida en bruto sirve para previsualizaciones y pruebas conceptuales. Para llegar a un acabado de producción puede ser necesario añadir máscaras, inpainting e interpolación de fotogramas, como se comenta en el hilo de la comunidad citado.
Wan2.2 Animate frente a otros modelos Wan
La familia Wan evoluciona rápido y su nomenclatura puede resultar confusa. Según la ficha del modelo, esta es la posición de Wan2.2 Animate dentro de la gama:
| Modelo | Qué hace | Relación con este artículo |
|---|---|---|
| Wan2.2-Animate-14B | Animación de personajes y sustitución de actores, de vídeo a vídeo | El modelo analizado aquí |
| Wan-Animate-2 | Modelo sucesor mencionado por la comunidad | Comentado en r/LocalLLaMA (2026) |
| Wan 2.7 Image Pro | Generación y edición de imágenes, no vídeo | Otra modalidad: imágenes estáticas |
| Wan 3 | Texto a vídeo e imagen a vídeo de propósito general | Vídeo general más reciente, sin un modo específico de animación de personajes |
| Wan2.2-S2V-14B | Vídeo a partir de voz, con animación guiada por audio | Modelo complementario para movimiento dirigido por audio |
Preguntas frecuentes
¿Wan2.2 Animate puede trabajar con varios personajes a la vez?
No. La guía oficial de preprocesado prepara la extracción de máscaras para vídeos de una sola persona, así que ambos modos admiten un personaje por ejecución. Una entrada con varias personas puede fallar o seguir la pose equivocada. Para trabajar con varios personajes, hay que procesarlos por separado y componerlos en posproducción.
¿Qué resoluciones admite?
Las resoluciones admitidas por el workflow son 480p y 720p; los ejemplos oficiales de preprocesado utilizan 1280×720. No hay documentación sobre resoluciones superiores a 720p, así que el escalado a mayor resolución debe hacerse como un paso independiente.
¿Qué licencia se aplica al contenido generado?
El código y los pesos del modelo se distribuyen bajo Apache-2.0. Wan-AI no reclama derechos sobre el contenido generado, pero responsabiliza al usuario de emplearlo de forma legal y no perjudicial. La ficha del modelo prohíbe generar contenido ilícito, dirigirse a poblaciones vulnerables o usar datos personales con fines maliciosos.
¿Wan2.2 Animate genera audio?
No. Animate solo genera vídeo. Si necesitas animación guiada por audio, como sincronización labial a partir de voz, el modelo independiente es Wan2.2-S2V-14B, que, según el registro de actualizaciones de la ficha de Wan2.2, añadió compatibilidad con CosyVoice TTS el 5 de septiembre de 2025.
En resumen: usa Move para imágenes fijas y Mix para sustituir actores. Ejecútalo en local si cuentas con GPU y experiencia con ComfyUI; si priorizas rapidez, recurre a una API alojada —fal.ai, WaveSpeed o APIXO, a $0.04–0.08/s—, pero considera la normalización a 16 fps de fal.ai y la facturación por tiempo de cómputo de Replicate.