AIREITER

Wan2.2 Animate explicado: modos, especificações, preços de API e configuração

Última Atualização: 2026-08-14 01:23:50

O Wan2.2 Animate transforma uma imagem estática em uma performance de vídeo e também consegue trocar o ator de uma gravação sem desmontar a cena original. O modelo open source de 14B da Alibaba foi lançado em 19 de setembro de 2025 sob a licença Apache-2.0 e pode rodar localmente pelo ComfyUI ou pela CLI oficial. Só não espere bons resultados apertando “gerar” e pronto: FPS compatível, alinhamento da pose e máscaras bem configuradas fazem toda a diferença.

O que é o Wan2.2 Animate?

O Wan2.2-Animate-14B é a variante MoE do Wan-AI voltada à animação de personagens, derivada do modelo de imagem para vídeo Wan2.2 I2V-A14B. Segundo o model card, cerca de 14B parâmetros são ativados em cada etapa de denoising, enquanto o total chega a 27B distribuídos entre dois especialistas. O modelo recebe duas entradas: uma imagem do personagem e um vídeo-guia/de referência. Conforme o modo escolhido, ele faz o personagem reproduzir os movimentos do vídeo ou substitui o ator original mantendo a cena.

Os pesos oficiais são distribuídos em BF16. Há também uma versão quantizada em FP8, o arquivo Wan2_2-Animate-14B_fp8 usado no workflow do ComfyUI. Nesse caso, os pesos usam precisão de 8 bits em vez de 16 bits, reduzindo pela metade a memória ocupada e tornando o modelo mais viável em GPUs para consumidores.

Move ou Mix: dois usos para o mesmo modelo

O Wan2.2 Animate oferece dois modos de operação. No ComfyUI, eles aparecem como Move e Mix; na CLI e na documentação oficial, como animation e replacement. O pipeline é compartilhado — com extração do esqueleto, captura implícita dos traços faciais e uso da imagem do personagem como referência visual —, mas cada modo preserva e substitui elementos diferentes.

Modo Move (animação) transfere os movimentos corporais e as expressões faciais do vídeo-guia para a imagem do seu personagem. A imagem define o sujeito; o vídeo fornece a atuação. Assim, um retrato parado pode virar um avatar dançando, enquanto um personagem conceitual pode assumir a coreografia do clipe. O movimento corporal é conduzido por sinais de esqueleto espacialmente alinhados, e as expressões são reencenadas a partir do ator original.

Modo Mix (substituição) faz o caminho inverso: troca o ator de um vídeo existente pelo personagem escolhido, preservando o restante da cena. Uma LoRA de Relighting dedicada adapta iluminação e tonalidade de cor do personagem inserido às características da gravação, evitando aquele visual de recorte colado sobre o vídeo.

AspectoMove (animação)Mix (substituição)
O que mudaA imagem estática ganha movimentoO ator do vídeo é substituído
O que é preservadoA identidade do personagem da imagemCena, iluminação e cores do vídeo
Entrada que conduz o resultadoMovimentos e expressões do vídeoAtuação do vídeo
Flag da CLI--retarget_flag --use_flux--replace_flag --use_relighting_lora
Retargeting da poseRecomendado (lida com diferenças de proporção corporal)Desativado por padrão (risco de interferir na interação com o ambiente)
Melhor usoAnimação de personagens conceituais e avataresSubstituição de atores e inserção de personagens de marca

Requisitos de sistema e hardware

O repositório oficial é o Wan-Video/Wan2.2 no GitHub, com exigência de PyTorch ≥2.4.0. O FlashAttention é necessário para obter mais velocidade, mas pode ser instalado por último caso a primeira tentativa falhe. Como não existe um requisito mínimo oficial e fixo de VRAM, o caminho com FP8 e model offload é a opção mais realista para GPUs de consumo. Antes de baixar tudo, confira as observações de memória do workflow exato do ComfyUI.

Os resultados de eficiência do model card aparecem em gráficos, não em texto. As execuções com uma única GPU usam model offload e conversão de dtype. Relatos da comunidade dão apenas uma ideia parcial do desempenho: um usuário do r/comfyui gerou animações de dança em uma RTX 3070 usando máscaras e inpainting, enquanto uma variante vinculada anuncia edição com 8 GB de VRAM. São configurações específicas, não uma medição completa do pipeline Animate-14B.

Como rodar o Wan2.2 Animate localmente

Há dois caminhos para executar o modelo localmente: a CLI oficial e o ComfyUI. Nos dois casos, primeiro é preciso baixar os pesos:

git clone https://github.com/Wan-Video/Wan2.2
huggingface-cli download Wan-AI/Wan2.2-Animate-14B --local-dir ./Wan2.2-Animate-14B

Caminho pela CLI

O processo começa com o pré-processamento do vídeo-guia para extrair o esqueleto e os pontos faciais. Depois, você executa a inferência. As flags de pré-processamento dependem do modo escolhido; a lista completa de argumentos está na seção de execução do model card:

  • Animação (Move): --retarget_flag --use_flux
  • Substituição (Mix): --replace_flag --use_relighting_lora --iterations 3 --k 7 --w_len 1 --h_len 1

Em execuções com uma única GPU, use --refert_num 1, como nos comandos de exemplo do model card. A documentação também deixa um alerta claro: "We do not recommend using LoRA models trained on Wan2.2." Alterações nos pesos causadas por LoRAs de terceiros podem gerar comportamentos inesperados no pipeline de animação.

Caminho pelo ComfyUI

O workflow nativo do ComfyUI exige que os arquivos abaixo sejam colocados nos respectivos diretórios:

ArquivoDiretórioFunção
Wan2_2-Animate-14B_fp8_e4m3fn_scaled_KJ.safetensorsdiffusion_models/Pesos principais FP8 da Kijai
umt5_xxl_fp8_e4m3fn_scaled.safetensorstext_encoders/Codificador de texto UMT5 XXL (FP8)
clip_vision_h.safetensorsclip_visions/Codificador CLIP Vision
wan_2.1_vae.safetensorsvae/VAE do Wan2.1
lightx2v_I2V_14B_480p_cfg_step_distill_rank64_bf16.safetensorsloras/LoRA de aceleração LightX2V em 4 etapas

Também são necessários dois custom nodes: ComfyUI-KJNodes e comfyui_controlnet_aux, que fornece o DWPose Estimator para o pré-processamento do esqueleto. Há ainda duas limitações práticas: a largura ou a altura da saída precisa ser divisível por 16, e cada nó Video Extend adiciona 77 frames (cerca de 4,8 segundos) para estender clipes além da geração-base. Para ativar o modo Mix, mantenha todas as conexões. No modo Move, desconecte background_video e character_mask do nó do subgrafo de saída.

Preços de APIs hospedadas

Se a configuração local for pesada demais, alguns provedores oferecem o Wan2.2 Animate por uso. As tarifas parecem semelhantes em uma primeira olhada, mas o critério de cobrança muda bastante — e isso pode alterar o valor final:

Provedor480p720pModelo de cobrançaLimites de duração
fal.ai$0.04/s$0.08/sFrames normalizados para 16 fps; fontes com FPS alto custam mais—
WaveSpeed$0.20 / 5s$0.40 / 5sPor execução, em blocos de 5 segundos5–120s
APIXO$0.04/s$0.08/sPor segundo detectado do vídeo de referênciamínimo de 5s, limite de 120s
Replicate——$3 por 1.000 segundos de inferência (tempo de computação, não duração da saída)—

Os blocos de 5 segundos da WaveSpeed equivalem às mesmas tarifas efetivas — $0.04/s em 480p e $0.08/s em 720p. Por isso, fal.ai, WaveSpeed e APIXO são competitivas no preço anunciado. O detalhe está no que cada uma mede: a fal.ai normaliza a contagem de frames para 16 fps, então um vídeo-guia de 30 fps custa mais por segundo de duração real do que a tarifa sugere. Já a Replicate cobra pelo tempo de inferência na GPU, e não pela duração do vídeo gerado: uma saída de 10 segundos que consuma 40 segundos de computação custa $0.12. Antes de escolher, confirme quais modos cada endpoint oferece; o endereço da fal.ai acima aponta especificamente para o endpoint Move/animação.

O que funciona — e o que costuma dar errado

As demonstrações oficiais são bem acabadas, mas a experiência da comunidade mostra uma diferença considerável entre a qualidade dos demos e o resultado de uma primeira execução local:

"what's the secret, is it post processing, frame interpolation" — u/Grand-Summer9946, r/comfyui

Com base nessa discussão e no guia oficial de pré-processamento, estes são os cenários em que o modelo se sai bem — e aqueles que mais quebram:

Onde funciona bem: clipes de dança e transferência de movimento com uma única pessoa, especialmente quando o personagem se move diante de um fundo relativamente estático. A recriação de expressões faciais também é convincente quando o vídeo-fonte mostra uma atuação nítida e de frente.

Onde costuma falhar:

  • Cenas com várias pessoas. A extração de máscaras foi projetada para vídeos com uma única pessoa; acompanhar a pose errada é um problema frequente.
  • Diferenças nas proporções corporais. Quando a imagem do personagem e o vídeo-guia têm proporções muito diferentes, o modo Mix pode produzir artefatos e deformações.
  • Incompatibilidade de FPS. Se o FPS do vídeo-guia não corresponder à configuração do workflow, podem surgir travamentos, efeito de câmera lenta ou artefatos de zoom.
  • Granularidade da máscara. Uma máscara mais ampla preserva mais do fundo, mas pode deixar partes do personagem “vazarem”; uma máscara mais precisa restringe a geração e aumenta o risco de inconsistências no cenário.

A saída bruta já serve para prévias e testes de conceito. Para chegar a um resultado de produção, talvez seja necessário combinar máscara, inpainting e interpolação de frames, como discutido no tópico da comunidade citado acima.

Wan2.2 Animate contra outros modelos Wan

A família Wan evolui rapidamente, e a nomenclatura das versões pode confundir. De acordo com o model card, o Wan2.2 Animate ocupa esta posição:

Wan 3
ModeloO que fazRelação com este artigo
Wan2.2-Animate-14BAnimação de personagens e substituição de atores (vídeo para vídeo)É o tema deste artigo
Wan-Animate-2Sucessor divulgado pela comunidadeDiscutido no r/LocalLLaMA (2026)
Wan 2.7 Image ProGeração e edição de imagens (não vídeo)Modalidade diferente: imagens estáticas
Texto para vídeo e imagem para vídeo de uso geralVídeo geral mais recente, sem modo dedicado à animação de personagens
Wan2.2-S2V-14BÁudio para vídeo (animação conduzida por áudio)Modelo complementar para movimentos guiados por áudio

Perguntas frequentes

O Wan2.2 Animate consegue trabalhar com vários personagens ao mesmo tempo?

Não. O guia oficial de pré-processamento foi desenvolvido para extrair máscaras de vídeos com uma única pessoa. Portanto, os dois modos trabalham com um personagem por execução. Entradas com várias pessoas podem falhar ou acompanhar a pose errada. Para usar mais de um personagem, processe cada um separadamente e faça a composição na pós-produção.

Quais resoluções são compatíveis?

Os workflows suportam 480p e 720p; os exemplos oficiais de pré-processamento usam 1280×720. Não há documentação para resoluções acima de 720p, então qualquer aumento de resolução precisa ser feito separadamente, em uma etapa posterior.

Qual licença se aplica ao conteúdo gerado?

O código e os pesos do modelo são distribuídos sob a licença Apache-2.0. A Wan-AI afirma não reivindicar direitos sobre o conteúdo gerado, mas responsabiliza os usuários pelo uso legal e não prejudicial. O model card proíbe gerar conteúdo ilegal, atingir populações vulneráveis ou usar dados pessoais de forma maliciosa.

O Wan2.2 Animate gera áudio?

Não. O Animate gera apenas vídeo. Para animação conduzida por áudio, como sincronização labial a partir de fala, o modelo separado é o Wan2.2-S2V-14B, que, segundo o registro de atualizações do model card do Wan2.2, passou a oferecer suporte ao TTS CosyVoice em 5 de setembro de 2025.


Em resumo: use o Move para animar imagens estáticas e o Mix para substituir atores. A execução local faz sentido para quem tem uma GPU adequada e familiaridade com o ComfyUI. Para ganhar tempo, prefira uma API hospedada — fal.ai, WaveSpeed ou APIXO, a $0.04–0.08/s —, mas considere a normalização para 16 fps da fal.ai e a cobrança pelo tempo de computação da Replicate.