AIREITER

Wan2.2 Animate: modalità, specifiche, prezzi API e configurazione

Ultimo Aggiornamento: 2026-08-14 01:22:20

Wan2.2 Animate riunisce in un unico framework due operazioni che normalmente richiedono pipeline distinte: animare un personaggio statico usando un video come guida, oppure sostituire l'attore in un filmato lasciando invariata la scena. Il modello open source da 14B di Alibaba è stato pubblicato il 19 settembre 2025 con licenza Apache-2.0 e può girare in locale tramite ComfyUI o la CLI ufficiale. Ottenere risultati puliti, però, non significa solo premere genera: contano la corrispondenza degli FPS, l'allineamento della posa e il masking.

Cos'è Wan2.2 Animate e come funziona

Wan2.2-Animate-14B è la variante MoE per l'animazione dei personaggi di Wan-AI, basata sul modello image-to-video Wan2.2 I2V-A14B. Secondo la model card, a ogni step di denoising sono attivi circa 14B parametri, su 27B complessivi distribuiti tra due esperti. Richiede due input: un'immagine del personaggio e un video guida/di riferimento. In base alla modalità scelta, restituisce il personaggio mentre replica i movimenti del video oppure lo inserisce al posto dell'attore originale nella scena.

I pesi ufficiali sono distribuiti in BF16. La versione quantizzata FP8, ovvero il file Wan2_2-Animate-14B_fp8 impiegato nel workflow ComfyUI, memorizza i pesi a 8 bit anziché a 16, dimezzando la memoria necessaria per i pesi e rendendo il modello utilizzabile anche su GPU consumer.

Move e Mix: quando animare e quando sostituire un attore

Wan2.2 Animate offre due modalità operative. In ComfyUI si chiamano Move e Mix, mentre la CLI e la documentazione ufficiale usano i nomi animation e replacement. La pipeline di base è la stessa — estrazione dello scheletro, rilevamento implicito dei tratti del viso e immagine del personaggio come riferimento visivo — ma cambia ciò che viene mantenuto e ciò che viene sostituito.

Modalità Move (animation) trasferisce movimenti corporei ed espressioni facciali dal video guida all'immagine del personaggio. Il soggetto è l'immagine, mentre il video fornisce l'interpretazione: un ritratto statico può diventare un avatar che balla e un personaggio concettuale può ereditare la coreografia della clip. I movimenti del corpo seguono segnali scheletrici allineati nello spazio, mentre le espressioni vengono retargettizzate dall'attore sorgente.

Modalità Mix (replacement) esegue l'operazione inversa: sostituisce l'attore di un video con il personaggio dell'immagine, preservando la scena originale. Un Relighting LoRA dedicato adatta illuminazione e tonalità cromatica del personaggio inserito al filmato sorgente, così il compositing non dà l'impressione di un elemento incollato sopra.

AspettoMove (Animation)Mix (Replacement)
Cosa cambiaL'immagine statica viene animataL'attore del video viene sostituito
Cosa viene preservatoL'identità del personaggio nell'immagineScena, illuminazione e colori del video
Input guidaMovimento + espressioni dal videoInterpretazione dal video
Flag CLI--retarget_flag --use_flux--replace_flag --use_relighting_lora
Pose retargetingConsigliato, gestisce le differenze nelle proporzioni corporeeDisattivato per impostazione predefinita, per il rischio di interazioni tra personaggio e ambiente
Ideale perAnimare personaggi concettuali e avatarSostituzione di attori e inserimenti branded

Requisiti di sistema e hardware

Il repository ufficiale è Wan-Video/Wan2.2 su GitHub e richiede PyTorch ≥2.4.0. FlashAttention serve ad accelerare l'esecuzione, ma se l'installazione fallisce al primo tentativo può essere aggiunto in seguito. Non essendo pubblicato un requisito minimo ufficiale e fisso di VRAM, il percorso FP8 con model offload è quello pensato per le GPU consumer; prima del download conviene comunque verificare le note sulla memoria dello specifico workflow ComfyUI.

I risultati di efficienza della model card sono presentati in forma grafica, non testuale. Le esecuzioni su una singola GPU usano model offload e conversione del dtype. I benchmark della community offrono solo indicazioni parziali: un utente di r/comfyui ha prodotto animazioni di danza su una RTX 3070 usando masking e inpainting, mentre una variante collegata dichiara editing con 8 GB di VRAM. Non si tratta però della pipeline completa Animate-14B.

Come eseguire Wan2.2 Animate in locale

Le strade per l'uso locale sono due: la CLI ufficiale e ComfyUI. In entrambi i casi bisogna prima scaricare i pesi:

git clone https://github.com/Wan-Video/Wan2.2
huggingface-cli download Wan-AI/Wan2.2-Animate-14B --local-dir ./Wan2.2-Animate-14B

Configurazione via CLI

Il video guida va pre-elaborato per estrarre scheletri e landmark facciali, quindi si può avviare l'inferenza. La modalità scelta determina i flag di preprocessing; gli elenchi completi degli argomenti sono nella sezione di esecuzione della model card:

  • Animation (Move): --retarget_flag --use_flux
  • Replacement (Mix): --replace_flag --use_relighting_lora --iterations 3 --k 7 --w_len 1 --h_len 1

Per le esecuzioni su una sola GPU, gli esempi della model card usano --refert_num 1. La scheda avverte inoltre: "Non consigliamo di usare modelli LoRA addestrati su Wan2.2." Le modifiche ai pesi introdotte da LoRA di terze parti possono provocare comportamenti imprevisti nella pipeline di animazione.

Configurazione con ComfyUI

Il workflow nativo di ComfyUI richiede questi file modello nelle rispettive directory:

FileDirectoryRuolo
Wan2_2-Animate-14B_fp8_e4m3fn_scaled_KJ.safetensorsdiffusion_models/Pesi principali Kijai FP8
umt5_xxl_fp8_e4m3fn_scaled.safetensorstext_encoders/Encoder testuale UMT5 XXL (FP8)
clip_vision_h.safetensorsclip_visions/Encoder CLIP Vision
wan_2.1_vae.safetensorsvae/VAE Wan2.1
lightx2v_I2V_14B_480p_cfg_step_distill_rank64_bf16.safetensorsloras/LoRA LightX2V per accelerazione a 4 step

Servono inoltre due nodi personalizzati: ComfyUI-KJNodes e comfyui_controlnet_aux, che fornisce DWPose Estimator per il preprocessing dello scheletro. Ci sono due vincoli pratici: larghezza o altezza dell'output devono essere divisibili per 16, e ogni nodo Video Extend aggiunge 77 frame, circa 4,8 secondi, per clip più lunghe della generazione base. Per attivare Mix si mantengono tutte le connessioni; per Move bisogna scollegare background_video e character_mask dal nodo del sottografo di output.

Prezzi delle API hosted: fal.ai, WaveSpeed, APIXO e Replicate

Se la configurazione locale è troppo impegnativa, diversi provider ospitano Wan2.2 Animate con tariffe a consumo. A prima vista i prezzi possono sembrare simili, ma i criteri di fatturazione cambiano in modi che incidono concretamente sul costo finale:

Provider480p720pModello di fatturazioneLimiti di durata
fal.ai$0.04/s$0.08/sFrame normalizzati a 16 fps; una sorgente ad alto FPS costa di più—
WaveSpeed$0.20 / 5s$0.40 / 5sPer singola esecuzione di output, a blocchi di 5 secondi5–120s
APIXO$0.04/s$0.08/sPer secondo rilevato del video di riferimentoMinimo 5s, massimo 120s
Replicate——$3 per 1.000 secondi di inferenza (tempo di calcolo, non output)—

I blocchi da 5 secondi di WaveSpeed portano alla stessa tariffa effettiva, ovvero $0.04/s a 480p e $0.08/s a 720p. Per questo fal.ai, WaveSpeed e APIXO sono competitivi sul prezzo nominale. La differenza sta in ciò che viene misurato: fal.ai normalizza il conteggio dei frame a 16 fps, quindi un video guida a 30 fps costa più di quanto suggerisca la tariffa per secondo di durata. Replicate fattura il tempo di inferenza GPU, non la durata dell'output: un video finale di 10 secondi che richiede 40 secondi di calcolo costa $0.12. Prima di scegliere un endpoint, controllate quali modalità espone: l'URL fal.ai riportato sopra punta nello specifico all'endpoint Move/animation.

Cosa funziona davvero e dove emergono i limiti

Le demo ufficiali del modello sono rifinite, ma l'esperienza della community mostra una distanza tra quella qualità e il risultato di una prima esecuzione locale:

"qual è il segreto, post-processing, interpolazione dei frame?" — u/Grand-Summer9946, r/comfyui

In base a quella discussione e alla guida ufficiale al preprocessing, ecco gli scenari più affidabili e quelli problematici.

Cosa riesce bene: clip di danza e trasferimento del movimento con una sola persona, in cui il personaggio si muove davanti a uno sfondo relativamente statico. La riproduzione delle espressioni facciali è efficace quando il video sorgente mostra una performance nitida e frontale.

Cosa tende a rompersi:

  • Scene con più persone. L'estrazione della maschera è progettata solo per video con una persona; seguire la posa sbagliata è un errore comune.
  • Proporzioni corporee diverse. Le differenze tra l'immagine del personaggio e il video guida producono artefatti e deformazioni in modalità Mix.
  • FPS non corrispondenti. Se FPS del video guida e configurazione del workflow non coincidono, sono probabili scatti, rallentamenti o artefatti di zoom.
  • Precisione della maschera. Una maschera più ampia conserva una porzione maggiore dello sfondo ma può causare perdite di forma; una più precisa limita la generazione e rischia incoerenze nello sfondo.

L'output grezzo è utilizzabile per anteprime e test concettuali. Per arrivare a una qualità adatta alla produzione possono servire masking, inpainting e interpolazione dei frame aggiunti alla pipeline, come discusso nel thread della community citato.

Wan2.2 Animate rispetto agli altri modelli Wan

La famiglia Wan evolve rapidamente e la nomenclatura delle versioni può creare confusione. Ecco dove si colloca Wan2.2 Animate secondo la model card:

ModelloCosa faRapporto con questo articolo
Wan2.2-Animate-14BAnimazione di personaggi + sostituzione di attori (video-to-video)Il modello trattato in questo articolo
Wan-Animate-2Modello successore segnalato dalla communityDiscusse su r/LocalLLaMA (2026)
Wan 2.7 Image ProGenerazione e modifica di immagini, non videoModalità diversa: immagini statiche
Wan 3Text-to-video / image-to-video generalistaVideo generalista più recente, senza una modalità dedicata all'animazione dei personaggi
Wan2.2-S2V-14BSpeech-to-video, animazione guidata dall'audioModello complementare per movimenti guidati dall'audio

FAQ

Wan2.2 Animate può gestire più personaggi contemporaneamente?

No. La guida ufficiale al preprocessing costruisce l'estrazione delle maschere per video con una sola persona, quindi entrambe le modalità supportano un personaggio per esecuzione. Un input con più persone può fallire o agganciare la posa errata. Per lavorare su più personaggi, occorre elaborarli separatamente e comporli in post-produzione.

Quali risoluzioni supporta?

Le risoluzioni supportate dal workflow sono 480p e 720p; gli esempi ufficiali di preprocessing usano 1280×720. Non è documentato nulla oltre 720p, quindi per risoluzioni superiori serve un upscaling eseguito separatamente.

Quale licenza si applica all'output?

Codice e pesi del modello sono distribuiti con licenza Apache-2.0. Wan-AI non rivendica diritti sui contenuti generati, ma ritiene gli utenti responsabili di un utilizzo legale e non dannoso. La model card vieta la generazione di contenuti illegali, il targeting di popolazioni vulnerabili e l'uso malevolo di dati personali.

Wan2.2 Animate genera anche l'audio?

No. Animate produce solo video. Per l'animazione guidata dall'audio, ad esempio il lip-sync a partire dal parlato, serve il modello separato Wan2.2-S2V-14B, che secondo il registro aggiornamenti della model card di Wan2.2 ha aggiunto il supporto a CosyVoice TTS il 5 settembre 2025.


In sintesi: scegliete Move per le immagini statiche e Mix per sostituire un attore. L'esecuzione locale ha senso se disponete di una GPU e conoscete ComfyUI; per fare prima, usate un'API hosted — fal.ai, WaveSpeed o APIXO a $0.04–0.08/s — tenendo però conto della normalizzazione a 16 fps di fal.ai e della fatturazione basata sul tempo di calcolo di Replicate.