Wan2.2 Animate réunit dans un même modèle deux usages souvent traités séparément : donner vie à une image de personnage à partir d’une vidéo de référence, ou remplacer l’acteur d’une séquence sans modifier son décor. Publié le 19 septembre 2025 sous licence Apache-2.0, ce modèle open source de 14B d’Alibaba peut tourner en local via ComfyUI ou la CLI officielle. Pour obtenir un rendu propre, il ne suffit toutefois pas de lancer une génération : FPS cohérents, pose bien alignée et masquage soigné font toute la différence.
Wan2.2 Animate, c’est quoi exactement ?
Wan2.2-Animate-14B est la déclinaison MoE dédiée à l’animation de personnages de Wan-AI, bâtie sur le modèle image-vers-vidéo Wan2.2 I2V-A14B. D’après la fiche du modèle, environ 14B de paramètres sont actifs à chaque étape de débruitage, sur un total de 27B répartis entre deux experts. Il utilise deux entrées : une image de personnage et une vidéo de pilotage/référence. Selon le mode choisi, le personnage reproduit les mouvements de la vidéo ou prend la place de l’acteur présent dans la séquence.
Les poids officiels sont fournis en BF16. Une version quantifiée en FP8 — le fichier Wan2_2-Animate-14B_fp8 utilisé dans le workflow ComfyUI — enregistre les poids en précision 8 bits plutôt que 16 bits. La mémoire nécessaire aux poids est ainsi divisée par deux, ce qui rend le modèle plus accessible aux GPU grand public.
Move ou Mix : deux approches pour deux usages
Wan2.2 Animate propose deux modes de fonctionnement. Dans ComfyUI, ils s’appellent Move et Mix ; la CLI et la documentation officielle parlent respectivement d’animation et de replacement. Le pipeline reste le même dans les deux cas : extraction du squelette, extraction implicite des traits du visage et image du personnage utilisée comme référence visuelle. Ce qui change, c’est la partie de la vidéo que le modèle conserve ou remplace.
Mode Move (animation) : il transfère les mouvements du corps et les expressions faciales de la vidéo de pilotage vers l’image de votre personnage. L’image fournit le sujet, la vidéo apporte l’interprétation. Un portrait fixe peut ainsi devenir un avatar qui danse, tandis qu’un personnage de concept art reprend la chorégraphie de la séquence. Les mouvements corporels reposent sur des signaux de squelette spatialement alignés, et les expressions faciales sont retargetées depuis l’acteur source.
Mode Mix (replacement) : à l’inverse, il remplace l’acteur d’une vidéo existante par le personnage de votre image, tout en préservant la scène d’origine. Un Relighting LoRA dédié adapte l’éclairage et la colorimétrie du personnage inséré à ceux de la vidéo source, afin d’éviter un montage qui donne l’impression d’avoir été simplement collé par-dessus.
| Aspect | Move (Animation) | Mix (Replacement) |
|---|---|---|
| Ce qui est modifié | L’image fixe est animée | L’acteur de la vidéo est remplacé |
| Ce qui est préservé | L’identité du personnage issue de l’image | La scène, l’éclairage et les couleurs de la vidéo |
| Entrée de pilotage | Mouvements + expressions de la vidéo | Interprétation de la vidéo |
| Option CLI | --retarget_flag --use_flux | --replace_flag --use_relighting_lora |
| Retargeting de pose | Recommandé, pour gérer les écarts de proportions corporelles | Désactivé par défaut, en raison du risque sur les interactions personnage-environnement |
| Idéal pour | Animer des personnages de concept art et des avatars | Remplacer un acteur ou insérer un personnage de marque |
Configuration requise et matériel
Le dépôt officiel est Wan-Video/Wan2.2 sur GitHub et demande PyTorch ≥2.4.0. FlashAttention est nécessaire pour de bonnes performances, mais vous pouvez l’installer à la fin si la première tentative échoue. Aucun minimum officiel de VRAM n’étant indiqué, considérez la version FP8 associée à l’offload du modèle comme la voie à suivre sur un GPU grand public, puis vérifiez les notes mémoire du workflow ComfyUI concerné avant de télécharger les fichiers.
Les résultats d’efficacité de la fiche du modèle sont présentés sous forme de graphiques plutôt que de chiffres textuels. Les exécutions sur un seul GPU font appel à l’offload du modèle et à la conversion de dtype. Les retours de la communauté donnent quelques points de repère : un utilisateur de r/comfyui a produit des animations de danse sur une RTX 3070 avec du masquage et de l’inpainting, tandis qu’une variante liée annonce du montage avec 8 GB de VRAM. Il s’agit de configurations partielles, et non du pipeline Animate-14B complet.
Lancer Wan2.2 Animate en local
Deux options sont disponibles en local : la CLI officielle et ComfyUI. Dans les deux cas, il faut d’abord télécharger les poids :
git clone https://github.com/Wan-Video/Wan2.2
huggingface-cli download Wan-AI/Wan2.2-Animate-14B --local-dir ./Wan2.2-Animate-14B
Avec la CLI officielle
La première étape consiste à prétraiter la vidéo de pilotage pour en extraire les squelettes et les points de repère faciaux, avant de lancer l’inférence. Les options de prétraitement dépendent ensuite du mode choisi ; les listes complètes d’arguments sont disponibles dans la section d’exécution de la fiche du modèle :
- Animation (Move) :
--retarget_flag --use_flux - Replacement (Mix) :
--replace_flag --use_relighting_lora --iterations 3 --k 7 --w_len 1 --h_len 1
Pour une exécution sur un seul GPU, les exemples de la fiche du modèle utilisent --refert_num 1. Elle comporte aussi cet avertissement : « Nous ne recommandons pas d’utiliser des modèles LoRA entraînés sur Wan2.2. » Les modifications de poids apportées par des LoRA tiers peuvent provoquer des comportements inattendus dans le pipeline d’animation.
Avec ComfyUI
Le workflow natif ComfyUI requiert les fichiers suivants dans leurs répertoires respectifs :
| Fichier | Répertoire | Rôle |
|---|---|---|
Wan2_2-Animate-14B_fp8_e4m3fn_scaled_KJ.safetensors | diffusion_models/ | Poids principaux Kijai FP8 |
umt5_xxl_fp8_e4m3fn_scaled.safetensors | text_encoders/ | Encodeur de texte UMT5 XXL (FP8) |
clip_vision_h.safetensors | clip_visions/ | Encodeur CLIP Vision |
wan_2.1_vae.safetensors | vae/ | VAE Wan2.1 |
lightx2v_I2V_14B_480p_cfg_step_distill_rank64_bf16.safetensors | loras/ | LoRA d’accélération LightX2V en 4 étapes |
Deux nœuds personnalisés sont également nécessaires : ComfyUI-KJNodes et comfyui_controlnet_aux, qui fournit le DWPose Estimator pour le prétraitement des squelettes. Deux contraintes pratiques sont à garder en tête : la largeur ou la hauteur de sortie doit être divisible par 16, et chaque nœud Video Extend ajoute 77 images, soit environ 4,8 secondes, pour les clips dépassant la génération de base. Pour activer le mode Mix, conservez toutes les connexions ; en mode Move, déconnectez background_video et character_mask du nœud de sous-graphe de sortie.
Tarifs des API hébergées selon les fournisseurs
Si l’installation locale est trop exigeante, plusieurs fournisseurs hébergent Wan2.2 Animate avec une facturation à l’usage. Les prix semblent proches au premier regard, mais les méthodes de facturation diffèrent suffisamment pour avoir un effet réel sur la note :
| Fournisseur | 480p | 720p | Modèle de facturation | Limites de durée |
|---|---|---|---|---|
| fal.ai | $0.04/s | $0.08/s | Images normalisées à 16 fps ; une source à FPS élevé coûte davantage | — |
| WaveSpeed | $0.20 / 5s | $0.40 / 5s | Par génération, par paliers de 5 secondes | 5–120s |
| APIXO | $0.04/s | $0.08/s | Par seconde détectée dans la vidéo de référence | 5s minimum, plafond de 120s |
| Replicate | — | — | $3 pour 1 000 secondes d’inférence (temps de calcul, pas durée de sortie) | — |
Les paliers de 5 secondes de WaveSpeed reviennent au même tarif effectif — $0.04/s en 480p et $0.08/s en 720p — ce qui place fal.ai, WaveSpeed et APIXO dans une concurrence tarifaire directe sur le prix affiché. Tout dépend néanmoins de ce qui est comptabilisé : fal.ai normalise le nombre d’images à 16 fps, de sorte qu’une vidéo de pilotage à 30 fps coûte plus cher par seconde de durée réelle que le tarif ne le laisse entendre. Replicate facture le temps d’inférence GPU, et non la durée de sortie : une vidéo de 10 secondes qui demande 40 secondes de calcul coûte $0.12. Avant de vous engager, vérifiez les modes exposés par chaque endpoint ; l’URL fal.ai ci-dessus mène précisément à l’endpoint Move/animation.
Ce qui marche vraiment, et les limites à connaître
Les démonstrations du modèle affichent des résultats soignés, mais les retours de la communauté montrent un écart entre cette qualité et celle d’une première exécution locale :
« quel est le secret, du post-traitement, de l’interpolation d’images ? » — u/Grand-Summer9946, r/comfyui
À partir de cette discussion et du guide officiel de prétraitement, voici les points forts du modèle et les situations qui le mettent en difficulté.
Ce qui fonctionne bien : les clips de danse ou de transfert de mouvement avec une seule personne, lorsque le personnage évolue devant un arrière-plan relativement statique. La reproduction des expressions faciales est convaincante si la vidéo source montre clairement une personne de face.
Ce qui pose problème :
- Les scènes avec plusieurs personnes. L’extraction de masque est conçue pour des vidéos à une seule personne ; le suivi de la mauvaise pose est une erreur fréquente.
- Les différences de proportions corporelles. Les écarts entre l’image du personnage et la vidéo de pilotage entraînent des artefacts et des déformations en mode Mix.
- Les FPS incohérents. Si les FPS de la vidéo de pilotage ne correspondent pas à ceux définis dans le workflow, attendez-vous à des saccades, des ralentis ou des artefacts de zoom.
- La précision du masque. Un masque plus grossier conserve davantage d’arrière-plan, mais peut laisser fuir des formes ; un masque plus fin contraint davantage la génération et risque de rendre le fond incohérent.
Le rendu brut convient aux aperçus et aux tests de concept. Pour atteindre un niveau de production, il peut être nécessaire d’ajouter du masquage, de l’inpainting et de l’interpolation d’images, comme l’évoque la discussion communautaire citée.
Wan2.2 Animate face aux autres modèles Wan
La famille Wan évolue rapidement, et ses numéros de version ne facilitent pas toujours la lecture. Selon la fiche du modèle, voici où se situe Wan2.2 Animate :
| Modèle | Fonction | Lien avec cet article |
|---|---|---|
| Wan2.2-Animate-14B | Animation de personnage + remplacement d’acteur (vidéo à vidéo) | Sujet de cet article |
| Wan-Animate-2 | Modèle successeur signalé par la communauté | Évoqué sur r/LocalLLaMA (2026) |
| Wan 2.7 Image Pro | Génération et édition d’images, pas de vidéo | Modalité différente : images fixes |
| Wan 3 | Texte-vers-vidéo / image-vers-vidéo polyvalent | Modèle vidéo généraliste plus récent, sans mode dédié à l’animation de personnages |
| Wan2.2-S2V-14B | Parole-vers-vidéo, avec animation pilotée par l’audio | Modèle compagnon pour les mouvements guidés par l’audio |
FAQ
Wan2.2 Animate peut-il gérer plusieurs personnages simultanément ?
Non. Le guide officiel de prétraitement prévoit l’extraction de masque pour des vidéos à une seule personne ; les deux modes prennent donc en charge un personnage par génération. Une entrée avec plusieurs personnes peut échouer ou suivre la mauvaise pose. Pour travailler avec plusieurs personnages, traitez-les séparément puis composez le résultat en post-production.
Quelles résolutions sont prises en charge ?
Les résolutions prises en charge par les workflows sont le 480p et le 720p ; les exemples officiels de prétraitement utilisent du 1280×720. Rien au-delà du 720p n’est documenté : une résolution supérieure impose donc une étape distincte d’upscaling.
Quelle licence s’applique aux contenus générés ?
Le code et les poids du modèle sont distribués sous licence Apache-2.0. Wan-AI ne revendique aucun droit sur les contenus générés, mais rend les utilisateurs responsables d’un usage légal et non nuisible. La fiche du modèle interdit la génération de contenus illégaux, le ciblage de populations vulnérables et l’utilisation malveillante de données personnelles.
Wan2.2 Animate génère-t-il de l’audio ?
Non. Animate génère uniquement de la vidéo. Pour une animation pilotée par l’audio, par exemple un lip-sync à partir de la parole, il faut utiliser le modèle distinct Wan2.2-S2V-14B, qui, selon le journal des mises à jour de la fiche du modèle Wan2.2, a ajouté la prise en charge de CosyVoice TTS le 5 septembre 2025.
En bref : choisissez Move pour animer une image fixe et Mix pour remplacer un acteur. L’exécution locale est pertinente si vous disposez d’un GPU et maîtrisez ComfyUI ; pour aller vite, passez par une API hébergée — fal.ai, WaveSpeed ou APIXO à $0.04–0.08/s — en tenant compte de la normalisation à 16 fps de fal.ai et de la facturation au temps de calcul chez Replicate.