Ein Standbild zum Tanzen bringen oder eine Person in bestehendem Videomaterial ersetzen: Genau dafür ist Wan2.2 Animate gedacht. Alibabas Open-Source-Modell mit 14B Parametern wurde am 19. September 2025 unter Apache-2.0 veröffentlicht und läuft lokal über ComfyUI oder die offizielle CLI. Für überzeugende Ergebnisse reicht allerdings kein Klick auf „Generate“: Entscheidend sind passende FPS, sauber ausgerichtete Posen und gute Masken.
Was ist Wan2.2 Animate?
Wan2.2-Animate-14B ist die MoE-Variante von Wan-AI für Charakteranimation und basiert auf dem Image-to-Video-Modell Wan2.2 I2V-A14B. Laut Model Card sind bei jedem Denoising-Schritt rund 14B Parameter aktiv; insgesamt verteilen sich 27B Parameter auf zwei Experten. Das Modell erwartet zwei Eingaben: ein Charakterbild und ein steuerndes Referenzvideo. Je nach gewähltem Modus animiert es den Charakter mit der Bewegung des Videos oder ersetzt die darin auftretende Person durch den Charakter.
Die offiziellen Gewichte liegen in BF16 vor. Eine FP8-quantisierte Variante – die Datei Wan2_2-Animate-14B_fp8 aus dem ComfyUI-Workflow – speichert Gewichte mit 8 statt 16 Bit Präzision. Das halbiert den Speicherbedarf der Gewichte und macht das Modell auch für Consumer-GPUs praktikabler.
Move oder Mix: Was die beiden Modi machen
Wan2.2 Animate kennt zwei Betriebsarten. In ComfyUI heißen sie Move und Mix, in der CLI und den offiziellen Dokumenten animation und replacement. Die zugrunde liegende Pipeline ist gleich: Skelett-Extraktion, implizite Erfassung von Gesichtsmerkmalen und das Charakterbild als visuelle Referenz. Der Unterschied liegt darin, welche Teile erhalten bleiben und welche ersetzt werden.
Move-Modus (Animation) überträgt Körperbewegungen und Gesichtsausdrücke aus dem Driving Video auf das Charakterbild. Das Bild liefert die Figur, das Video die Performance. Aus einem statischen Porträt wird ein tanzender Avatar; eine Konzeptfigur übernimmt die Choreografie des Clips. Die Körperbewegung folgt räumlich ausgerichteten Skelettsignalen, die Mimik wird vom ursprünglichen Darsteller übertragen.
Mix-Modus (Replacement) funktioniert umgekehrt: Er ersetzt den Darsteller in einem vorhandenen Video durch das Charakterbild und erhält dabei die ursprüngliche Szene. Eine eigene Relighting LoRA passt die eingefügte Figur an Licht und Farbgebung des Quellmaterials an, damit das Compositing nicht wie aufgeklebt wirkt.
| Aspekt | Move (Animation) | Mix (Replacement) |
|---|---|---|
| Was sich verändert | Ein Standbild wird animiert | Der Darsteller im Video wird ersetzt |
| Was erhalten bleibt | Die Charakteridentität aus dem Bild | Szene, Licht und Farben des Videos |
| Steuernde Eingabe | Bewegung + Ausdrücke aus dem Video | Performance aus dem Video |
| CLI-Flag | --retarget_flag --use_flux | --replace_flag --use_relighting_lora |
| Pose Retargeting | Empfohlen, da es Unterschiede in den Körperproportionen ausgleicht | Standardmäßig deaktiviert, wegen möglicher Probleme bei Charakter-Umgebungs-Interaktionen |
| Am besten geeignet für | Konzeptfiguren und Avatare animieren | Actor Replacement und gebrandete Einfügungen |
Systemanforderungen und Hardware
Das offizielle Repository ist Wan-Video/Wan2.2 auf GitHub; vorausgesetzt wird PyTorch ≥2.4.0. Für hohe Geschwindigkeit ist FlashAttention nötig, bei Problemen kann es aber auch zuletzt installiert werden. Einen offiziellen festen VRAM-Mindestwert gibt es nicht. Für Consumer-GPUs ist daher der FP8-Pfad in Verbindung mit Model Offload gedacht. Vor dem Download sollten die Speicherhinweise des konkreten ComfyUI-Workflows geprüft werden.
Die Effizienzwerte der Model Card sind als Grafiken statt als Text angegeben. Läufe auf einer einzelnen GPU nutzen Model Offload und dtype-Konvertierung. Community-Berichte liefern nur eingeschränkt vergleichbare Praxiswerte: Ein Nutzer bei r/comfyui erzeugte Tanzanimationen auf einer RTX 3070 mit Masking und Inpainting; eine verlinkte Variante wirbt mit Bearbeitung auf 8 GB VRAM. Das sind Teil-Setups, nicht die vollständige Animate-14B-Pipeline.
Wan2.2 Animate lokal ausführen
Lokal stehen zwei Wege offen: die offizielle CLI und ComfyUI. Zuerst müssen bei beiden die Gewichte heruntergeladen werden:
git clone https://github.com/Wan-Video/Wan2.2
huggingface-cli download Wan-AI/Wan2.2-Animate-14B --local-dir ./Wan2.2-Animate-14B
Einrichtung per CLI
Zunächst wird das Driving Video vorverarbeitet, um Skelette und Gesichtspunkte zu extrahieren; danach startet die Inferenz. Die Wahl des Modus bestimmt die Flags für die Vorverarbeitung. Die vollständigen Argumentlisten stehen im Run-Abschnitt der Model Card:
- Animation (Move):
--retarget_flag --use_flux - Replacement (Mix):
--replace_flag --use_relighting_lora --iterations 3 --k 7 --w_len 1 --h_len 1
Für Einzel-GPU-Läufe wird gemäß den Beispielbefehlen der Model Card --refert_num 1 verwendet. Dort findet sich auch der Hinweis: „Wir empfehlen nicht, auf Wan2.2 trainierte LoRA-Modelle zu verwenden.“ Gewichtsanpassungen durch LoRAs von Drittanbietern können in der Animationspipeline unerwartetes Verhalten verursachen.
Einrichtung mit ComfyUI
Der native ComfyUI-Workflow benötigt diese Modelldateien in den jeweiligen Verzeichnissen:
| Datei | Verzeichnis | Aufgabe |
|---|---|---|
Wan2_2-Animate-14B_fp8_e4m3fn_scaled_KJ.safetensors | diffusion_models/ | Kijai-FP8-Hauptgewichte |
umt5_xxl_fp8_e4m3fn_scaled.safetensors | text_encoders/ | UMT5-XXL-Text-Encoder (FP8) |
clip_vision_h.safetensors | clip_visions/ | CLIP-Vision-Encoder |
wan_2.1_vae.safetensors | vae/ | Wan2.1-VAE |
lightx2v_I2V_14B_480p_cfg_step_distill_rank64_bf16.safetensors | loras/ | LightX2V-LoRA zur Beschleunigung auf 4 Schritte |
Zusätzlich werden zwei Custom Nodes benötigt: ComfyUI-KJNodes und comfyui_controlnet_aux, das den DWPose Estimator für die Skelett-Vorverarbeitung bereitstellt. Zwei praktische Grenzen sind zu beachten: Die Ausgabebreite oder -höhe muss durch 16 teilbar sein, und jeder Video Extend-Node fügt für Clips über die Basisgenerierung hinaus 77 Frames hinzu, also etwa 4,8 Sekunden. Für Mix bleiben alle Verbindungen bestehen. Für Move werden background_video und character_mask vom Output-Subgraph-Node getrennt.
Preise gehosteter APIs im Vergleich
Wer sich das lokale Setup sparen möchte, kann Wan2.2 Animate bei mehreren Anbietern nutzungsbasiert ausführen. Die Preise wirken auf den ersten Blick ähnlich, doch die Abrechnungsmodelle unterscheiden sich in einer Weise, die die tatsächlichen Kosten deutlich beeinflussen kann:
| Anbieter | 480p | 720p | Abrechnungsmodell | Laufzeitlimits |
|---|---|---|---|---|
| fal.ai | $0.04/s | $0.08/s | Frames werden auf 16 fps normiert; Quellen mit hoher FPS kosten mehr | — |
| WaveSpeed | $0.20 / 5s | $0.40 / 5s | Pro Output-Run, gestaffelt in 5-Sekunden-Blöcken | 5–120s |
| APIXO | $0.04/s | $0.08/s | Pro erkannter Sekunde des Referenzvideos | Mindestens 5s, maximal 120s |
| Replicate | — | — | $3 pro 1.000 Inferenzsekunden (Rechenzeit, nicht Output) | — |
Die 5-Sekunden-Blöcke von WaveSpeed ergeben denselben effektiven Preis: $0.04/s bei 480p und $0.08/s bei 720p. Damit sind fal.ai, WaveSpeed und APIXO beim beworbenen Grundpreis konkurrenzfähig. Entscheidend ist jedoch, was genau gemessen wird: fal.ai normiert die Framezahl auf 16 fps. Ein Driving Video mit 30 fps kostet damit pro tatsächlicher Videosekunde mehr, als der Tarif zunächst vermuten lässt. Replicate rechnet GPU-Inferenzzeit statt Ausgabedauer ab: Ein 10-Sekunden-Output, dessen Berechnung 40 Sekunden dauert, kostet $0.12. Vor der Entscheidung sollte geprüft werden, welche Modi der jeweilige Endpoint anbietet; die fal.ai-URL oben führt ausdrücklich zum Move-/Animation-Endpoint.
Was in der Praxis funktioniert – und was nicht
Die Showcase-Demos des Modells sehen sehr sauber aus. Erfahrungen aus der Community zeigen jedoch, dass zwischen diesen Beispielen und dem ersten lokalen Durchlauf eine deutliche Lücke liegen kann:
„Was ist das Geheimnis – Post-Processing, Frame Interpolation?“ — u/Grand-Summer9946, r/comfyui
Ausgehend von diesem Thread und dem offiziellen Preprocessing Guide zeigt sich recht klar, was zuverlässig klappt und wo die Pipeline an Grenzen stößt.
Funktioniert gut: Tanz- und Motion-Transfer-Clips mit einer einzelnen Person vor einem weitgehend statischen Hintergrund. Auch die Übertragung von Gesichtsausdrücken gelingt gut, wenn das Quellvideo eine klare, frontal sichtbare Performance enthält.
Typische Probleme:
- Szenen mit mehreren Personen. Die Maskenextraktion ist ausdrücklich für Videos mit nur einer Person ausgelegt; häufig wird die falsche Pose verfolgt.
- Unterschiedliche Körperproportionen. Weichen Charakterbild und Driving Video stark voneinander ab, entstehen im Mix-Modus Artefakte und Verformungen.
- Nicht passende FPS. Stimmen FPS des Driving Videos und die Workflow-Konfiguration nicht überein, sind Ruckler, Zeitlupe oder Zoom-Artefakte zu erwarten.
- Detailgrad der Maske. Eine gröbere Maske bewahrt mehr Hintergrund, kann aber Form-Leakage verursachen. Eine feinere Maske schränkt die Generierung stärker ein und kann zu inkonsistenten Hintergründen führen.
Der rohe Output reicht für Vorschauen und Konzepttests. Ergebnisse in Produktionsqualität können zusätzlich Masking, Inpainting und Frame Interpolation erfordern, wie auch der zitierte Community-Thread beschreibt.
Wan2.2 Animate im Wan-Modellportfolio
Die Wan-Familie entwickelt sich schnell weiter, und die Versionsnamen sind nicht immer selbsterklärend. Laut Model Card lässt sich Wan2.2 Animate so einordnen:
| Modell | Funktion | Bezug zu diesem Artikel |
|---|---|---|
| Wan2.2-Animate-14B | Charakteranimation + Actor Replacement (Video-zu-Video) | Gegenstand dieses Artikels |
| Wan-Animate-2 | Nachfolgemodell laut Community-Berichten | Diskussion auf r/LocalLLaMA (2026) |
| Wan 2.7 Image Pro | Bildgenerierung und -bearbeitung, kein Video | Andere Modalität: statische Bilder |
| Wan 3 | Allgemeines Text-to-Video / Image-to-Video | Neueres allgemeines Videomodell ohne dedizierten Charakteranimationsmodus |
| Wan2.2-S2V-14B | Speech-to-Video, also audiogesteuerte Animation | Begleitmodell für audiogesteuerte Bewegung |
FAQ
Kann Wan2.2 Animate mehrere Charaktere gleichzeitig verarbeiten?
Nein. Der offizielle Preprocessing Guide legt die Maskenextraktion auf Videos mit einer einzelnen Person aus. Beide Modi unterstützen daher einen Charakter pro Durchlauf. Material mit mehreren Personen kann fehlschlagen oder die falsche Pose verfolgen. Für mehrere Charaktere müssen diese separat verarbeitet und anschließend in der Postproduktion zusammengesetzt werden.
Welche Auflösungen werden unterstützt?
Die unterstützten Workflow-Auflösungen sind 480p und 720p; die offiziellen Preprocessing-Beispiele verwenden 1280×720. Höhere Auflösungen als 720p sind nicht dokumentiert und erfordern daher Upscaling als separaten Schritt.
Welche Lizenz gilt für die Ausgabe?
Modellcode und Gewichte stehen unter Apache-2.0. Wan-AI beansprucht keine Rechte an generierten Inhalten, macht Nutzer jedoch für eine rechtmäßige und nicht schädliche Verwendung verantwortlich. Die Model Card untersagt die Generierung rechtswidriger Inhalte, das Anvisieren vulnerabler Gruppen sowie die böswillige Nutzung personenbezogener Daten.
Erzeugt Wan2.2 Animate auch Audio?
Nein. Animate erzeugt ausschließlich Video. Für audiogesteuerte Animation, etwa Lip-Sync aus Sprache, gibt es das separate Modell Wan2.2-S2V-14B. Dieses erhielt laut Update-Log der Wan2.2-Model-Card am 5. September 2025 CosyVoice-TTS-Unterstützung.
Fazit: Move ist der passende Modus für Standbilder, Mix für Actor Replacement. Lokal lohnt sich das Modell mit GPU und ComfyUI-Erfahrung; für einen schnelleren Einstieg bieten sich gehostete APIs an. fal.ai, WaveSpeed und APIXO liegen bei $0.04–0.08/s, wobei bei fal.ai die 16-fps-Normierung und bei Replicate die Abrechnung nach Rechenzeit eingeplant werden sollten.