AIREITER

Wan2.2 Animate erklärt: Modi, Specs, API-Preise & Setup

Zuletzt aktualisiert: 2026-08-14 01:22:16

Ein Standbild zum Tanzen bringen oder eine Person in bestehendem Videomaterial ersetzen: Genau dafür ist Wan2.2 Animate gedacht. Alibabas Open-Source-Modell mit 14B Parametern wurde am 19. September 2025 unter Apache-2.0 veröffentlicht und läuft lokal über ComfyUI oder die offizielle CLI. Für überzeugende Ergebnisse reicht allerdings kein Klick auf „Generate“: Entscheidend sind passende FPS, sauber ausgerichtete Posen und gute Masken.

Was ist Wan2.2 Animate?

Wan2.2-Animate-14B ist die MoE-Variante von Wan-AI für Charakteranimation und basiert auf dem Image-to-Video-Modell Wan2.2 I2V-A14B. Laut Model Card sind bei jedem Denoising-Schritt rund 14B Parameter aktiv; insgesamt verteilen sich 27B Parameter auf zwei Experten. Das Modell erwartet zwei Eingaben: ein Charakterbild und ein steuerndes Referenzvideo. Je nach gewähltem Modus animiert es den Charakter mit der Bewegung des Videos oder ersetzt die darin auftretende Person durch den Charakter.

Die offiziellen Gewichte liegen in BF16 vor. Eine FP8-quantisierte Variante – die Datei Wan2_2-Animate-14B_fp8 aus dem ComfyUI-Workflow – speichert Gewichte mit 8 statt 16 Bit Präzision. Das halbiert den Speicherbedarf der Gewichte und macht das Modell auch für Consumer-GPUs praktikabler.

Move oder Mix: Was die beiden Modi machen

Wan2.2 Animate kennt zwei Betriebsarten. In ComfyUI heißen sie Move und Mix, in der CLI und den offiziellen Dokumenten animation und replacement. Die zugrunde liegende Pipeline ist gleich: Skelett-Extraktion, implizite Erfassung von Gesichtsmerkmalen und das Charakterbild als visuelle Referenz. Der Unterschied liegt darin, welche Teile erhalten bleiben und welche ersetzt werden.

Move-Modus (Animation) überträgt Körperbewegungen und Gesichtsausdrücke aus dem Driving Video auf das Charakterbild. Das Bild liefert die Figur, das Video die Performance. Aus einem statischen Porträt wird ein tanzender Avatar; eine Konzeptfigur übernimmt die Choreografie des Clips. Die Körperbewegung folgt räumlich ausgerichteten Skelettsignalen, die Mimik wird vom ursprünglichen Darsteller übertragen.

Mix-Modus (Replacement) funktioniert umgekehrt: Er ersetzt den Darsteller in einem vorhandenen Video durch das Charakterbild und erhält dabei die ursprüngliche Szene. Eine eigene Relighting LoRA passt die eingefügte Figur an Licht und Farbgebung des Quellmaterials an, damit das Compositing nicht wie aufgeklebt wirkt.

AspektMove (Animation)Mix (Replacement)
Was sich verändertEin Standbild wird animiertDer Darsteller im Video wird ersetzt
Was erhalten bleibtDie Charakteridentität aus dem BildSzene, Licht und Farben des Videos
Steuernde EingabeBewegung + Ausdrücke aus dem VideoPerformance aus dem Video
CLI-Flag--retarget_flag --use_flux--replace_flag --use_relighting_lora
Pose RetargetingEmpfohlen, da es Unterschiede in den Körperproportionen ausgleichtStandardmäßig deaktiviert, wegen möglicher Probleme bei Charakter-Umgebungs-Interaktionen
Am besten geeignet fürKonzeptfiguren und Avatare animierenActor Replacement und gebrandete Einfügungen

Systemanforderungen und Hardware

Das offizielle Repository ist Wan-Video/Wan2.2 auf GitHub; vorausgesetzt wird PyTorch ≥2.4.0. Für hohe Geschwindigkeit ist FlashAttention nötig, bei Problemen kann es aber auch zuletzt installiert werden. Einen offiziellen festen VRAM-Mindestwert gibt es nicht. Für Consumer-GPUs ist daher der FP8-Pfad in Verbindung mit Model Offload gedacht. Vor dem Download sollten die Speicherhinweise des konkreten ComfyUI-Workflows geprüft werden.

Die Effizienzwerte der Model Card sind als Grafiken statt als Text angegeben. Läufe auf einer einzelnen GPU nutzen Model Offload und dtype-Konvertierung. Community-Berichte liefern nur eingeschränkt vergleichbare Praxiswerte: Ein Nutzer bei r/comfyui erzeugte Tanzanimationen auf einer RTX 3070 mit Masking und Inpainting; eine verlinkte Variante wirbt mit Bearbeitung auf 8 GB VRAM. Das sind Teil-Setups, nicht die vollständige Animate-14B-Pipeline.

Wan2.2 Animate lokal ausführen

Lokal stehen zwei Wege offen: die offizielle CLI und ComfyUI. Zuerst müssen bei beiden die Gewichte heruntergeladen werden:

git clone https://github.com/Wan-Video/Wan2.2
huggingface-cli download Wan-AI/Wan2.2-Animate-14B --local-dir ./Wan2.2-Animate-14B

Einrichtung per CLI

Zunächst wird das Driving Video vorverarbeitet, um Skelette und Gesichtspunkte zu extrahieren; danach startet die Inferenz. Die Wahl des Modus bestimmt die Flags für die Vorverarbeitung. Die vollständigen Argumentlisten stehen im Run-Abschnitt der Model Card:

  • Animation (Move): --retarget_flag --use_flux
  • Replacement (Mix): --replace_flag --use_relighting_lora --iterations 3 --k 7 --w_len 1 --h_len 1

Für Einzel-GPU-Läufe wird gemäß den Beispielbefehlen der Model Card --refert_num 1 verwendet. Dort findet sich auch der Hinweis: „Wir empfehlen nicht, auf Wan2.2 trainierte LoRA-Modelle zu verwenden.“ Gewichtsanpassungen durch LoRAs von Drittanbietern können in der Animationspipeline unerwartetes Verhalten verursachen.

Einrichtung mit ComfyUI

Der native ComfyUI-Workflow benötigt diese Modelldateien in den jeweiligen Verzeichnissen:

DateiVerzeichnisAufgabe
Wan2_2-Animate-14B_fp8_e4m3fn_scaled_KJ.safetensorsdiffusion_models/Kijai-FP8-Hauptgewichte
umt5_xxl_fp8_e4m3fn_scaled.safetensorstext_encoders/UMT5-XXL-Text-Encoder (FP8)
clip_vision_h.safetensorsclip_visions/CLIP-Vision-Encoder
wan_2.1_vae.safetensorsvae/Wan2.1-VAE
lightx2v_I2V_14B_480p_cfg_step_distill_rank64_bf16.safetensorsloras/LightX2V-LoRA zur Beschleunigung auf 4 Schritte

Zusätzlich werden zwei Custom Nodes benötigt: ComfyUI-KJNodes und comfyui_controlnet_aux, das den DWPose Estimator für die Skelett-Vorverarbeitung bereitstellt. Zwei praktische Grenzen sind zu beachten: Die Ausgabebreite oder -höhe muss durch 16 teilbar sein, und jeder Video Extend-Node fügt für Clips über die Basisgenerierung hinaus 77 Frames hinzu, also etwa 4,8 Sekunden. Für Mix bleiben alle Verbindungen bestehen. Für Move werden background_video und character_mask vom Output-Subgraph-Node getrennt.

Preise gehosteter APIs im Vergleich

Wer sich das lokale Setup sparen möchte, kann Wan2.2 Animate bei mehreren Anbietern nutzungsbasiert ausführen. Die Preise wirken auf den ersten Blick ähnlich, doch die Abrechnungsmodelle unterscheiden sich in einer Weise, die die tatsächlichen Kosten deutlich beeinflussen kann:

Anbieter480p720pAbrechnungsmodellLaufzeitlimits
fal.ai$0.04/s$0.08/sFrames werden auf 16 fps normiert; Quellen mit hoher FPS kosten mehr—
WaveSpeed$0.20 / 5s$0.40 / 5sPro Output-Run, gestaffelt in 5-Sekunden-Blöcken5–120s
APIXO$0.04/s$0.08/sPro erkannter Sekunde des ReferenzvideosMindestens 5s, maximal 120s
Replicate——$3 pro 1.000 Inferenzsekunden (Rechenzeit, nicht Output)—

Die 5-Sekunden-Blöcke von WaveSpeed ergeben denselben effektiven Preis: $0.04/s bei 480p und $0.08/s bei 720p. Damit sind fal.ai, WaveSpeed und APIXO beim beworbenen Grundpreis konkurrenzfähig. Entscheidend ist jedoch, was genau gemessen wird: fal.ai normiert die Framezahl auf 16 fps. Ein Driving Video mit 30 fps kostet damit pro tatsächlicher Videosekunde mehr, als der Tarif zunächst vermuten lässt. Replicate rechnet GPU-Inferenzzeit statt Ausgabedauer ab: Ein 10-Sekunden-Output, dessen Berechnung 40 Sekunden dauert, kostet $0.12. Vor der Entscheidung sollte geprüft werden, welche Modi der jeweilige Endpoint anbietet; die fal.ai-URL oben führt ausdrücklich zum Move-/Animation-Endpoint.

Was in der Praxis funktioniert – und was nicht

Die Showcase-Demos des Modells sehen sehr sauber aus. Erfahrungen aus der Community zeigen jedoch, dass zwischen diesen Beispielen und dem ersten lokalen Durchlauf eine deutliche Lücke liegen kann:

„Was ist das Geheimnis – Post-Processing, Frame Interpolation?“ — u/Grand-Summer9946, r/comfyui

Ausgehend von diesem Thread und dem offiziellen Preprocessing Guide zeigt sich recht klar, was zuverlässig klappt und wo die Pipeline an Grenzen stößt.

Funktioniert gut: Tanz- und Motion-Transfer-Clips mit einer einzelnen Person vor einem weitgehend statischen Hintergrund. Auch die Übertragung von Gesichtsausdrücken gelingt gut, wenn das Quellvideo eine klare, frontal sichtbare Performance enthält.

Typische Probleme:

  • Szenen mit mehreren Personen. Die Maskenextraktion ist ausdrücklich für Videos mit nur einer Person ausgelegt; häufig wird die falsche Pose verfolgt.
  • Unterschiedliche Körperproportionen. Weichen Charakterbild und Driving Video stark voneinander ab, entstehen im Mix-Modus Artefakte und Verformungen.
  • Nicht passende FPS. Stimmen FPS des Driving Videos und die Workflow-Konfiguration nicht überein, sind Ruckler, Zeitlupe oder Zoom-Artefakte zu erwarten.
  • Detailgrad der Maske. Eine gröbere Maske bewahrt mehr Hintergrund, kann aber Form-Leakage verursachen. Eine feinere Maske schränkt die Generierung stärker ein und kann zu inkonsistenten Hintergründen führen.

Der rohe Output reicht für Vorschauen und Konzepttests. Ergebnisse in Produktionsqualität können zusätzlich Masking, Inpainting und Frame Interpolation erfordern, wie auch der zitierte Community-Thread beschreibt.

Wan2.2 Animate im Wan-Modellportfolio

Die Wan-Familie entwickelt sich schnell weiter, und die Versionsnamen sind nicht immer selbsterklärend. Laut Model Card lässt sich Wan2.2 Animate so einordnen:

ModellFunktionBezug zu diesem Artikel
Wan2.2-Animate-14BCharakteranimation + Actor Replacement (Video-zu-Video)Gegenstand dieses Artikels
Wan-Animate-2Nachfolgemodell laut Community-BerichtenDiskussion auf r/LocalLLaMA (2026)
Wan 2.7 Image ProBildgenerierung und -bearbeitung, kein VideoAndere Modalität: statische Bilder
Wan 3Allgemeines Text-to-Video / Image-to-VideoNeueres allgemeines Videomodell ohne dedizierten Charakteranimationsmodus
Wan2.2-S2V-14BSpeech-to-Video, also audiogesteuerte AnimationBegleitmodell für audiogesteuerte Bewegung

FAQ

Kann Wan2.2 Animate mehrere Charaktere gleichzeitig verarbeiten?

Nein. Der offizielle Preprocessing Guide legt die Maskenextraktion auf Videos mit einer einzelnen Person aus. Beide Modi unterstützen daher einen Charakter pro Durchlauf. Material mit mehreren Personen kann fehlschlagen oder die falsche Pose verfolgen. Für mehrere Charaktere müssen diese separat verarbeitet und anschließend in der Postproduktion zusammengesetzt werden.

Welche Auflösungen werden unterstützt?

Die unterstützten Workflow-Auflösungen sind 480p und 720p; die offiziellen Preprocessing-Beispiele verwenden 1280×720. Höhere Auflösungen als 720p sind nicht dokumentiert und erfordern daher Upscaling als separaten Schritt.

Welche Lizenz gilt für die Ausgabe?

Modellcode und Gewichte stehen unter Apache-2.0. Wan-AI beansprucht keine Rechte an generierten Inhalten, macht Nutzer jedoch für eine rechtmäßige und nicht schädliche Verwendung verantwortlich. Die Model Card untersagt die Generierung rechtswidriger Inhalte, das Anvisieren vulnerabler Gruppen sowie die böswillige Nutzung personenbezogener Daten.

Erzeugt Wan2.2 Animate auch Audio?

Nein. Animate erzeugt ausschließlich Video. Für audiogesteuerte Animation, etwa Lip-Sync aus Sprache, gibt es das separate Modell Wan2.2-S2V-14B. Dieses erhielt laut Update-Log der Wan2.2-Model-Card am 5. September 2025 CosyVoice-TTS-Unterstützung.


Fazit: Move ist der passende Modus für Standbilder, Mix für Actor Replacement. Lokal lohnt sich das Modell mit GPU und ComfyUI-Erfahrung; für einen schnelleren Einstieg bieten sich gehostete APIs an. fal.ai, WaveSpeed und APIXO liegen bei $0.04–0.08/s, wobei bei fal.ai die 16-fps-Normierung und bei Replicate die Abrechnung nach Rechenzeit eingeplant werden sollten.