Tek bir kareden dans eden bir avatar üretmek ya da mevcut videodaki oyuncuyu kendi karakterinizle değiştirmek istiyorsanız Wan2.2 Animate bunu aynı çatı altında sunuyor. Alibaba'nın açık kaynaklı 14B karakter animasyonu modeli, 19 Eylül 2025 tarihinde Apache-2.0 lisansıyla yayımlandı. ComfyUI veya resmi CLI üzerinden yerelde çalışıyor; ancak iyi sonuç almak yalnızca üret düğmesine basmaktan ibaret değil. FPS eşleşmesi, poz hizalaması ve maskeleme, çıktının kalitesini doğrudan belirliyor.
Wan2.2 Animate nedir, ne yapar?
Wan2.2-Animate-14B, Wan-AI'ın Wan2.2 I2V-A14B görüntüden videoya modelinden türettiği, MoE tabanlı karakter animasyonu varyantı. Model kartına göre her gürültü giderme adımında yaklaşık 14B parametre aktif oluyor; iki uzman arasındaki toplam parametre sayısı ise 27B. Sistem iki girdi bekliyor: bir karakter görseli ve bir hareket/referans videosu. Seçtiğiniz moda bağlı olarak karakteriniz videodaki hareketleri yapıyor veya videodaki asıl oyuncunun yerini alıyor.
Resmi ağırlıklar BF16 formatında sunuluyor. ComfyUI iş akışında kullanılan FP8 nicemlenmiş sürümdeki Wan2_2-Animate-14B_fp8 dosyası ise ağırlıkları 16 bit yerine 8 bit hassasiyetle saklıyor. Bu, ağırlık belleği ihtiyacını yarıya indirerek modeli tüketici sınıfı GPU'larda daha erişilebilir hâle getiriyor.
Move ve Mix modları: Aynı model, iki farklı kullanım
Wan2.2 Animate iki çalışma moduna sahip. ComfyUI tarafında bunlar Move ve Mix olarak geçiyor; CLI ve resmi belgelerdeki adlarıysa animation ve replacement. İki mod da aynı temel işlem hattını kullanıyor: iskelet çıkarımı, örtük yüz özelliği çıkarımı ve görsel referans olarak karakter görüntüsü. Asıl fark, videoda hangi unsurların korunup hangilerinin değiştirildiğinde ortaya çıkıyor.
Move modu (animation), hareket videosundaki vücut hareketlerini ve yüz ifadelerini karakter görselinize aktarıyor. Karakter görseli özneyi, video ise performansı sağlıyor. Böylece sabit bir portre dans eden bir avatara dönüşebiliyor veya konsept karakteriniz kaynak klibin koreografisini devralabiliyor. Vücut hareketi, uzamsal olarak hizalanmış iskelet sinyalleriyle yönlendirilirken yüz ifadeleri kaynak oyuncudan yeniden hedefleniyor.
Mix modu (replacement) ise ters yönde çalışıyor: Karakter görselinizi mevcut bir videodaki oyuncunun yerine yerleştirirken özgün sahneyi koruyor. Özel Relighting LoRA, eklenen karakteri kaynak görüntülerin ışığına ve renk tonuna uyarlayarak kompozitin sonradan yapıştırılmış gibi görünmesini azaltıyor.
| Konu | Move (Animation) | Mix (Replacement) |
|---|---|---|
| Değişen unsur | Sabit görsel canlandırılır | Videodaki oyuncu değiştirilir |
| Korunan unsur | Görseldeki karakter kimliği | Videodaki sahne, ışık ve renk |
| Hareket girdisi | Videodan gelen hareketler ve ifadeler | Videodaki performans |
| CLI bayrağı | --retarget_flag --use_flux | --replace_flag --use_relighting_lora |
| Poz yeniden hedefleme | Önerilir; vücut oranı farklarını yönetir | Varsayılan olarak kapalıdır; karakter-çevre etkileşimi riski vardır |
| En uygun kullanım | Konsept karakterleri ve avatarları canlandırmak | Oyuncu değiştirme ve markalı karakter ekleme |
Sistem gereksinimleri ve donanım ihtiyacı
Resmi depo, GitHub'daki Wan-Video/Wan2.2; PyTorch ≥2.4.0 gerektiriyor. Hız için FlashAttention gerekli, ancak ilk kurulumda hata verirse en son yüklemeyi deneyebilirsiniz. Resmi olarak sabit bir minimum VRAM değeri paylaşılmadığından, FP8 sürümü ve model offload yaklaşımını tüketici GPU'ları için seçenek olarak değerlendirin. İndirmeden önce kullanacağınız ComfyUI iş akışının bellek notlarını kontrol etmekte fayda var.
Model kartındaki verimlilik sonuçları metin yerine görsel biçiminde sunuluyor. Tek GPU'lu çalıştırmalarda model offload ve dtype dönüşümü kullanılıyor. Topluluktan gelen örnekler ise kısmi benchmark niteliğinde: Bir r/comfyui kullanıcısı, maskeleme ve inpainting kullanarak RTX 3070 üzerinde dans animasyonları ürettiğini paylaştı; bağlantı verilen bir varyant da 8 GB VRAM ile düzenleme vad ediyor. Bunlar tam Animate-14B işlem hattını temsil etmeyen, sınırlı kurulumlar.
Wan2.2 Animate'i yerelde çalıştırma
Yerelde iki yol var: resmi CLI ve ComfyUI. Her ikisinde de önce model ağırlıklarını indirmeniz gerekiyor:
git clone https://github.com/Wan-Video/Wan2.2
huggingface-cli download Wan-AI/Wan2.2-Animate-14B --local-dir ./Wan2.2-Animate-14B
CLI ile kurulum ve çalıştırma
Önce hareket videosunu işleyerek iskeletleri ve yüz işaret noktalarını çıkarıyor, ardından çıkarım sürecini başlatıyorsunuz. Seçtiğiniz mod, ön işleme bayraklarını da belirliyor. Tüm argüman listeleri model kartının çalıştırma bölümünde bulunuyor:
- Animation (Move):
--retarget_flag --use_flux - Replacement (Mix):
--replace_flag --use_relighting_lora --iterations 3 --k 7 --w_len 1 --h_len 1
Model kartındaki örnek komutlara göre tek GPU kurulumlarında --refert_num 1 kullanılıyor. Kartta ayrıca şu uyarı yer alıyor: "Wan2.2 üzerinde eğitilmiş LoRA modellerinin kullanılmasını önermiyoruz." Üçüncü taraf LoRA'ların yaptığı ağırlık değişiklikleri, animasyon işlem hattında beklenmedik davranışlara yol açabiliyor.
ComfyUI ile kurulum ve çalıştırma
ComfyUI'nin yerel iş akışı, aşağıdaki model dosyalarının ilgili dizinlerde olmasını istiyor:
| Dosya | Dizin | Görevi |
|---|---|---|
Wan2_2-Animate-14B_fp8_e4m3fn_scaled_KJ.safetensors | diffusion_models/ | Kijai FP8 ana ağırlıkları |
umt5_xxl_fp8_e4m3fn_scaled.safetensors | text_encoders/ | UMT5 XXL metin kodlayıcı, FP8 |
clip_vision_h.safetensors | clip_visions/ | CLIP Vision kodlayıcısı |
wan_2.1_vae.safetensors | vae/ | Wan2.1 VAE |
lightx2v_I2V_14B_480p_cfg_step_distill_rank64_bf16.safetensors | loras/ | LightX2V 4 adımlı hızlandırma LoRA'sı |
Ek olarak iki custom node gerekiyor: ComfyUI-KJNodes ve iskelet ön işlemesi için DWPose Estimator sağlayan comfyui_controlnet_aux. İki pratik kısıt da var: Çıktı genişliği veya yüksekliği 16'ya tam bölünmeli. Temel üretim süresini aşan kliplerde her Video Extend düğümü 77 kare, yani yaklaşık 4,8 saniye ekliyor. Mix modunu etkinleştirmek için tüm bağlantıları koruyun; Move modunda ise background_video ve character_mask bağlantılarını çıktı alt grafik düğümünden ayırın.
Barındırılan API seçenekleri ve fiyatlar
Yerel kurulumla uğraşmak istemiyorsanız, Wan2.2 Animate'i kullandıkça öde modeliyle sunan birkaç sağlayıcı var. İlk bakışta oranlar yakın görünse de faturalandırma yöntemleri toplam maliyeti ciddi biçimde değiştirebiliyor:
| Sağlayıcı | 480p | 720p | Faturalandırma modeli | Süre sınırları |
|---|---|---|---|---|
| fal.ai | $0.04/sn | $0.08/sn | Kareler 16 fps seviyesine normalize edilir; yüksek FPS'li kaynak daha pahalıdır | — |
| WaveSpeed | $0.20 / 5 sn | $0.40 / 5 sn | Her çıktı çalıştırması için, 5 saniyelik kademeler | 5–120 sn |
| APIXO | $0.04/sn | $0.08/sn | Algılanan referans videosunun saniyesi başına | En az 5 sn, en fazla 120 sn |
| Replicate | — | — | 1.000 çıkarım saniyesi başına $3; çıktı süresi değil, hesaplama süresi | — |
WaveSpeed'in 5 saniyelik kademeleri aynı efektif orana denk geliyor: 480p'de $0.04/sn, 720p'de $0.08/sn. Bu nedenle fal.ai, WaveSpeed ve APIXO, görünen fiyat bakımından rekabetçi. Ancak önemli nokta, neyin ölçüldüğü. fal.ai kare sayısını 16 fps'e normalize ediyor; dolayısıyla 30 fps'lik bir hareket videosu, görünen oranın ima ettiğinden daha yüksek bir duvar saati saniyesi maliyeti yaratıyor. Replicate ise GPU çıkarım süresini ücretlendiriyor, çıktı uzunluğunu değil: Hesaplanması 40 saniye süren 10 saniyelik çıktı $0.12 tutar. Kullanmaya karar vermeden önce her endpoint'in hangi modları sunduğunu kontrol edin; yukarıdaki fal.ai URL'si özellikle Move/animation endpoint'ine yöneliyor.
Pratikte iyi çalışanlar ve sorun çıkaranlar
Modelin vitrin demoları oldukça cilalı görünse de topluluk deneyimleri, demo kalitesi ile ilk yerel denemede alınan sonuç arasında fark olabildiğini gösteriyor:
"sır ne, post-processing mi, frame interpolation mı" — u/Grand-Summer9946, r/comfyui
Bu tartışma ve resmi ön işleme rehberi temelinde, modelin güçlü olduğu ve zorlandığı noktalar şöyle:
İyi çalıştığı senaryolar: Görece sabit bir arka plan önünde hareket eden tek kişilik dans ve hareket aktarımı klipleri. Kaynak videoda yüz net görünüyorsa ve performans kameraya dönükse, yüz ifadesi canlandırma tarafı da güçlü sonuç veriyor.
Sorun çıkaran senaryolar:
- Birden fazla kişinin bulunduğu sahneler. Maske çıkarımı yalnızca tek kişilik videolar için tasarlanmış; yanlış pozu takip etmek sık rastlanan bir hata.
- Vücut oranı uyuşmazlığı. Karakter görseli ile hareket videosu arasındaki oran farkları, Mix modunda artefaktlara ve deformasyonlara neden olabiliyor.
- FPS uyuşmazlığı. Hareket videosunun FPS değeriyle iş akışı yapılandırması farklıysa takılma, ağır çekim veya yakınlaştırma artefaktları bekleyin.
- Maske ayrıntı seviyesi. Daha kaba bir maske arka planın daha fazlasını korur, fakat şekil sızıntısına yol açabilir. Daha ince maske üretimi sınırlar ve arka plan tutarsızlığı riski doğurur.
Ham çıktı, ön izleme ve konsept denemeleri için kullanılabilir düzeyde. Alıntılanan topluluk tartışmasında da belirtildiği gibi, prodüksiyon kalitesindeki sonuçlar için maskeleme, inpainting ve frame interpolation gibi ek işlemler gerekebilir.
Wan2.2 Animate, diğer Wan modelleri arasında nerede?
Wan model ailesi hızlı ilerliyor ve sürüm adları kafa karıştırabiliyor. Model kartına göre Wan2.2 Animate'in aile içindeki konumu şöyle:
| Model | Ne yapar? | Bu yazıyla ilişkisi |
|---|---|---|
| Wan2.2-Animate-14B | Karakter animasyonu ve oyuncu değiştirme, videodan videoya | Bu yazının konusu |
| Wan-Animate-2 | Topluluk tarafından bildirilen halef model | r/LocalLLaMA'da tartışıldı (2026) |
| Wan 2.7 Image Pro | Görsel üretimi ve düzenleme, video değil | Farklı ortam: sabit görseller |
| Wan 3 | Genel amaçlı metinden videoya / görüntüden videoya | Daha yeni genel video modeli; özel karakter animasyonu modu yok |
| Wan2.2-S2V-14B | Konuşmadan videoya, sesle yönlendirilen animasyon | Sesle yönlendirilen hareket için tamamlayıcı model |
Sık sorulan sorular
Wan2.2 Animate aynı anda birden fazla karakteri işleyebilir mi?
Hayır. Resmi ön işleme rehberi, maske çıkarımını tek kişilik videolar için tasarlıyor. Bu nedenle iki mod da çalıştırma başına tek karakteri destekliyor. Birden fazla kişi içeren girdiler başarısız olabilir veya model yanlış pozu takip edebilir. Birden fazla karakter için her birini ayrı işleyip sonradan kompozitlemeniz gerekir.
Hangi çözünürlükleri destekliyor?
Desteklenen iş akışı çözünürlükleri 480p ve 720p. Resmi ön işleme örneklerinde 1280×720 kullanılıyor. 720p üzeri için belgelenmiş bir destek bulunmadığından, daha yüksek çözünürlük ayrı bir upscale adımı gerektiriyor.
Çıktılar için hangi lisans geçerli?
Model kodu ve ağırlıkları Apache-2.0 lisansıyla sunuluyor. Wan-AI, üretilen içerik üzerinde hak iddia etmiyor; ancak kullanıcının yasalara uygun ve zarar vermeyen kullanımdan sorumlu olduğunu belirtiyor. Model kartı, yasa dışı içerik üretimini, savunmasız grupları hedef almayı ve kişisel verilerin kötü niyetle kullanılmasını yasaklıyor.
Wan2.2 Animate ses de üretiyor mu?
Hayır. Animate yalnızca video üretiyor. Konuşmadan dudak senkronu gibi sesle yönlendirilen animasyon gerekiyorsa, bunun için ayrı Wan2.2-S2V-14B modeli kullanılmalı. Wan2.2 model kartının güncelleme kaydına göre bu model, 5 Eylül 2025'te CosyVoice TTS desteği ekledi.
Kısaca: Sabit görselleri canlandırmak için Move, videodaki oyuncuyu değiştirmek için Mix kullanın. GPU'nuz ve ComfyUI deneyiminiz varsa yerel kurulum mantıklı; hız istiyorsanız barındırılan API'ler iyi bir alternatif. fal.ai, WaveSpeed ve APIXO'da fiyatlar $0.04–0.08/sn seviyesinde, ancak fal.ai'nin 16 fps normalizasyonunu ve Replicate'in hesaplama süresine dayalı ücretlendirmesini bütçenize dahil edin.