AIREITER

MiniMax H3 Prompt İncelemesi: Neler İşe Yarıyor, Neler Bozuluyor? (2026)

Son Güncelleme: 2026-08-24 05:41:53

MiniMax, H3 model kartında ön işleme katmanını “nihai çıktının kalitesi açısından kritik” olarak tanımlıyor. Öte yandan H3 prompt'ları üzerine 220 oy alan bir Reddit başlığı, anlamsızlaşan diyaloglarla ilgili adeta bir hata raporu. Bu MiniMax H3 prompt incelemesinde resmî formatı, kaynak gösterilen içerik üreticisi testleri ve arıza bildirimleriyle karşılaştırıyoruz: bu raporlarda kamera ve referans kontrolü, diyalog ve sese kıyasla daha güvenilir görünüyor. Hatta en iyi sonuçlar bazen sözdiziminden bilerek uzaklaşınca geliyor.

MiniMax H3 Prompt Formatı Aslında Ne?

Resmî MiniMax H3 prompt'u; integrated_multimodal_description, overall_soundscape ve non_diegetic_music adlı üç alandan oluşan yapılandırılmış bir belge. Zaman kodlu planlar, kalıcı konuşmacı kimlikleri ve <d> diyalog etiketleri içeriyor. Bunun nedeni, H3'ün normalde barındırılan bir ön işleyicinin ürettiği yapılandırılmış bir ara temsil beklemesi: H3-Context-IR. MiniMax bu katmanı açık ağırlık sürümüne dahil etmedi. Barındırılan API'de serbest yazılmış isteğinizi sistem sizin için yeniden yapılandırıyor; buna karşılık yerelde çalışan 33B açık ağırlıklar (SGLang, vLLM, Diffusers, ComfyUI), bu yapıyı elle yazmanızı gerektiriyor.

Hugging Face üzerinde MiniMax H3 resmî model kartı; sistem özeti ve modül yapısı gösteriliyor

MiniMax ayrıca resmî GitHub deposunda taşınabilir bir h3-prompt-writing becerisi sunuyor. Herhangi bir kodlama ajanının haricî API çağrısı olmadan okuyabileceği iki rehber dosyası var: base-en.txt ve ref-en.txt. İçerik üreticileri, doğal dille yazılmış brief'leri tam formata çevirmek için bunu Claude veya Cursor içinde çalıştırıyor. @AI__TSUBAKI, sinematik klipler için tam olarak bu iş akışını belgeliyor.

Her prompt'u sınırlayan teknik çerçeve

KısıtDeğerPrompt'a etkisi
Klip süresi4–15 saniye, 24 FPSZaman damgaları kesin biçimde artmalı ve toplam süre sınırları içinde kalmalı
Ses32 kHz stereo, görüntüyle birlikte üretiliyorSoundscape ve müzik alanları zorunlu; N/A kullanılabilir
ÇözünürlükVarsayılan 768p; H3-Regenerate-2K ile 2K (yalnızca API)Önce 768p'de test edin, prompt kesinleştikten sonra 2K için ödeme yapın
Görev türleriT2VA (metin), I2VA (0.00 sn'de ilk kare), FL2VA (ilk + son kare), L2VA (son kare), Ref2VA (çoklu referans)Her türün kendine ait bir hizalama cümlesi var
Referans sınırları9 görsel + 3 video klip + 3 ses klibi; toplam 12 dosya, medya türü başına toplam ≤15 snDaha fazla referans daha fazla yönlendirme demektir; her zaman daha iyi sonuç vermez
Prompt boyutuResmî örnekler 300–700 kelime; yalnızca metinden videoya isteklerde üst sınır yaklaşık 7.000 karakterReferanssız kısa prompt'lar, resmî kılavuzun işaret ettiği hata senaryolarından biri

Üç alan, tek kamera yönergesi, tırnak içindeki diyaloğa sahip kadraj içi bir konuşmacı ve müziksiz bir yapı içeren asgari tam prompt, on satıra sığabiliyor:

integrated_multimodal_description: Cinematic, live-action. [Shot 1] A woman in her
late twenties sits on a sunlit sofa, a matte-green skincare bottle in hand. The
camera pushes in, small amplitude, slow speed. She is visible on screen and says:
"This is the one product I repurchase every year." At 00:05.500 she sets the
bottle down.
overall_soundscape: Quiet room tone, faint traffic outside, soft fabric movement,
gentle contact of the bottle on the table.
non_diegetic_music: N/A

Tüm alanların sözdizimi, etiketler, hizalama cümleleri ve şablonlar için MiniMax H3 prompt rehberimize bakabilirsiniz. Bu incelemenin odağı ise bu formatın harcanan çabaya değip değmediği.

Resmî Formatın Üç Temel Vaadi Ne Kadar Gerçekçi?

Resmî rehber, açıkça söylemese de üç temel vaatte bulunuyor. Kaynak gösterilen raporlar ilk iki konuda daha olumlu; ses talimatlarına uyum ise belirgin biçimde daha sorunlu.

Vaat 1: “Yapı, beklediğiniz sonucu getirir”

Kanıtların en güçlü olduğu başlık bu. X kullanıcısı @AIWarper, resmî yapıya geçtikten sonra yaptığı önce/sonra karşılaştırmasını paylaştı:

“MiniMax'ın yayımladığı prompt rehberine uymanızı ŞİDDETLE tavsiye ediyorum. Tam olarak beklediğiniz sonucu almakta gerçekten çok yardımcı oluyor.... Son paylaşımım önerilen prompt yapısını izlemiyordu.” — @AIWarper, 306 beğeni

Üçüncü taraf test günlüğü de ayrıntı düzeyinde aynı örüntüyü gösteriyor: tam 00:05.000'de kesme istedi ve bunu aldı; yazılı bir tanıtım metnini kelimesi kelimesine seslendirdi; ilk kare kompozisyonunu 6 saniyelik bir I2VA klibi boyunca sabit tuttu. Storyboard raporları da benzer. @aimikoda'nın panoları sıralı plan yönergeleri olarak izleniyor. @nanyuan0412'nın storyboard'u da doğaçlama olmadan takip edildi; yalnızca yazmayı unuttukları ses alanları neredeyse sessizlik olarak çıktı.

Tekrarlayan sınırlama, talimatın reddedilmesi değil tempo. u/Relevant_One_2261 şöyle yazıyor: “En büyük sorun tempo oldu.” Süreye sığmayan diyaloglar ve birbirine fazla yakın zaman damgaları, tekrar eden yapısal hata kaynakları.

Vaat 2: “Kamera komutları, sonuç tariflerinden daha etkili”

Bu vaat, çözüme kavuşmuş bir kadraj sorunuyla doğrulanıyor. r/StableDiffusion'da bir kullanıcı, yürüyen karakterin tüm vücudunu kadrajda tutmak için yalnızca “entire subject remains visible throughout” talimatını verdi; H3 bunu defalarca yerine getiremedi. Çözüm, hedeflenen sonucu H3'ün kendi kamera diline çevirmek oldu:

“Kamera, karakter ileri yürürken onunla aynı hızda ve büyük genlikle geriye açılır; tam boy kompozisyon korunur.” — u/Powerful-Goal52, orijinal gönderi sahibi tarafından çalıştığı doğrulandı

Bu yaklaşım doğrudan H3'ün üç kamera boyutuna karşılık geliyor: hareket türü, genlik ve hız. Ayrıca model her plan için tek kamera talimatı bekliyor. Kısa bir dönüşüm tablosu şöyle:

İstenen sonuçH3'ün izlediği komut
Yürürken karakterin tamamı görünür kalsınKarakterin yürüme hızında, büyük genlikle Pull Out
Kadrajı bozmadan hafif vurguKüçük genlikte, yavaş Push In
Sabit duran karakterin çevresini ortaya çıkarmaOrta genlikte Truck Left veya Truck Right
Tilt olmadan yükseklik değişimiYavaş hızda Pedestal Up / Pedestal Down

Resmî prompt rehberi; Zoom, Push, Pull, Pan, Tilt, Truck, Pedestal, Arc, Tracking, Static, Shake, Roll ve POV olmak üzere 13 hareket türü ailesi tanımlıyor. Her biri genlik ve hızla değiştirilebiliyor. Zoom'un odak uzaklığını değiştirmesi, push'ın ise kameranın fiziksel hareketi olması pratikte önemli; bu iki terim birbirinin yerine kullanılamaz.

Vaat 3: “Ses alanlarını ayırırsanız sonuç temiz kalır”

En zayıf katman burası. Diegetik ortam sesini non-diegetik müzikten ayırmak doğru bir tasarım tercihi, fakat talimatlara uyum tutarsız:

“Bunu kullanıyorum ama zamanın yaklaşık %20'sinde yine de müzik ekliyor lol” — u/TheElectriking, non_diegetic_music: N/A hakkında

Alıntının geldiği 220 oy alan başlık, sorunun diğer yönlerini de sıralıyor: klip sınırlarında ses artefaktları, rastgele anlamsız sözler söyleyen karakterler ve repliği yanlış kişinin seslendirmesi. u/krigeta1, üç özel ses referansı verip “rastgele bir ses veya karakterlere atadığım sesin hiç kullanılmadığını” bildiriyor. Başka bir başlıkta ise, ekranda görünen diyaloğun sürekli ekran dışından okunması sorunu; konuşmacı kimliğinin görünür karaktere açıkça bağlanmasıyla çözülmüş.

Ekran üzerindeki metin de aynı derecede kırılgan. Topluluk wiki'si, bunu “exact text is fragile” diye özetliyor; marka açısından kritik yazıların görsel referans olarak verilmesini veya sonradan compositing ile eklenmesini öneriyor. Karşı görüş bildiren bir rapor da var: @web4miko, kendi testlerinde H3'ün metin ve bağlam anlayışında “Seedance 2.0'ı bile geçemediğini” söylüyor. Kaynak gösterilen raporlarda ses yönlendirme, tam metin üretimi ve yoğun bağlam, tekrar eden zayıf noktalar.

Resmî Sözdiziminden Ne Zaman Sapmalı?

Kaynak gösterilen yan yana karşılaştırmalarda ve ilk elden raporlarda resmî formattan üç sapma öne çıkıyor. Tam yapıya bağlanmadan önce bunların üçünü de bilmekte fayda var.

Bazen tırnak işaretleri <d> etiketlerinden daha iyi sonuç veriyor. r/StableDiffusion'da yayımlanan bir yan yana karşılaştırmada (yaklaşık 105 oy, 81 yorum), gönderi sahibi rehberdeki <d>[Language]...台词...</d> etiketlerini kaldırıp düz tırnak içi diyalog kullandığında temiz konuşma elde ettiğini belirtti. Etiketli biçim ise istenmeyen sesler ekledi. Benzer testler yapan bir yorumcu da aynı fikirde:

“resmî diyalog prompt sistemi aşırı sorunlu... tırnak yaklaşımı da kusursuz değil ama <d></d> etiketlemesi kadar problemli değil.” — u/networking_noob

Pratikte şu yaklaşım mantıklı: Eğitimdeki temel yol olduğu için önce <d> kullanın. Ancak konuşma bozuluyor veya gereğinden fazla üretiliyorsa, tüm prompt'u yeniden yazmak yerine aynı repliği tırnak içinde tekrar deneyin.

non_diegetic_music: N/A, tek başına etkili bir kontrol. u/Nextil, “yapının geri kalanının çoğunu görmezden gelseniz bile” bunun müziği engellediğini bildiriyor. Başka hiçbir yapılandırılmış işlem yapmayacaksanız bile bunu uygulayın; istenmeyen müzik, kaynak gösterilen raporlardaki tekrar eden şikâyetlerden biri.

Referans ağırlıklı işlerde daha fazla değil, daha az metin gerekir. Kimliği görseller, hareketi ise video taşıyorsa prompt'un görevi yalnızca yönlendirme ve yeni aksiyonu tanımlamak olur. @aimikoda'nın en çok paylaşılan şablonları — bunlardan biri 1.300'den fazla yer işareti aldı — tam da bu nedenle minimal. @CharaspowerAI ise MiniMax'ın kendi Design ajanının “act as an expert FPV director and turn this into something viral” şeklindeki tek satırı otomatik olarak tam yapılandırılmış bir prompt'a dönüştürdüğünü gösterdi. Örnek bir referans yönlendirme bloğu şöyle:

@Image 1 is the character reference: preserve the face, short black hair, red silk jacket.
@Video 1 supplies the sword-draw rhythm.
@Audio 1 sets the mood with quiet traditional strings.

Bundan sonra prompt yalnızca yeni planı anlatmalı. Bu raporlardaki pratik iş akışı şu: önce sabit görselleri oturtun, yükü referanslara bırakın ve yalnızca değişen unsurlar için metin harcayın.

Kılavuzun Çözmediği Hatalar İçin Hızlı Teşhis

Resmî prompt rehberi sözdiziminde bitiyor; üretim bozuk döndüğünde ne yapmanız gerektiğini anlatmıyor. Aşağıdaki tablo, yukarıdaki hata raporlarından derlendi:

BelirtiOlası nedenÇözüm
N/A olmasına rağmen müzik eklenmesiBir kullanıcı, üretimlerinin yaklaşık %20'sinde sızıntı gözlemlediYeniden üretin; prompt'un hiçbir yerinde müzikal bir “mood” istemeyin
Repliği yanlış karakterin söylemesiKonuşmacı-ses yönlendirme çakışmasıKonuşmacı kimliğini, ekranda görünen karaktere açıkça bağlayın
Ekrandaki repliğin ekran dışı ses olarak okunmasıDudak senkronu ilişkisinin eksik olmasıKonuşmacının görünür olduğunu belirtin; gerçek bir voice-over için “lips remain closed” ekleyin
Ses referansının görmezden gelinmesi3 klip / 15 saniye sınırının aşılması veya referansa rol atanmamasıHer klibe bir rol verin; toplam referans sesini kısaltın
Yerel modelin Çince diyaloğu yok saymasıComfyUI, Qwen tokenizer'ını yeniden kullandı; shell kodlaması metni bozduDepodaki tokenizer'ı kullanın (resmî gereklilik) + Unicode güvenli gönderim + <d>[Chinese] 台词</d> (topluluk tarafından bildirilen çözüm)
Uzun tek planın (>15 sn) dağılması4–15 sn tasarım aralığının dışında kalması; nesneler düzleşiyor, devamlılık kayıyor15 saniyelik parçalara bölün ve aralarındaki devamlılığı planlayın

Yerel kurulum satırı özellikle önemli. @eternityspring'in raporunda “H3 Çince konuşmuyor” sorununun kaynağı prompt değil, tokenizer'ın yeniden kullanılması ve karakter kodlamasıydı.

Maliyeti: Token, Deneme Sayısı ve Taşınabilirlik

Yapılandırmanın bedeli var. Resmî depo, üç tekrarlanabilir senaryo için Context-IR token kullanımını yayımlıyor ve referans sayısı arttıkça rakamlar keskin biçimde yükseliyor:

H3 Context-IR token kullanımını gösteren çubuk grafik: T2VA 8.565 token, I2VA 22.822 token, Ref2VA 39.299 token

Yalnızca metinden oluşan bir üretim 8.565 ön işleme token'ı tüketiyor. Çok modlu referans işi ise bunun 33.323'ü prompt tarafında olmak üzere 39.299 token'a çıkıyor. Yerel çalıştırmalarda bu token'lar ön işleme gecikmesi ekliyor; barındırılan iş akışlarında ise fiyat üretim saniyesi üzerinden verilse bile işlem yükü yaratıyor. Zaman maliyeti de gerçek: X'te bir içerik üreticisi, üç kişilik ve yörüngesel kamera hareketi içeren tek bir prompt'u sonuç alıncaya kadar 48 saat boyunca geliştirdiğini belgeliyor (@LoveUolanda). Ekonomik deneme yöntemi şu: 6 saniyelik bir testin yaklaşık $0.68 tuttuğu 768p'de taslak hazırlayın; prompt kesinleştiğinde 2K'ya geçin. Aracının model sayfasında MiniMax H3 için $0.1125/s 768p ve $0.1825/s 2K ücretleri listeleniyor.

Son gizli maliyet taşınabilirlik. H3'ün alanları, konuşmacı kimlikleri ve etiketleri bir standart değil, kendine özgü bir lehçe. Modeller arası bir rehber, Veo 3.1'in satır içi SFX: etiketleriyle düz paragraflar istediğini, Seedance 2.0'ın ise altı bölümlü bir açıklama kullandığını gösteriyor. İkisi de H3'ün alanlarını, konuşmacı kimliklerini veya etiketlerini kabul etmiyor. H3 için oluşturduğunuz prompt kütüphanesi, başka bir yerde kopyala-yapıştırla çalışmaz; yeniden yazılması gerekir.

MiniMax H3 Prompt İncelemesi: Sık Sorulan Sorular

Yapılandırılmış prompt formatı MiniMax H3 için zorunlu mu?

Hayır. Barındırılan API'de Context-IR, serbest yazılmış doğal dil isteklerini dahili temsile dönüştürüyor. Yapı; özellikle yerelde çalışan açık ağırlıklarda ve kesin kesmeler, zaman damgaları ile konuşmacı yönlendirmesi gereken işlerde önem kazanıyor.

MiniMax H3'ün arka plan müziği eklemesini nasıl engellerim?

Prompt'u non_diegetic_music: N/A ile bitirin ve başka hiçbir yerde müzikal bir atmosfer istemeyin. Yine de sızıntı yaşanabilir; yeniden üretim yapmak normaldir.

MiniMax H3 prompt'u ne kadar uzun olmalı?

MiniMax'ın kendi örnekleri 300–700 kelime uzunluğunda ve yalnızca metinden videoya istekler yaklaşık 7.000 karakteri kabul ediyor. Kimlik ve hareketi referanslar taşıyorsa prompt uzamak yerine kısalmalı.

H3 prompt'larını Seedance veya Veo'da yeniden kullanabilir miyim?

Hayır. H3'ün adlandırılmış alanları, konuşmacı kimlikleri ve etiketleri modele özel. Seedance altı bölümlü bir format kullanırken Veo düz paragraflar alıyor; bu nedenle her hedef model için prompt'un ayrı sürümü gerekiyor.

Yerel H3 kurulumum neden İngilizce dışındaki diyalogları yok sayıyor?

Sorun çoğunlukla modelde değil, araç zincirinde. Qwen tokenizer'ını yeniden kullanan kurulumlar veya Unicode'u bozan shell ortamları, diyaloğu üretim aşamasına gelmeden bozuyor. Deponun resmî tokenizer'ını ve <d>[Language] diyalog formatını kullanın.

Sonuç: Bu Formatı Kimler Öğrenmeli?

İşinizKarar
Diyalog içeren çok planlı filmTam formatı öğrenin; ses için tekrar denemelere ve tırnak içi diyalog alternatife bütçe ayırın
Ürün / sabit görsel animasyonu (I2VA)Hafif sürümü öğrenin: hizalama cümlesi + hareket + ses alanları
Storyboard veya karakter tutarlılığı odaklı seriEvet — referanslar asıl yükü taşır; prompt'ları kısa ve yönlendirilebilir tutun
Tek seferlik kısa klipler, gündelik kullanımBüyük kısmını atlayın: düz açıklama + non_diegetic_music: N/A yeterli olur
Tek bir modeller arası prompt kütüphanesi oluşturmakHayır — her modelin lehçesi için ayrı sürüm gerekir; model bazında yazın

Çok planlı, zaman damgalı veya referans odaklı işler için formatı öğrenin; uyumun belgelendiği ve tekrarlanabildiği alan burası. Tek seferlik kliplerde ise bu kadar ayrıntıya girmeyin; yoğun diyaloglu seslerde itaat beklemek yerine tekrar denemeleri hesaba katın.

Topluluk da bu alışverişin iki ucuna bölünmüş durumda: aynı ay içinde hem 48 saat süren bir kamera prompt'u uğraşı hem de bir yorumcunun “kılavuzu okumak gerçekten heyecan vericiydi” dediği 880 oy alan bir gönderi ortaya çıktı. Modelin ses alanlarına uyumu kamera talimatlarına uyum seviyesine ulaşana kadar en mantıklı yaklaşım şu: yapıyı bir ajana taslak olarak hazırlatın, ses alanlarını kendiniz kontrol edin ve 2K'ya geçmeden önce 768p'de düşük maliyetle test yapın.