AIREITER

MiniMax H3 Prompt Rehberi: Resmî Sözdizimi, Şablonlar ve Sorun Giderme

Son Güncelleme: 2026-08-17 06:58:09

Tek satırlık bir “sinematik” tanım, modelin dolduracağı sayısız boşluk bırakır. Kamera talimatını atladığınızda sabit kadrajla karşılaşabilirsiniz; ses alanlarını tanımsız bıraktığınızda ise istemediğiniz konuşmalar devreye girebilir. MiniMax H3 için etkili prompt yazımı, kısa bir çekim senaryosu hazırlamaya daha çok benzer. Resmî dokümanlar; plan zaman damgaları, tutarlı konuşmacı kimlikleri ve ayrı iki ses alanından oluşan sabit bir yapı tanımlar. Üstelik tüm senaryo, sağlayıcıya göre değişmekle birlikte yaklaşık 7.000 karakterlik prompt sınırına ve 15 saniyelik klip tavanına sığmalıdır.

minimax.io üzerindeki MiniMax H3 resmî duyuru sayfası

Önce Doğru H3 Prompt Biçimini Seçin: İki Rehber, Dört Mod

MiniMax, Hugging Face üzerindeki MiniMax-H3 deposunda iki ayrı prompt yazım rehberi yayımlıyor. Bunlar farklı iş akışlarına hitap ediyor. Temel rehber, yüklenmiş referans kullanılmayan dört üretim görevini ele alıyor. Yüklediğiniz bir görsel, video ya da ses klibi üretime dahil olduğunda ise referans rehberi devreye giriyor. Temel rehberdeki dört görev şu modlara karşılık geliyor:

ModGirdiPromptta gereken hizalama talimatı
T2VAYalnızca metinYok; doğrudan temel alanlarla başlayın
I2VATek ilk-kare görseli"Picture 1 is fully referenced at 0.00 seconds and belongs to [Shot 1]"
FL2VAİlk kare + son karePicture 1 0.00 saniyede, Picture 2 ise tam bitiş anında
L2VATek son-kare görseliPicture 1 videonun bitiş zamanıyla ve son planla hizalanır

Her iki rehber de uygulanmış örneklerle bitiyor. MiniMax lansman yazısı da modeli aynı çerçevede anlatıyor: Menüden görev seçmek yerine metin, görsel, video ve ses girdileri arasındaki ilişkiyi tarif ediyorsunuz. Barındırılan uç noktalar bunu üç iş akışına indirger: fal üzerinde minimax/h3/text-to-video, image-to-video ve reference-to-video. Ancak alttaki prompt yapısı değişmez.

Hugging Face üzerindeki resmî MiniMax H3 temel prompt yazım rehberi

Temel Prompt Yapısı: Alan Alan İnceleme

Temel moddaki bir MiniMax H3 promptunda, hizalama talimatından sonra boş satırlarla ayrılan tam üç zorunlu alan bulunur. İskelet yapı şöyledir:

[alignment instruction if I2VA/FL2VA/L2VA]

integrated_multimodal_description: [Shot 1] ...

overall_soundscape: ...

non_diegetic_music: ...
  • integrated_multimodal_description, zaman akışını taşır: görsel stil, kompozisyon, eylemler, plan değişimleri, konuşmacılar, diyaloglar ve diegetik sesler; yani görüntüde görülen veya sahne içinde duyulan her şey.
  • overall_soundscape, diyalog içermeden ortamı ve fiziksel sesleri tek paragrafta 1–4 cümleyle özetler.
  • non_diegetic_music, yalnızca izleyicinin duyduğu müziği 1–3 cümleyle açıklar. Müzik yoksa N/A yazılır.

Resmî rehberdeki T2VA örneğinden uyarlanan, gün doğumundan önceki fırın sahnesi şöyle görünüyor:

integrated_multimodal_description: [Shot 1] Live-action, cinematic. A medium-wide
shot of a small bakery interior before sunrise; warm tungsten light, flour dust in
the air. A middle-aged baker (S1), grey apron, rolled sleeves, lifts the security
shutter. The camera pushes in with small amplitude at slow speed as he places
fresh bread on a wooden counter. (S1) says in a warm, mid-pitch voice <d>[English]
First batch of the day.</d> At 00:05.000, the camera cuts to a close-up of his
hands slicing a loaf; (S1)'s words carry over from the previous shot, <scenetrans>
continuing seamlessly across the cut.

overall_soundscape: The rattling shutter, metal trays set down on stone, a doorbell
chime, footsteps on tile, and the crusty sound of a knife slicing bread.

non_diegetic_music: Acoustic guitar and upright bass at a slow tempo, gentle
dynamics fading out before the final shot.

Resmî kurallara göre her satırın denetlediği unsur:

Prompt ögesiDenetlediği unsurKural
[Shot 1] Live-action, cinematic.Genel stilStil etiketi Shot 1 ile açılır; rehberdeki örnekler arasında Cinematic, live-action, 2D-animated, 3D CG, claymation, watercolor, vintage film yer alır
A middle-aged baker (S1), grey apron, rolled sleevesKonuşmacı kimliğiKimlik nitelikleri ID’den önce gelir; ID tüm planlarda aynı kalır
The camera pushes in with small amplitude at slow speedKameraHareket türü + genlik + hız, doğal bir eylem cümlesi olarak yazılır
<d>[English] First batch of the day.</d>DiyalogDil etiketi ve yalnızca birebir söylenecek sözler kullanılır; çevrilmez
At 00:05.000, the camera cuts to...Kesme zamanıZamanlar kesin biçimde artmalıdır; [Shot 1] için zaman damgası yazılmaz
<scenetrans> continuing seamlessly across the cutSes sürekliliğiKesme boyunca devam eden diyaloğu, iki bağlantı noktasında işaretler

Planlar, Kesimler ve Kamera Hareketleri

MiniMax H3’te plan sözdizimi konuma bağlıdır. [Shot 1] hiçbir zaman zaman damgası almaz; sonraki her plan ise At 00:03.500, gibi kesin biçimde artan bir kesme zamanı ile başlar. Onaylı kesme ifadeleri kısa tutulur: “the camera cuts to”, “the shot transitions to”, “the shot switches to”. Cross-dissolve, fade ve wipe gibi geçişleri ise yalnızca özellikle istiyorsanız kullanmalısınız. Kadrajda küçük bir değişiklik varsa rehber, kesme yerine kamera hareketi kullanılmasını öneriyor. Çünkü kesme; yeni bir özne, mekân, durum veya zaman bilgisi getirmelidir.

Kamera hareketini, en fazla üç boyut içeren doğal bir İngilizce eylem olarak yazın: hareket türü, genlik ve hız.

BoyutKabul edilen ifadeler
Hareket türüZoom In/Out, Push In/Pull Out, Pan Left/Right, Truck Left/Right, Tilt Up/Down, Pedestal Up/Down, Arc Shot, Tracking Shot, Static Shot, Shake Slightly/Strongly, POV, Roll Clockwise/Counterclockwise
Genlik"with small amplitude", "with large amplitude"
Hız"at slow speed", "at fast speed"

Orta genlik ve normal hız, varsayılan kabul edildiği için yazılmaz. “Zoom In” ile “Push In” arasındaki fark da önemlidir: Zoom In, sabit kamera konumundan odak uzaklığını değiştirir; Push In ise kamerayı fiziksel olarak öne taşır. Rehber bu ayrımı bilerek korur.

Diyalog Yazımı ve Konuşmacı Etiketleri

MiniMax H3 promptundaki her konuşan karakter, (S1), (S2) ya da eş zamanlı konuşma için (S1,S2) gibi sabit bir ID alır ve bu ID tüm planlarda korunur. Hiç konuşmayan karakterlere ID verilmez. Bir konuşmacının ilk görünümünde tutarlı üretim için yeterli kimlik bilgisi tanımlanmalıdır: ekranda ya da ekran dışında olması, yaş aralığı, cinsiyet, ses perdesi, tını, konuşma hızı ve aksan.

Tek bir diyalog satırının doğru yapısı şöyledir:

A woman in her 30s (S2), on-screen, mid-pitch voice, says with quiet anger
<d>[English] You promised me the 15th.</d>

Dört belgeli kural, sık görülen hataları önler. Kimlik, eylem ve söyleyiş biçimi <d> etiketinin dışında kalır; etiketin içine yalnızca dil etiketi ve noktalaması korunmuş birebir sözler girer. Seslendirme için doğrudan “says in an off-screen voiceover” ifadesi kullanılmalı, hemen ardından ekrandaki karakterin dudaklarının kapalı kaldığı belirtilmelidir. Kesme boyunca süren diyalogda, iki bağlantı noktasında da <scenetrans> ve “continues seamlessly across the cut” veya “carries over from the previous shot” gibi bir süreklilik ifadesi bulunmalıdır. Video bitmeden kesilen konuşmalar içinse <cutoff> kullanılır.

Tırnak işaretlerinin yalnızca tek bir görevi vardır: Videoda görünür olan her metin; afiş, tabela, etiket, neon ya da altyazı, İngilizce çift tırnak içinde, birebir ve çevrilmeden yazılır. Konuşulan diyaloğu tırnak içine almak, H3’ün bunu ses yerine gömülü altyazı olarak üretmesine yol açan belgelenmiş bir hatadır.

İki Ayrı Ses Alanı Ne İşe Yarıyor?

MiniMax lansman yazısına göre H3’ün tüm ses çıktısı videoyla birlikte üretilen yerel stereo sestir. Bu nedenle ses, açıklamaya serpiştirilmiş sıfatlarla değil, iki ayrı alanla yönetilir. overall_soundscape, rüzgâr, yağmur, trafik, adımlar, kumaş hareketi, çarpma, nefes ve kahkaha gibi ortam ile fiziksel sesleri 1–4 cümlede kapsar. Tam sessizlik isteniyorsa N/A kullanılır. non_diegetic_music ise karakterlerin duymadığı fon müziğini; enstrümantasyon, tempo, ritim ve dinamik değişimlerle tanımlar. “Epic” veya “emotional” gibi soyut ruh hâli ifadeleri açıkça önerilmez. Müzik istemiyorsanız doğru değer yine N/A olur.

Şarkı söyleme, sahne içindeki radyo ya da sokak müzisyeni gibi diegetik sesler bu iki alana yazılmaz. Bunların yeri, zaman çizelgesinin bulunduğu integrated_multimodal_description alanıdır. Bu ayrım yalnızca biçimsel değil: APIMODELS rehberi, güvenilir sonuçlar için açık ses kısıtlarının gerekli olduğunu belirtiyor. non_diegetic_music alanını tanımsız bırakmak, hiç istemediğiniz müziğin eklenmesine neden olabilir.

Referans Promptları: Etiketleme ve Koruma Kuralları

Yüklenen varlıklar üretimi yönlendirdiği anda referans rehberi kullanılmalıdır. Bu rehber, sabit sırada altı bölüm ister: subject_definitions, summary, retention_analysis, detailed_description, overall_soundscape, non_diegetic_music. Üretim görevlerinde detailed_description bölümü normalde 350–500 İngilizce kelime uzunluğundadır. Diyaloğun yoğun olduğu promptlarda ise kelime sayısı esnetilse bile konuşmanın tüm zaman akışı sığmalıdır.

Dört etiket türü temel işi üstlenir:

EtiketKullanım amacı
<Subject N>Çıktıda gerçekten kullanılan görünür içerik: herhangi bir varlıktan soyutlanan kişi, ürün, sahne, kıyafet, stil veya eylem
<Picture N>Somut kare bağlantısı oluşturan görsel: ilk kare, ana kare, son kare veya kompozisyon dayanağı
<Video N>Tüm videoya yönelik ilişki: kurgu kaynağı, devam noktası, kamera ya da kesme yapısı, ritim
<Audio N>Kopyalanan veya referans alınan ses sinyali: ses tınısı, şarkı sözleri, ritimler, ses efektleri

Numaralandırma her tür için bağımsızdır. Bu nedenle yüklenen tek bir video <Video 1>, onun ses parçası ise <Audio 2> olabilir. Konuşan bir özne, etiket ve konuşmacı ID’sini birleştirir: <Subject 3> (S1).

summary bölümü, [reference generation] veya [video editing + audio reuse] gibi köşeli parantezli bir görev önekiyle açılır. Video düzenleme talebinde başlangıç mutlaka “The target video is an edited version of <Video 1>.” olmalıdır. Ardından retention_analysis, her etiket için bir koruma işareti atar: görsellerde fully_preserved, partially_preserved, attribute_transfer veya weak_reference; seslerde fully_copy, partially_copy, reference ya da weak_reference. Yüzün korunurken kıyafetin değişebilmesini H3’e bu işaretlerle anlatırsınız.

Belgelenmiş sırayı izleyen en temel referans modu iskeleti:

subject_definitions:
<Subject 1>: the woman from Picture 1, long blonde hair, light-pink shirt
<Picture 1>: first frame of [Shot 1], café window seat
<Audio 1>: voice-timbre reference for <Subject 1> (S1)

summary: [reference generation + audio reference] One short paragraph naming the
task, the target video, and each reference relationship.

retention_analysis:
<Subject 1> (appears in [Shot 1], [Shot 2]): fully_preserved, same face, hair, outfit
<Picture 1> ([Shot 1] first frame): fully_preserved
<Audio 1> (S1 voice): reference, timbre only, no copied words

detailed_description: [1–2 style sentences.] [Shot 1] ... [350–500 words, dialogue
in <d> tags, <scenetrans> across cuts]

overall_soundscape: [Ambience and physical sounds.]

non_diegetic_music: N/A

H3 Beklenmedik Davrandığında: Belirtiye Göre Çözüm Tablosu

BelirtiMuhtemel prompt nedeniÇözüm
Anlamsız sesler veya uydurma “Sims dili”Yapılandırılmamış diyalog, konuşmacı ID’sinin olmaması ya da konuşmayan karakterlerin tanımlanmaması(S1)/(S2) ID’leri ekleyin, birebir sözleri <d>[Language] ...</d> içine alın ve sessiz karakterlerin konuşmadığını açıkça belirtin
Diyalogda gömülü altyazılarKonuşulan sözlerin tırnak işaretiyle yazılmasıTırnak işaretlerini yalnızca ekranda görülen metin için kullanın; diyaloğu <d> etiketlerine taşıyın
Diyaloğun yanlış karaktere atanmasıKonuşmacı ID’sinin tanımlanmış bir kişiye bağlanmamasıİlk görünümde konuşmacının kimlik özelliklerini verin: yaş, ekranda olma durumu ve ses; ID’yi planlar boyunca sabit tutun
İstenmeyen fon müziği veya müziknon_diegetic_music alanının belirsiz bırakılması ya da atlanmasıMüzik istemiyorsanız non_diegetic_music: N/A yazın; topluluk başlıkları bunu istenmeyen sesi kesen çözümlerden biri olarak gösteriyor
Planlanmamış kesmelerSahne değişimlerinin zaman damgası olmadan kesme ima etmesiAçık kesme ifadeleriyle [Shot N] At 00:03.500 kullanın; tek planlı çekimler için “no cuts” ifadesini isteyin
Yüz, kıyafet veya ürünün tutarsızlaşmasıReferansın rolünün hiç tanımlanmamış olmasıİlgili etiket için fully_preserved içeren bir retention_analysis satırı ekleyin ve etiketi her görünümde tekrarlayın

Anlamsız ses ve altyazı satırları doğrudan resmî sözdizimi kurallarından geliyor. r/StableDiffusion üzerindeki topluluk başlıkları da aynı çözümlerin pratikte işe yaradığını bağımsız olarak bildiriyor. İstenmeyen sesleri engellemek için en çok anılan yöntemlerden biri de non_diegetic_music: N/A.

Sınırlar ve Prompt Testinin Maliyeti

Prompt uzunluğu sınırlı, her deneme de ücretli olduğu için üretim sınırlarını bilmek önemlidir. Resmî API ve barındırılan sağlayıcılarda belgelenen limitler şöyle:

ParametreDeğerNot
Klip süresi15 saniyeye kadar, tam saniyefal/EvoLink uç noktalarında minimum 5 saniye; bazı V2 API dokümanlarında 4 saniye yazıyor
Çözünürlük768p ve 2K, 24 FPSMiniMax’a göre varsayılan çıktı çözünürlüğü 2K
Referans dosyalarıEn fazla 9 görsel, 3 video, 3 sesToplam 12 dosya; ses hiçbir zaman tek referans olamaz
Prompt uzunluğu~7.000 karakterfal ve V2 API dokümanları; APIMODELS 20.480 belirtiyor — sağlayıcınızı kontrol edin
En-boy oranları21:9, 16:9, 4:3, 1:1, 3:4, 9:16, adaptiveImage-to-video, giriş görselinin oranını izler

Fiyatlar sağlayıcıya göre değişir; bu rakamları liste fiyatı değil, tarihli anlık görüntüler olarak değerlendirin. fal üzerinde 2K üretim, 1 Ağustos tarihli fiyat görüntüsünde saniye başına $0.26 seviyesindeydi: 5 saniye için $1.30, 15 saniye için $3.90. İlk beş referans görsel ücretsiz, ek görseller ise adet başına $0.08. APIMODELS tarafında H3, saniye başına $0.088 ile çalışıyor; 15 saniyelik bir klip $1.32 tutuyor ve yalnızca başarılı istekler ücretlendiriliyor. Aynı pazar yerindeki saniye başı fiyatlarla karşılaştırma için:

APIMODELS üzerinde saniye başına video üretim fiyat karşılaştırması, Ağustos 2026

Asıl bütçe kalemi tekrar denemeleridir. İkinci denemede sonuç veren yapılandırılmış 15 saniyelik bir diyalog promptu APIMODELS üzerinde $2.64 tutar. Kullanılabilir tek çekim için beş deneme gerektiren yapılandırılmamış bir prompt ise $6.60’a çıkar. Barındırılan bir H3 uç noktasında prompt denemeleri yapmak için AIReiter'ın MiniMax H3 API sayfası, modeli güncel fiyatlarıyla birlikte sunuyor.

Kopyalayıp Başlayabileceğiniz Şablonlar

İki temel iskelet, kısa formatlı işlerin çoğunu karşılar. Köşeli parantezleri doldurun; alan adlarını ve boş satırları aynen koruyun:

integrated_multimodal_description: [Shot 1] [style label]. [Composition and
subject with 1–2 identity details]. [One primary action with physically
plausible pacing]. The camera [motion type] with [amplitude] at [speed].
[Character description] (S1) says in [voice description] <d>[Language]
[exact line]</d>. At [MM:SS.mmm], the camera cuts to [new subject or space],
[continuity phrase if dialogue crosses the cut].

overall_soundscape: [Ambience + physical action sounds, 1–4 sentences.]

non_diegetic_music: [Instrumentation, tempo, dynamics] or N/A
Picture 1 is fully referenced at 0.00 seconds and belongs to [Shot 1].

integrated_multimodal_description: [Shot 1] [Style consistent with Picture 1].
The scene, subject, colors, and spatial relationships of Picture 1 remain
consistent. [Action developing forward from the first frame → result or
reaction]. The camera [motion type] with [amplitude] at [speed].

overall_soundscape: [Ambience and action sounds grounded in the image.]

non_diegetic_music: N/A

Boş şablon yerine denenmiş promptlar arıyorsanız, kaynak bağlantılarını koruyan üç kütüphane öne çıkıyor. ecomimagelab/awesome-minimax-h3-prompts, 58 prompt içeriyor: 39’u resmî, 19’u topluluk tarafından test edilmiş. Her prompt, indirilebilir sonuç videosuyla birlikte sunuluyor ve temel kural şu: “No video, no entry.” imagineVid/Awesome-minimax-h3-prompts-and-skills, omni-reference kimlik sürekliliğinden yerel sesli diyaloğa uzanan altı iş akışında doğrulanmış 28 örnek barındırıyor. APIMODELS galerisi ise klip eklenmiş 226 promptu kullanım senaryosuna göre gezilebilir biçimde sunuyor. Tek satırlık kuralları şöyle: “References carry identity, the prompt carries action.”

Senaryoları yazmayı hızlandırmak için iki kısa yol da var. Reddit kullanıcıları, resmî rehberi bir LLM’e yapıştırıp hedef modu belirterek iyi sonuç aldıklarını bildiriyor: örneğin “rewrite this idea as T2VA using the base guide”. Bir ComfyUI eklentisi olan MiniMax H3 Prompt Writer v0.3 ise yapılandırılmış formatı node tabanlı iş akışı içinde oluşturuyor.

Sık Sorulan Sorular

MiniMax H3 temel ve referans prompt rehberleri arasındaki fark nedir?

Temel rehber, üç ana alan üzerine kurulan ve referans kullanmayan dört modu kapsar: T2VA, I2VA, FL2VA ve L2VA. Yüklenen görsel, video veya ses üretimi yönlendirdiğinde referans rehberi devreye girer; altı zorunlu bölüm ile <Subject>/<Picture>/<Video>/<Audio> etiketlerini ekler.

MiniMax H3 promptunda konuşmacıları nasıl etiketlerim?

İlk ses olayının sırasına göre sabit (S1), (S2) ID’leri atayın ve bu ID’leri planlar boyunca koruyun. Eş zamanlı konuşma için (S1,S2) kullanın. <d> etiketinin içine ise yalnızca dil etiketiyle birebir söylenecek sözleri yazın.

MiniMax H3’te anlamsız sesleri nasıl engellerim?

Diyaloğu konuşmacı ID’leri ve birebir <d> etiketleriyle yapılandırın, konuşmayan karakterlerin sessiz olduğunu belirtin ve fon müziği istemiyorsanız non_diegetic_music: N/A ayarını kullanın. Bunlar hem dokümanlarda yer alan hem de topluluk tarafından doğrulanan çözümlerdir.

MiniMax H3 diyalogları tırnak işareti içinde mi yazılmalı?

Hayır. Tırnak işaretleri videoda görünen metinlere ayrılmıştır. Konuşulan diyalog <d>[Language] ...</d> içinde yer almalıdır; aksi hâlde H3 bunu ekran üzeri altyazı olarak üretebilir.

MiniMax H3 promptu ne kadar uzun olabilir?

fal ve resmî V2 API dokümanlarında sınır yaklaşık 7.000 karakterdir. APIMODELS ise 20.480 karakter listeliyor. Bu yüzden 10.000 karakterlik bir senaryo yazmadan önce kullandığınız uç noktanın limitini doğrulayın.

Sözdiziminin Hâlâ Çözemediği Şeyler

Doğru yapı, isabet oranını yükseltir; ancak üretimi deterministik hâle getirmez. Yüz, logo ve ürün detaylarının tam doğruluğu hâlâ olasısaldır. Topluluk tarafından geliştirilen API sarmalayıcıları, kare düzeyinde tutarlılık sözü vermeyi açıkça reddediyor. En güçlü prompt kütüphanesi örnekleri de ölçülmüş garantiler yerine uzun kısıt bloklarıyla kimliği korumaya çalışıyor. Sözel olmayan sesler için satır içi <tags> kullanımı topluluk tarafından yürütülen deneysel bir yaklaşım ve sonuçlar üretimden üretime değişiyor. Başarıyı istek başına maliyetle değil, onaylanan saniye başına maliyetle değerlendirin; yazarken resmî temel ve referans rehberlerini açık tutun.

İlgili okumalar: MiniMax H3 yayın özeti, modelin ne olduğunu ele alıyor. MiniMax H3 vs LTX 2.3 ise modeli saniye başına en ucuz alternatifle karşılaştırıyor.