Tek satırlık bir “sinematik” tanım, modelin dolduracağı sayısız boşluk bırakır. Kamera talimatını atladığınızda sabit kadrajla karşılaşabilirsiniz; ses alanlarını tanımsız bıraktığınızda ise istemediğiniz konuşmalar devreye girebilir. MiniMax H3 için etkili prompt yazımı, kısa bir çekim senaryosu hazırlamaya daha çok benzer. Resmî dokümanlar; plan zaman damgaları, tutarlı konuşmacı kimlikleri ve ayrı iki ses alanından oluşan sabit bir yapı tanımlar. Üstelik tüm senaryo, sağlayıcıya göre değişmekle birlikte yaklaşık 7.000 karakterlik prompt sınırına ve 15 saniyelik klip tavanına sığmalıdır.
Önce Doğru H3 Prompt Biçimini Seçin: İki Rehber, Dört Mod
MiniMax, Hugging Face üzerindeki MiniMax-H3 deposunda iki ayrı prompt yazım rehberi yayımlıyor. Bunlar farklı iş akışlarına hitap ediyor. Temel rehber, yüklenmiş referans kullanılmayan dört üretim görevini ele alıyor. Yüklediğiniz bir görsel, video ya da ses klibi üretime dahil olduğunda ise referans rehberi devreye giriyor. Temel rehberdeki dört görev şu modlara karşılık geliyor:
| Mod | Girdi | Promptta gereken hizalama talimatı |
|---|---|---|
| T2VA | Yalnızca metin | Yok; doğrudan temel alanlarla başlayın |
| I2VA | Tek ilk-kare görseli | "Picture 1 is fully referenced at 0.00 seconds and belongs to [Shot 1]" |
| FL2VA | İlk kare + son kare | Picture 1 0.00 saniyede, Picture 2 ise tam bitiş anında |
| L2VA | Tek son-kare görseli | Picture 1 videonun bitiş zamanıyla ve son planla hizalanır |
Her iki rehber de uygulanmış örneklerle bitiyor. MiniMax lansman yazısı da modeli aynı çerçevede anlatıyor: Menüden görev seçmek yerine metin, görsel, video ve ses girdileri arasındaki ilişkiyi tarif ediyorsunuz. Barındırılan uç noktalar bunu üç iş akışına indirger: fal üzerinde minimax/h3/text-to-video, image-to-video ve reference-to-video. Ancak alttaki prompt yapısı değişmez.
Temel Prompt Yapısı: Alan Alan İnceleme
Temel moddaki bir MiniMax H3 promptunda, hizalama talimatından sonra boş satırlarla ayrılan tam üç zorunlu alan bulunur. İskelet yapı şöyledir:
[alignment instruction if I2VA/FL2VA/L2VA]
integrated_multimodal_description: [Shot 1] ...
overall_soundscape: ...
non_diegetic_music: ...
integrated_multimodal_description, zaman akışını taşır: görsel stil, kompozisyon, eylemler, plan değişimleri, konuşmacılar, diyaloglar ve diegetik sesler; yani görüntüde görülen veya sahne içinde duyulan her şey.overall_soundscape, diyalog içermeden ortamı ve fiziksel sesleri tek paragrafta 1–4 cümleyle özetler.non_diegetic_music, yalnızca izleyicinin duyduğu müziği 1–3 cümleyle açıklar. Müzik yoksaN/Ayazılır.
Resmî rehberdeki T2VA örneğinden uyarlanan, gün doğumundan önceki fırın sahnesi şöyle görünüyor:
integrated_multimodal_description: [Shot 1] Live-action, cinematic. A medium-wide
shot of a small bakery interior before sunrise; warm tungsten light, flour dust in
the air. A middle-aged baker (S1), grey apron, rolled sleeves, lifts the security
shutter. The camera pushes in with small amplitude at slow speed as he places
fresh bread on a wooden counter. (S1) says in a warm, mid-pitch voice <d>[English]
First batch of the day.</d> At 00:05.000, the camera cuts to a close-up of his
hands slicing a loaf; (S1)'s words carry over from the previous shot, <scenetrans>
continuing seamlessly across the cut.
overall_soundscape: The rattling shutter, metal trays set down on stone, a doorbell
chime, footsteps on tile, and the crusty sound of a knife slicing bread.
non_diegetic_music: Acoustic guitar and upright bass at a slow tempo, gentle
dynamics fading out before the final shot.
Resmî kurallara göre her satırın denetlediği unsur:
| Prompt ögesi | Denetlediği unsur | Kural |
|---|---|---|
[Shot 1] Live-action, cinematic. | Genel stil | Stil etiketi Shot 1 ile açılır; rehberdeki örnekler arasında Cinematic, live-action, 2D-animated, 3D CG, claymation, watercolor, vintage film yer alır |
A middle-aged baker (S1), grey apron, rolled sleeves | Konuşmacı kimliği | Kimlik nitelikleri ID’den önce gelir; ID tüm planlarda aynı kalır |
The camera pushes in with small amplitude at slow speed | Kamera | Hareket türü + genlik + hız, doğal bir eylem cümlesi olarak yazılır |
<d>[English] First batch of the day.</d> | Diyalog | Dil etiketi ve yalnızca birebir söylenecek sözler kullanılır; çevrilmez |
At 00:05.000, the camera cuts to... | Kesme zamanı | Zamanlar kesin biçimde artmalıdır; [Shot 1] için zaman damgası yazılmaz |
<scenetrans> continuing seamlessly across the cut | Ses sürekliliği | Kesme boyunca devam eden diyaloğu, iki bağlantı noktasında işaretler |
Planlar, Kesimler ve Kamera Hareketleri
MiniMax H3’te plan sözdizimi konuma bağlıdır. [Shot 1] hiçbir zaman zaman damgası almaz; sonraki her plan ise At 00:03.500, gibi kesin biçimde artan bir kesme zamanı ile başlar. Onaylı kesme ifadeleri kısa tutulur: “the camera cuts to”, “the shot transitions to”, “the shot switches to”. Cross-dissolve, fade ve wipe gibi geçişleri ise yalnızca özellikle istiyorsanız kullanmalısınız. Kadrajda küçük bir değişiklik varsa rehber, kesme yerine kamera hareketi kullanılmasını öneriyor. Çünkü kesme; yeni bir özne, mekân, durum veya zaman bilgisi getirmelidir.
Kamera hareketini, en fazla üç boyut içeren doğal bir İngilizce eylem olarak yazın: hareket türü, genlik ve hız.
| Boyut | Kabul edilen ifadeler |
|---|---|
| Hareket türü | Zoom In/Out, Push In/Pull Out, Pan Left/Right, Truck Left/Right, Tilt Up/Down, Pedestal Up/Down, Arc Shot, Tracking Shot, Static Shot, Shake Slightly/Strongly, POV, Roll Clockwise/Counterclockwise |
| Genlik | "with small amplitude", "with large amplitude" |
| Hız | "at slow speed", "at fast speed" |
Orta genlik ve normal hız, varsayılan kabul edildiği için yazılmaz. “Zoom In” ile “Push In” arasındaki fark da önemlidir: Zoom In, sabit kamera konumundan odak uzaklığını değiştirir; Push In ise kamerayı fiziksel olarak öne taşır. Rehber bu ayrımı bilerek korur.
Diyalog Yazımı ve Konuşmacı Etiketleri
MiniMax H3 promptundaki her konuşan karakter, (S1), (S2) ya da eş zamanlı konuşma için (S1,S2) gibi sabit bir ID alır ve bu ID tüm planlarda korunur. Hiç konuşmayan karakterlere ID verilmez. Bir konuşmacının ilk görünümünde tutarlı üretim için yeterli kimlik bilgisi tanımlanmalıdır: ekranda ya da ekran dışında olması, yaş aralığı, cinsiyet, ses perdesi, tını, konuşma hızı ve aksan.
Tek bir diyalog satırının doğru yapısı şöyledir:
A woman in her 30s (S2), on-screen, mid-pitch voice, says with quiet anger
<d>[English] You promised me the 15th.</d>
Dört belgeli kural, sık görülen hataları önler. Kimlik, eylem ve söyleyiş biçimi <d> etiketinin dışında kalır; etiketin içine yalnızca dil etiketi ve noktalaması korunmuş birebir sözler girer. Seslendirme için doğrudan “says in an off-screen voiceover” ifadesi kullanılmalı, hemen ardından ekrandaki karakterin dudaklarının kapalı kaldığı belirtilmelidir. Kesme boyunca süren diyalogda, iki bağlantı noktasında da <scenetrans> ve “continues seamlessly across the cut” veya “carries over from the previous shot” gibi bir süreklilik ifadesi bulunmalıdır. Video bitmeden kesilen konuşmalar içinse <cutoff> kullanılır.
Tırnak işaretlerinin yalnızca tek bir görevi vardır: Videoda görünür olan her metin; afiş, tabela, etiket, neon ya da altyazı, İngilizce çift tırnak içinde, birebir ve çevrilmeden yazılır. Konuşulan diyaloğu tırnak içine almak, H3’ün bunu ses yerine gömülü altyazı olarak üretmesine yol açan belgelenmiş bir hatadır.
İki Ayrı Ses Alanı Ne İşe Yarıyor?
MiniMax lansman yazısına göre H3’ün tüm ses çıktısı videoyla birlikte üretilen yerel stereo sestir. Bu nedenle ses, açıklamaya serpiştirilmiş sıfatlarla değil, iki ayrı alanla yönetilir. overall_soundscape, rüzgâr, yağmur, trafik, adımlar, kumaş hareketi, çarpma, nefes ve kahkaha gibi ortam ile fiziksel sesleri 1–4 cümlede kapsar. Tam sessizlik isteniyorsa N/A kullanılır. non_diegetic_music ise karakterlerin duymadığı fon müziğini; enstrümantasyon, tempo, ritim ve dinamik değişimlerle tanımlar. “Epic” veya “emotional” gibi soyut ruh hâli ifadeleri açıkça önerilmez. Müzik istemiyorsanız doğru değer yine N/A olur.
Şarkı söyleme, sahne içindeki radyo ya da sokak müzisyeni gibi diegetik sesler bu iki alana yazılmaz. Bunların yeri, zaman çizelgesinin bulunduğu integrated_multimodal_description alanıdır. Bu ayrım yalnızca biçimsel değil: APIMODELS rehberi, güvenilir sonuçlar için açık ses kısıtlarının gerekli olduğunu belirtiyor. non_diegetic_music alanını tanımsız bırakmak, hiç istemediğiniz müziğin eklenmesine neden olabilir.
Referans Promptları: Etiketleme ve Koruma Kuralları
Yüklenen varlıklar üretimi yönlendirdiği anda referans rehberi kullanılmalıdır. Bu rehber, sabit sırada altı bölüm ister: subject_definitions, summary, retention_analysis, detailed_description, overall_soundscape, non_diegetic_music. Üretim görevlerinde detailed_description bölümü normalde 350–500 İngilizce kelime uzunluğundadır. Diyaloğun yoğun olduğu promptlarda ise kelime sayısı esnetilse bile konuşmanın tüm zaman akışı sığmalıdır.
Dört etiket türü temel işi üstlenir:
| Etiket | Kullanım amacı |
|---|---|
<Subject N> | Çıktıda gerçekten kullanılan görünür içerik: herhangi bir varlıktan soyutlanan kişi, ürün, sahne, kıyafet, stil veya eylem |
<Picture N> | Somut kare bağlantısı oluşturan görsel: ilk kare, ana kare, son kare veya kompozisyon dayanağı |
<Video N> | Tüm videoya yönelik ilişki: kurgu kaynağı, devam noktası, kamera ya da kesme yapısı, ritim |
<Audio N> | Kopyalanan veya referans alınan ses sinyali: ses tınısı, şarkı sözleri, ritimler, ses efektleri |
Numaralandırma her tür için bağımsızdır. Bu nedenle yüklenen tek bir video <Video 1>, onun ses parçası ise <Audio 2> olabilir. Konuşan bir özne, etiket ve konuşmacı ID’sini birleştirir: <Subject 3> (S1).
summary bölümü, [reference generation] veya [video editing + audio reuse] gibi köşeli parantezli bir görev önekiyle açılır. Video düzenleme talebinde başlangıç mutlaka “The target video is an edited version of <Video 1>.” olmalıdır. Ardından retention_analysis, her etiket için bir koruma işareti atar: görsellerde fully_preserved, partially_preserved, attribute_transfer veya weak_reference; seslerde fully_copy, partially_copy, reference ya da weak_reference. Yüzün korunurken kıyafetin değişebilmesini H3’e bu işaretlerle anlatırsınız.
Belgelenmiş sırayı izleyen en temel referans modu iskeleti:
subject_definitions:
<Subject 1>: the woman from Picture 1, long blonde hair, light-pink shirt
<Picture 1>: first frame of [Shot 1], café window seat
<Audio 1>: voice-timbre reference for <Subject 1> (S1)
summary: [reference generation + audio reference] One short paragraph naming the
task, the target video, and each reference relationship.
retention_analysis:
<Subject 1> (appears in [Shot 1], [Shot 2]): fully_preserved, same face, hair, outfit
<Picture 1> ([Shot 1] first frame): fully_preserved
<Audio 1> (S1 voice): reference, timbre only, no copied words
detailed_description: [1–2 style sentences.] [Shot 1] ... [350–500 words, dialogue
in <d> tags, <scenetrans> across cuts]
overall_soundscape: [Ambience and physical sounds.]
non_diegetic_music: N/A
H3 Beklenmedik Davrandığında: Belirtiye Göre Çözüm Tablosu
| Belirti | Muhtemel prompt nedeni | Çözüm |
|---|---|---|
| Anlamsız sesler veya uydurma “Sims dili” | Yapılandırılmamış diyalog, konuşmacı ID’sinin olmaması ya da konuşmayan karakterlerin tanımlanmaması | (S1)/(S2) ID’leri ekleyin, birebir sözleri <d>[Language] ...</d> içine alın ve sessiz karakterlerin konuşmadığını açıkça belirtin |
| Diyalogda gömülü altyazılar | Konuşulan sözlerin tırnak işaretiyle yazılması | Tırnak işaretlerini yalnızca ekranda görülen metin için kullanın; diyaloğu <d> etiketlerine taşıyın |
| Diyaloğun yanlış karaktere atanması | Konuşmacı ID’sinin tanımlanmış bir kişiye bağlanmaması | İlk görünümde konuşmacının kimlik özelliklerini verin: yaş, ekranda olma durumu ve ses; ID’yi planlar boyunca sabit tutun |
| İstenmeyen fon müziği veya müzik | non_diegetic_music alanının belirsiz bırakılması ya da atlanması | Müzik istemiyorsanız non_diegetic_music: N/A yazın; topluluk başlıkları bunu istenmeyen sesi kesen çözümlerden biri olarak gösteriyor |
| Planlanmamış kesmeler | Sahne değişimlerinin zaman damgası olmadan kesme ima etmesi | Açık kesme ifadeleriyle [Shot N] At 00:03.500 kullanın; tek planlı çekimler için “no cuts” ifadesini isteyin |
| Yüz, kıyafet veya ürünün tutarsızlaşması | Referansın rolünün hiç tanımlanmamış olması | İlgili etiket için fully_preserved içeren bir retention_analysis satırı ekleyin ve etiketi her görünümde tekrarlayın |
Anlamsız ses ve altyazı satırları doğrudan resmî sözdizimi kurallarından geliyor. r/StableDiffusion üzerindeki topluluk başlıkları da aynı çözümlerin pratikte işe yaradığını bağımsız olarak bildiriyor. İstenmeyen sesleri engellemek için en çok anılan yöntemlerden biri de non_diegetic_music: N/A.
Sınırlar ve Prompt Testinin Maliyeti
Prompt uzunluğu sınırlı, her deneme de ücretli olduğu için üretim sınırlarını bilmek önemlidir. Resmî API ve barındırılan sağlayıcılarda belgelenen limitler şöyle:
| Parametre | Değer | Not |
|---|---|---|
| Klip süresi | 15 saniyeye kadar, tam saniye | fal/EvoLink uç noktalarında minimum 5 saniye; bazı V2 API dokümanlarında 4 saniye yazıyor |
| Çözünürlük | 768p ve 2K, 24 FPS | MiniMax’a göre varsayılan çıktı çözünürlüğü 2K |
| Referans dosyaları | En fazla 9 görsel, 3 video, 3 ses | Toplam 12 dosya; ses hiçbir zaman tek referans olamaz |
| Prompt uzunluğu | ~7.000 karakter | fal ve V2 API dokümanları; APIMODELS 20.480 belirtiyor — sağlayıcınızı kontrol edin |
| En-boy oranları | 21:9, 16:9, 4:3, 1:1, 3:4, 9:16, adaptive | Image-to-video, giriş görselinin oranını izler |
Fiyatlar sağlayıcıya göre değişir; bu rakamları liste fiyatı değil, tarihli anlık görüntüler olarak değerlendirin. fal üzerinde 2K üretim, 1 Ağustos tarihli fiyat görüntüsünde saniye başına $0.26 seviyesindeydi: 5 saniye için $1.30, 15 saniye için $3.90. İlk beş referans görsel ücretsiz, ek görseller ise adet başına $0.08. APIMODELS tarafında H3, saniye başına $0.088 ile çalışıyor; 15 saniyelik bir klip $1.32 tutuyor ve yalnızca başarılı istekler ücretlendiriliyor. Aynı pazar yerindeki saniye başı fiyatlarla karşılaştırma için:
Asıl bütçe kalemi tekrar denemeleridir. İkinci denemede sonuç veren yapılandırılmış 15 saniyelik bir diyalog promptu APIMODELS üzerinde $2.64 tutar. Kullanılabilir tek çekim için beş deneme gerektiren yapılandırılmamış bir prompt ise $6.60’a çıkar. Barındırılan bir H3 uç noktasında prompt denemeleri yapmak için AIReiter'ın MiniMax H3 API sayfası, modeli güncel fiyatlarıyla birlikte sunuyor.
Kopyalayıp Başlayabileceğiniz Şablonlar
İki temel iskelet, kısa formatlı işlerin çoğunu karşılar. Köşeli parantezleri doldurun; alan adlarını ve boş satırları aynen koruyun:
integrated_multimodal_description: [Shot 1] [style label]. [Composition and
subject with 1–2 identity details]. [One primary action with physically
plausible pacing]. The camera [motion type] with [amplitude] at [speed].
[Character description] (S1) says in [voice description] <d>[Language]
[exact line]</d>. At [MM:SS.mmm], the camera cuts to [new subject or space],
[continuity phrase if dialogue crosses the cut].
overall_soundscape: [Ambience + physical action sounds, 1–4 sentences.]
non_diegetic_music: [Instrumentation, tempo, dynamics] or N/A
Picture 1 is fully referenced at 0.00 seconds and belongs to [Shot 1].
integrated_multimodal_description: [Shot 1] [Style consistent with Picture 1].
The scene, subject, colors, and spatial relationships of Picture 1 remain
consistent. [Action developing forward from the first frame → result or
reaction]. The camera [motion type] with [amplitude] at [speed].
overall_soundscape: [Ambience and action sounds grounded in the image.]
non_diegetic_music: N/A
Boş şablon yerine denenmiş promptlar arıyorsanız, kaynak bağlantılarını koruyan üç kütüphane öne çıkıyor. ecomimagelab/awesome-minimax-h3-prompts, 58 prompt içeriyor: 39’u resmî, 19’u topluluk tarafından test edilmiş. Her prompt, indirilebilir sonuç videosuyla birlikte sunuluyor ve temel kural şu: “No video, no entry.” imagineVid/Awesome-minimax-h3-prompts-and-skills, omni-reference kimlik sürekliliğinden yerel sesli diyaloğa uzanan altı iş akışında doğrulanmış 28 örnek barındırıyor. APIMODELS galerisi ise klip eklenmiş 226 promptu kullanım senaryosuna göre gezilebilir biçimde sunuyor. Tek satırlık kuralları şöyle: “References carry identity, the prompt carries action.”
Senaryoları yazmayı hızlandırmak için iki kısa yol da var. Reddit kullanıcıları, resmî rehberi bir LLM’e yapıştırıp hedef modu belirterek iyi sonuç aldıklarını bildiriyor: örneğin “rewrite this idea as T2VA using the base guide”. Bir ComfyUI eklentisi olan MiniMax H3 Prompt Writer v0.3 ise yapılandırılmış formatı node tabanlı iş akışı içinde oluşturuyor.
Sık Sorulan Sorular
MiniMax H3 temel ve referans prompt rehberleri arasındaki fark nedir?
Temel rehber, üç ana alan üzerine kurulan ve referans kullanmayan dört modu kapsar: T2VA, I2VA, FL2VA ve L2VA. Yüklenen görsel, video veya ses üretimi yönlendirdiğinde referans rehberi devreye girer; altı zorunlu bölüm ile <Subject>/<Picture>/<Video>/<Audio> etiketlerini ekler.
MiniMax H3 promptunda konuşmacıları nasıl etiketlerim?
İlk ses olayının sırasına göre sabit (S1), (S2) ID’leri atayın ve bu ID’leri planlar boyunca koruyun. Eş zamanlı konuşma için (S1,S2) kullanın. <d> etiketinin içine ise yalnızca dil etiketiyle birebir söylenecek sözleri yazın.
MiniMax H3’te anlamsız sesleri nasıl engellerim?
Diyaloğu konuşmacı ID’leri ve birebir <d> etiketleriyle yapılandırın, konuşmayan karakterlerin sessiz olduğunu belirtin ve fon müziği istemiyorsanız non_diegetic_music: N/A ayarını kullanın. Bunlar hem dokümanlarda yer alan hem de topluluk tarafından doğrulanan çözümlerdir.
MiniMax H3 diyalogları tırnak işareti içinde mi yazılmalı?
Hayır. Tırnak işaretleri videoda görünen metinlere ayrılmıştır. Konuşulan diyalog <d>[Language] ...</d> içinde yer almalıdır; aksi hâlde H3 bunu ekran üzeri altyazı olarak üretebilir.
MiniMax H3 promptu ne kadar uzun olabilir?
fal ve resmî V2 API dokümanlarında sınır yaklaşık 7.000 karakterdir. APIMODELS ise 20.480 karakter listeliyor. Bu yüzden 10.000 karakterlik bir senaryo yazmadan önce kullandığınız uç noktanın limitini doğrulayın.
Sözdiziminin Hâlâ Çözemediği Şeyler
Doğru yapı, isabet oranını yükseltir; ancak üretimi deterministik hâle getirmez. Yüz, logo ve ürün detaylarının tam doğruluğu hâlâ olasısaldır. Topluluk tarafından geliştirilen API sarmalayıcıları, kare düzeyinde tutarlılık sözü vermeyi açıkça reddediyor. En güçlü prompt kütüphanesi örnekleri de ölçülmüş garantiler yerine uzun kısıt bloklarıyla kimliği korumaya çalışıyor. Sözel olmayan sesler için satır içi <tags> kullanımı topluluk tarafından yürütülen deneysel bir yaklaşım ve sonuçlar üretimden üretime değişiyor. Başarıyı istek başına maliyetle değil, onaylanan saniye başına maliyetle değerlendirin; yazarken resmî temel ve referans rehberlerini açık tutun.
İlgili okumalar: MiniMax H3 yayın özeti, modelin ne olduğunu ele alıyor. MiniMax H3 vs LTX 2.3 ise modeli saniye başına en ucuz alternatifle karşılaştırıyor.