MiniMax Music 3.0, 13 Ağustos 2026'da HuggingFace üzerinde açık ağırlıklarla, şarkı başına $0.15 ücretli bir API'yle ve beş dakikaya kadar şarkı üretme desteğiyle kullanıma sunuldu. Ancak API uç noktası belgelerinde hâlâ Music 2.6 referansları bulunuyor. Modeli yerel olarak çalıştırmak içinse 24 GB'a kadar VRAM gerekebiliyor.
Music 3.0 ile Neler Değişti? Beş Dakikalık Şarkılar Neden Önemli?
MiniMax, Music 2.6 modelinin yerine Music 3.0'ı öneriyor. En büyük yenilik, kompozisyon, aranje, performans ve prodüksiyonun tek seferde oluşturulduğu, beş dakikaya kadar uzunlukta şarkılar üretebilmesi. MiniMax'e göre bu yaklaşım, önceki sürümlerde şarkı ilk bölümün ötesine geçtikçe tür, enstrümanlar ve vokal tutarlılığının bozulması sorununu hedefliyor (resmî blog).
| Bileşen | Parametre | Görevi |
|---|---|---|
| Global LLM (Qwen3.5-8B tabanlı) | 8B | Şarkının tamamındaki müzikal yapıyı ve anlamsal bağlamı tahmin eder |
| Yerel LLM | 0.6B | Her karedeki ince akustik ayrıntıları tamamlar |
| Flow-matching + Flow-VAE | 2.4B + 123M | Gizli durumları sürekli sese dönüştürür; ayrık token'lara dayanmaz |
Modelin temelinde, kaba müzikal yapıyla (1. katman, 16.384 girdili codebook) ince akustik ayrıntıları (2–8. katmanlar, her biri 1.024 girdili codebook) birbirinden ayıran 8 katmanlı residual vector quantization (RVQ) yapısı bulunuyor. Global LLM şarkı genelindeki bağlamı takip ederken yerel LLM kare bazında akustik tahmin yapıyor. Flow-matching katmanı da nihai sesi yalnızca ayrık token'ları çözerek değil, birleştirilmiş gizli durumlardan oluşturuyor. Blog yazısına göre bu tasarım, önceki yapay zekâ müzik modellerinde görülen yüksek frekanslı bozulmaları ve mekanik ifade sorununu azaltıyor. Ancak MiniMax, Music 2.6, Suno veya Udio ile yapılmış kontrollü karşılaştırmalı test sonuçlarını yayımlamadı.
API Fiyatları, Model Kimlikleri ve Hız Limitleri
MiniMax'in resmî platformunda Music 3.0 için iki model kimliği ve kullanıma göre ücretlendirilen net bir fiyatlandırma yapısı yer alıyor:
| Model kimliği | Şarkı başına fiyat | Hız limiti | Notlar |
|---|---|---|---|
Music-3.0 | $0.15 | 120 RPM | Daha yüksek limitler için satış ekibiyle iletişime geçin |
Music-3.0-free | $0 | 3 RPM | Ücretsiz deneme katmanı |
Music-3.0 şarkı sözü oluşturma/düzenleme | $0.01 | — | Şarkı sözlerini otomatik oluşturur veya iyileştirir |
Her iki model de tek bir API çağrısında vokalli, beş dakikaya kadar eksiksiz bir şarkı üretebiliyor. Uç nokta POST /v1/music_generation; yani Music 2.6 ile kullanılan adresin aynısı. Ancak çıkış gününde API referans belgelerindeki örneklerde hâlâ music-2.6 görülüyordu. Belgeler güncellenene kadar geliştiricilerin Music-3.0 kimliğini manuel olarak test etmesi gerekebilir.
Music 3.0'ı Yerelde Çalıştırma: ComfyUI ve Donanım Gereksinimleri
Açık ağırlıklarla yayımlanması, topluluğun en çok ilgisini çeken gelişme oldu. Ağırlıklar HuggingFace üzerinde MiniMaxAI/MiniMax-Music3 adresinde, ComfyUI için optimize edilmiş dağıtım ise Comfy-Org/MiniMax-Music-3 adresinde bulunuyor.
Model kartında üç donanım seviyesi belgelenmiş durumda. Bu gereksinimler, topluluktan gelen ilk raporlarla da örtüşüyor:
| Çalışma modu | VRAM | Yaklaşık hız | Kalite |
|---|---|---|---|
| Tam hassasiyet | <24 GB (ör. RTX 4090) | En hızlı | En iyi |
| CPU offloading | ~22 GB GPU + 32 GB+ RAM | Orta | Tam sürüme yakın |
| Katman akışı | 8 GB GPU + 32 GB+ RAM | Yavaş | Kısıtlı |
Yerel kurulum için önce ComfyUI 0.33.0 veya daha yeni bir sürümünü yükleyin (ComfyUI topluluk başlığında doğrulandı). Ardından yukarıdaki HuggingFace depolarından model dosyalarını indirin, MiniMax-Music3 için ComfyUI iş akışını yükleyin, kullanılabilir VRAM'e göre hassasiyet modunu seçin ve üretimi başlatın. Şu anda desteklenen tek hesaplama altyapısı CUDA; ROCm veya MPS desteği henüz yok (topluluk raporlarına göre). Diffusers entegrasyonu için bir PR üzerinde çalışılıyor. Bu entegrasyon tamamlanırsa ComfyUI dışındaki Python tabanlı yerel çıkarım seçenekleri de açılacak.
r/comfyui'de bir Reddit kullanıcısı, AMD RX 7900 GRE (16 GB VRAM, 32 GB RAM) ile 140 saniyelik country tarzı müziği yaklaşık 125 saniyede ürettiğini bildirdi. r/StableDiffusion'daki başka bir başlıkta topluluğun yaklaşımı ise oldukça net özetlendi:
"MiniMax Music sayesinde bugün Suno aboneliğimi iptal ettim." — r/StableDiffusion
Ticari kullanıma geçmeden önce lisans şartlarını mutlaka incelemek gerekiyor. Blog yazısı "açık ağırlıklar" ve "production-ready" ifadelerini kullanıyor; ancak lisans metnini, ticari kullanım maddelerini veya yeniden dağıtım koşullarını yayımlamıyor. HuggingFace deposundaki LICENSE dosyası yetkili kaynak. Gelir getiren bir projede kullanmadan önce bu dosyayı kontrol edin.
Music 3.0 için Prompt Nasıl Yazılır? Structured Captions ve Bölüm Etiketleri
Music 3.0'ın kontrol sistemi Structured Captions üzerine kuruluyor. Bunlar, şarkının her bölümünde ne olması gerektiğini modele anlatan, ayrıntılı ve zaman akışına göre düzenlenmiş açıklamalar. Resmî bloga göre iyi hazırlanmış bir açıklama şu unsurları içermeli:
- Tür ve alt tür (ör. "progressive house / EDM")
- Tempo ve ton (ör. "126 BPM, B-flat major")
- Enstrümanlar (ör. "breathy male tenor, side-chained synths, club bass, hall reverb")
- Vokal yorumu (ör. "gravelly tenor with falsetto breaks")
- Duygusal akış (ör. "airy verse building to high-energy chorus")
- Prodüksiyon karakteri (ör. "vintage room mix," "glossy keys")
Şarkı sözlerinde çoğu müzik yapay zekâsı modelinin tanıdığı standart bölüm etiketleri kullanılabiliyor:
[intro]
[verse]
[pre-chorus]
[chorus]
[bridge]
[instrumental]
[solo]
[outro]
Prompt Enhancement System, daha basit istekleri ("upbeat pop song with female vocals") müzik endüstrisinde kullanılan terimlerle hazırlanmış eksiksiz Structured Caption formatına dönüştürebiliyor. Böylece müzisyen olmayan kullanıcılar da uzmanlık gerektiren kelimeleri bilmeden ayrıntılı kontrol elde ediyor. Enstrümantal parçalar şarkı sözü olmadan üretilebiliyor; vokalli parçalar içinse kullanıcının söz sağlaması veya şarkı başına $0.01 ücretli söz optimizasyon aracını kullanması gerekiyor.
MiniMax Music 3.0, Suno ve Udio Karşısında
Asıl soru şu: Şarkı başına $0.15 ödeyerek MiniMax'i mi kullanmalı, yoksa kendini kanıtlamış bir platforma mı abone olmalı?
| Özellik | MiniMax Music 3.0 | Suno | Udio |
|---|---|---|---|
| Maksimum şarkı uzunluğu | 5 dk | ~4 dk | ~2–4 dk |
| Fiyatlandırma modeli | $0.15/şarkı (kullandıkça öde) | $10/ay Pro (500 şarkı) | $10/ay Standard (~600 şarkı) |
| Ücretsiz seçenek | 3 RPM API + açık ağırlıklar | Günde 10 şarkı | Sınırlı kredi |
| Açık ağırlıklar | Evet (HuggingFace) | Hayır | Hayır |
| Yerel dağıtım | Evet (ComfyUI) | Hayır | Hayır |
| Ticari kullanım | HuggingFace lisansını kontrol edin | Ücretli planlara dahil | Ücretli planlara dahil |
Başa baş noktası ayda yaklaşık 67 şarkı. Bu sayının altında MiniMax'in şarkı başına $0.15 ücretli kullanıma göre ödeme modeli, abonelik seçeneklerinden daha ucuz. Üzerine çıkıldığında ise 500'den fazla şarkı için aylık $10 ücret alan Suno Pro veya Udio Standard, yalnızca maliyet açısından avantajlı hale geliyor. Ancak MiniMax'in açık ağırlıklarla yerel kullanım seçeneği hesabı değiştiriyor: GPU'nuza zaten sahipseniz sınırsız üretim ücretsiz.
r/SunoAI ve r/comfyui başlıklarındaki yorumlar, Music 3.0'ın vokal doğallığı ve prompt'a uyum konusunda Suno v4 ile rekabet edebildiğini gösteriyor. Elektronik ve pop türleri özellikle beğenilirken rock, metal ve eski akustik tarzlarda tepkiler daha karışık. Bazı kullanıcılar yoğun aranjmanlarda sesin bulanıklaşabildiğini belirtiyor. Çok dilli destek de güçlü görünüyor: resmî demolar Mandarin ve İngilizceyi, topluluk testleri ise Bollywood rap'i kapsıyor.
Sık Sorulan Sorular
MiniMax Music 3.0 ücretsiz mi?
Music-3.0-free API modeli, şarkıları herhangi bir ücret ödemeden üretiyor; hız limiti 3 RPM. Ayrıca açık ağırlıklı modeli ComfyUI üzerinden yerel olarak da ücretsiz çalıştırabilirsiniz.
Music 3.0 enstrümantal parçalar üretebilir mi?
Evet. Enstrümantal üretim için şarkı sözü gerekmiyor. Vokalli üretimdeyse kullanıcı tarafından sağlanan sözler veya şarkı başına $0.01 ücretli söz optimizasyon aracı gerekiyor.
Music 3.0 için API model kimliği nedir?
Music-3.0 (120 RPM, şarkı başına $0.15) ve Music-3.0-free (3 RPM) modellerinin ikisi de POST /v1/music_generation üzerinden çalışıyor. Ancak API belgelerinde bazı sayfalarda hâlâ music-2.6 referansı bulunuyor.
Music 3.0 İngilizce dışındaki dilleri destekliyor mu?
Resmî demolar Mandarin ve İngilizceyi içeriyor. Topluluk testlerinde Hintçe de başarılı sonuç verdi (Bollywood rap testi). Resmî bir dil listesi yayımlanmış değil.
MiniMax Music 3.0 parçalarını ticari olarak kullanabilir miyim?
HuggingFace üzerindeki LICENSE dosyasını ve API hizmet şartlarını kontrol edin. Blog yazısı ticari kullanım hakları konusunda bilgi vermiyor.
Music 3.0'ı yerel olarak çalıştırmak için ne kadar VRAM gerekiyor?
Tam hassasiyet için 24 GB'ın altında, CPU offloading ile yaklaşık 22 GB veya katman akışı modunda 8 GB gerekiyor. Ayrıntılar için yukarıdaki donanım tablosuna bakabilirsiniz.
Hangi Seçenek Size Uygun?
| Senaryo | Önerilen seçenek | Maliyet |
|---|---|---|
| Birkaç şarkıyı test etmek veya prototip hazırlamak | Music-3.0-free API | $0 |
| Ara sıra üretim kullanımı (<ayda 67 şarkı) | Music-3.0 API | $0.15/şarkı |
| Yüksek hacimli üretim (>ayda 67 şarkı) | Suno Pro veya Udio Standard | $10/ay |
| 24 GB GPU'ya sahip olup sınırsız ücretsiz üretim istemek | HuggingFace ağırlıklarıyla yerel ComfyUI | $0 (yalnızca hesaplama maliyeti) |
| Programatik müzik üretimi yapan bir uygulama geliştirmek | MiniMax platformu üzerinden Music-3.0 API | $0.15/şarkı |
Şimdilik iki önemli boşluk var: hâlâ Music 2.6'yı temel alan API belgeleri ve açık ağırlıkların belirsiz lisans şartları. Sürüm olgunlaştıkça her ikisinin de netleşmesi beklenebilir; yine de bu iki konu API'nin bugün çalışmasına engel değil.