MiniMax Music 3.0 è arrivato il 13 agosto 2026 con pesi open su HuggingFace, un’API da $0,15 a brano e la possibilità di generare canzoni lunghe fino a cinque minuti. C’è però qualche dettaglio da tenere presente: la documentazione dell’endpoint fa ancora riferimento a Music 2.6, mentre l’inferenza in locale può richiedere fino a 24 GB di VRAM.
Le novità di Music 3.0: perché cinque minuti fanno la differenza
Music 3.0 prende il posto di Music 2.6 come modello musicale di riferimento di MiniMax. La novità più evidente è la generazione di brani completi fino a cinque minuti in un’unica passata, dalla composizione all’arrangiamento, fino all’interpretazione e alla produzione. L’obiettivo è risolvere uno dei problemi delle versioni precedenti: quando il brano superava la prima sezione, genere, strumenti e coerenza della voce tendevano a perdersi (blog ufficiale).
| Componente | Parametri | Funzione |
|---|---|---|
| LLM globale (derivato da Qwen3.5-8B) | 8B | Prevede struttura musicale e contenuti semantici sull’intero brano |
| LLM locale | 0.6B | Ricostruisce i dettagli acustici più fini di ogni frame |
| Flow matching + Flow-VAE | 2.4B + 123M | Converte gli stati latenti in audio continuo, non in token discreti |
Alla base c’è uno stack di quantizzazione vettoriale residua a 8 livelli (RVQ), che separa la struttura musicale generale, affidata al Layer 1 con codebook da 16.384 elementi, dai dettagli acustici, gestiti dai Layer 2–8 con 1.024 elementi ciascuno. L’LLM globale mantiene il contesto dell’intera canzone, quello locale si occupa della previsione acustica frame per frame e lo stack di flow matching produce l’audio finale a partire dagli stati latenti combinati, senza limitarsi a decodificare token discreti. Secondo il blog, questo approccio riduce gli artefatti ad alta frequenza e le frasi troppo rigide tipiche dei precedenti modelli musicali generativi. MiniMax, però, non ha pubblicato benchmark controllati a confronto con Music 2.6, Suno o Udio.
Prezzi API, ID dei modelli e limiti di utilizzo
La piattaforma ufficiale di MiniMax propone due ID per Music 3.0, con una tariffazione a consumo piuttosto semplice:
| ID modello | Prezzo per brano | Limite richieste | Note |
|---|---|---|---|
Music-3.0 | $0.15 | 120 RPM | Per limiti superiori è necessario contattare il commerciale |
Music-3.0-free | $0 | 3 RPM | Livello di prova gratuito |
Generazione/modifica testi di Music-3.0 | $0.01 | — | Generazione automatica o ottimizzazione dei testi |
Entrambi i modelli producono un brano completo, con voce e della durata massima di cinque minuti, per ogni chiamata API. L’endpoint è POST /v1/music_generation, lo stesso utilizzato da Music 2.6. Al momento del lancio, la documentazione di riferimento delle API mostra ancora music-2.6 negli esempi indicizzati. Chi sviluppa dovrà quindi probabilmente provare manualmente l’ID Music-3.0 finché la documentazione non verrà aggiornata.
Usare Music 3.0 in locale: ComfyUI e requisiti hardware
È soprattutto il rilascio dei pesi open ad aver attirato l’attenzione della community. I pesi sono disponibili su HuggingFace all’indirizzo MiniMaxAI/MiniMax-Music3, mentre una distribuzione ottimizzata per ComfyUI si trova su Comfy-Org/MiniMax-Music-3.
La scheda del modello, insieme alle prime segnalazioni della community, documenta tre configurazioni hardware:
| Modalità | VRAM | Velocità indicativa | Qualità |
|---|---|---|---|
| Precisione completa | <24 GB (per esempio RTX 4090) | La più alta | La migliore |
| CPU offloading | ~22 GB di GPU + almeno 32 GB di RAM | Media | Quasi completa |
| Layer streaming | 8 GB di GPU + almeno 32 GB di RAM | Bassa | Limitata |
Per iniziare in locale bisogna installare ComfyUI in versione 0.33.0 o successiva (come confermato dalla discussione della community di ComfyUI), scaricare i file del modello da uno dei repository HuggingFace indicati sopra, caricare il workflow ComfyUI per MiniMax-Music3, scegliere la modalità di precisione in base alla VRAM disponibile e avviare la generazione. Al momento CUDA è l’unico backend di calcolo supportato: non esiste ancora un percorso ROCm o MPS (secondo le segnalazioni della community). È inoltre in corso una PR per l’integrazione con Diffusers, che permetterebbe di eseguire il modello nativamente in Python anche al di fuori di ComfyUI.
Un utente di Reddit su r/comfyui ha riferito di aver generato 140 secondi di musica country con una AMD RX 7900 GRE (16 GB di VRAM, 32 GB di RAM) in circa 125 secondi. Un’altra discussione su r/StableDiffusion riassume così, senza troppi giri di parole, l’umore della community:
"Today I have unsubscribed from Suno thanks to Minimax Music." — r/StableDiffusion
Prima di usare il modello per lavori commerciali conviene leggere con attenzione la licenza. Il blog parla di “open weights” e di un modello “production-ready”, ma non pubblica il testo della licenza, le clausole sull’uso commerciale né i termini per la redistribuzione. Il file LICENSE del repository HuggingFace resta la fonte da consultare; è necessario verificarlo prima di distribuire lavori destinati a generare entrate.
Come dare istruzioni a Music 3.0: Structured Captions e tag delle sezioni
Il controllo di Music 3.0 ruota attorno alle Structured Captions: descrizioni dettagliate e organizzate nel tempo, che indicano al modello cosa deve accadere in ogni parte del brano. Secondo il blog ufficiale, una caption ben costruita dovrebbe specificare:
- Genere e sottogenere (per esempio, “progressive house / EDM”)
- Tempo e tonalità (per esempio, “126 BPM, si bemolle maggiore”)
- Strumentazione (per esempio, “tenore maschile arioso, synth in sidechain, basso da club, riverbero hall”)
- Interpretazione vocale (per esempio, “tenore roco con passaggi in falsetto”)
- Sviluppo emotivo (per esempio, “strofa ariosa che cresce fino a un ritornello ad alta energia”)
- Carattere della produzione (per esempio, “mix con ambiente vintage”, “tastiere brillanti”)
I testi possono usare i normali tag di sezione riconosciuti dalla maggior parte dei modelli di musica generativa:
[intro]
[verse]
[pre-chorus]
[chorus]
[bridge]
[instrumental]
[solo]
[outro]
Il Prompt Enhancement System può trasformare richieste generiche come “canzone pop vivace con voce femminile” nel formato completo delle Structured Captions, utilizzando la terminologia dell’industria musicale. Anche chi non ha una preparazione musicale può così ottenere un controllo più preciso senza dover conoscere un vocabolario specialistico. I brani strumentali si possono generare senza testo; per quelli cantati servono testi forniti dall’utente oppure l’ottimizzatore dei testi, al costo di $0,01 a brano.
MiniMax Music 3.0 contro Suno e Udio
La domanda concreta è questa: conviene pagare $0,15 per brano a MiniMax oppure abbonarsi a un servizio già affermato?
| Caratteristica | MiniMax Music 3.0 | Suno | Udio |
|---|---|---|---|
| Durata massima del brano | 5 min | ~4 min | ~2–4 min |
| Modello di prezzo | $0,15/brano (a consumo) | $10/mese Pro (500 brani) | $10/mese Standard (~600 brani) |
| Opzione gratuita | API a 3 RPM + pesi open | 10 brani al giorno | Crediti limitati |
| Pesi open | Sì (HuggingFace) | No | No |
| Esecuzione in locale | Sì (ComfyUI) | No | No |
| Uso commerciale | Verificare la licenza HuggingFace | Incluso nei piani a pagamento | Incluso nei piani a pagamento |
Il punto di pareggio è intorno ai 67 brani al mese. Sotto questa soglia, il pagamento a consumo di MiniMax, pari a $0,15 per brano, costa meno di qualsiasi abbonamento. Oltre, Suno Pro o Udio Standard a $10 al mese per oltre 500 brani vincono sul semplice costo unitario. L’opzione locale con pesi open di MiniMax, però, cambia completamente il quadro: se si possiede già la GPU, la generazione gratuita è illimitata.
Le discussioni su r/SunoAI e r/comfyui descrivono Music 3.0 come competitivo con Suno v4 per naturalezza delle voci e aderenza ai prompt, con riscontri particolarmente positivi su musica elettronica e pop. Rock, metal e stili acustici più datati hanno ricevuto commenti più contrastanti, e alcuni utenti hanno segnalato impasti poco nitidi nei mix densi. Il supporto multilingue, con mandarino e inglese nelle demo ufficiali e rap Bollywood nei test della community, sembra solido.
Domande frequenti
MiniMax Music 3.0 è gratis?
Il modello API Music-3.0-free genera brani senza costi, con un limite di 3 RPM. È inoltre possibile eseguire gratuitamente in locale il modello con pesi open tramite ComfyUI.
Music 3.0 può generare brani strumentali?
Sì. Per generare musica strumentale non servono testi; la generazione vocale richiede invece testi forniti dall’utente oppure l’ottimizzatore dei testi al costo di $0,01 a brano.
Qual è l’ID API del modello Music 3.0?
Music-3.0 (120 RPM, $0,15/brano) e Music-3.0-free (3 RPM), entrambi tramite POST /v1/music_generation. Va ricordato che la documentazione API continua a indicare music-2.6 in alcune pagine.
Music 3.0 supporta lingue diverse dall’inglese?
Le demo ufficiali includono mandarino e inglese. I test della community mostrano generazioni riuscite in hindi (test di rap Bollywood). Non è stata pubblicata alcuna lista ufficiale delle lingue supportate.
Posso usare commercialmente i brani creati con MiniMax Music 3.0?
È necessario controllare il file LICENSE su HuggingFace e i termini di servizio delle API. Il blog non specifica i diritti di utilizzo commerciale.
Quanta VRAM serve per eseguire Music 3.0 in locale?
Meno di 24 GB in precisione completa, ~22 GB con CPU offloading oppure 8 GB in modalità layer streaming. Per i dettagli, consulta la tabella hardware qui sopra.
Quale modalità conviene scegliere?
| Situazione | Opzione consigliata | Costo |
|---|---|---|
| Testare o prototipare pochi brani | API Music-3.0-free | $0 |
| Uso saltuario in produzione (<67 brani/mese) | API Music-3.0 | $0,15/brano |
| Generazione ad alto volume (>67 brani/mese) | Suno Pro o Udio Standard | $10/mese |
| Possiedi una GPU da 24 GB e vuoi generare senza limiti | ComfyUI in locale con i pesi HuggingFace | $0 (solo calcolo) |
| Stai sviluppando un’app per la generazione musicale automatizzata | API Music-3.0 tramite la piattaforma MiniMax | $0,15/brano |
Restano due punti da chiarire: la documentazione API, ancora ferma a Music 2.6, e i termini di licenza non specificati per i pesi open. Entrambi dovrebbero essere definiti meglio con la stabilizzazione del rilascio, ma al momento nessuno dei due impedisce di utilizzare l’API.