AIREITER

Test de MiniMax Music 3.0 : API, tarifs et installation en local

Dernière mise à jour: 2026-08-14 00:21:19

Lancé le 13 août 2026, MiniMax Music 3.0 réunit trois arguments majeurs : des poids ouverts sur HuggingFace, une API facturée 0,15 $ par morceau et des générations pouvant atteindre cinq minutes. Quelques zones restent toutefois floues : la documentation de l’endpoint mentionne encore Music 2.6, tandis que l’inférence en local peut nécessiter jusqu’à 24 Go de VRAM.

Music 3.0 : des morceaux de cinq minutes générés d’un seul tenant

Music 3.0 devient le modèle musical recommandé par MiniMax à la place de Music 2.6. Son évolution la plus visible est la génération, en une seule passe, de titres allant jusqu’à cinq minutes, avec composition, arrangement, interprétation et production. Selon MiniMax, cela corrige un défaut des versions précédentes : au-delà de la première section, elles avaient tendance à perdre la cohérence du genre, de l’instrumentation et des voix (blog officiel).

ComposantParamètresRôle
LLM global (issu de Qwen3.5-8B)8BPrédit la structure musicale et la sémantique sur l’ensemble du morceau
LLM local0.6BAjoute les détails acoustiques fins à l’intérieur de chaque frame
Flow-matching + Flow-VAE2.4B + 123MTransforme les états cachés en audio continu, et non en tokens discrets

Sous le capot, une pile de quantification vectorielle résiduelle (RVQ) à 8 couches distingue la structure musicale globale — couche 1 et dictionnaire de 16 384 entrées — des détails acoustiques fins, gérés par les couches 2 à 8 avec 1 024 entrées chacune. Le LLM global conserve le contexte à l’échelle du titre, le LLM local prédit l’acoustique frame par frame, puis la pile de flow-matching produit l’audio final à partir d’états cachés fusionnés plutôt que de décoder uniquement des tokens discrets. Le blog affirme que cette approche atténue les artefacts dans les hautes fréquences et le phrasé rigide des anciens modèles de musique IA, mais MiniMax n’a pas publié de benchmark contrôlé face à Music 2.6, Suno ou Udio.

API Music 3.0 : prix, identifiants et limites de requêtes

La plateforme officielle de MiniMax propose deux identifiants de modèles Music 3.0, avec une facturation simple à l’usage :

Identifiant du modèlePrix par morceauLimite de débitRemarques
Music-3.00,15 $120 RPMContactez les ventes pour des limites plus élevées
Music-3.0-free0 $3 RPMPalier d’essai gratuit
Génération/édition de paroles Music-3.00,01 $—Génération ou optimisation automatique des paroles

Les deux modèles produisent un morceau complet par appel d’API, avec voix et jusqu’à cinq minutes de durée. L’endpoint est POST /v1/music_generation, le même que pour Music 2.6. Le jour du lancement, la documentation de référence de l’API affichait encore music-2.6 dans ses exemples indexés. Les développeurs devront donc potentiellement tester manuellement l’identifiant Music-3.0 en attendant la mise à jour de la documentation.

Lancer Music 3.0 en local avec ComfyUI : matériel requis

C’est la publication des poids ouverts qui a le plus suscité l’enthousiasme de la communauté. Ils sont disponibles sur HuggingFace via MiniMaxAI/MiniMax-Music3, ainsi que dans une distribution optimisée pour ComfyUI sur Comfy-Org/MiniMax-Music-3.

La fiche du modèle documente trois niveaux de configuration matérielle, confirmés par les premiers retours de la communauté :

ModeVRAMVitesse approximativeQualité
Pleine précision<24 Go (ex. RTX 4090)La plus rapideLa meilleure
Déport sur CPU~22 Go de GPU + 32 Go+ de RAMModéréeProche du niveau maximal
Streaming des couches8 Go de GPU + 32 Go+ de RAMLenteLimitée

Pour démarrer en local, installez ComfyUI en version 0.33.0 ou ultérieure (confirmation dans le fil de la communauté ComfyUI), téléchargez les fichiers du modèle depuis l’un des dépôts HuggingFace ci-dessus, chargez le workflow ComfyUI de MiniMax-Music3, choisissez le mode de précision adapté à votre VRAM, puis lancez la génération. CUDA est pour l’instant le seul backend de calcul pris en charge ; aucune voie ROCm ou MPS n’existe encore (selon les retours de la communauté). Une PR d’intégration Diffusers est en cours, ce qui ouvrirait l’inférence Python native en dehors de ComfyUI.

Un utilisateur de Reddit sur r/comfyui indique avoir généré 140 secondes de musique country avec une AMD RX 7900 GRE (16 Go de VRAM, 32 Go de RAM) en environ 125 secondes. Sur r/StableDiffusion, un autre fil résumait sans détour le sentiment de la communauté :

« Aujourd’hui, je me suis désabonné de Suno grâce à Minimax Music. » — r/StableDiffusion

Les conditions de licence méritent une lecture attentive avant tout usage commercial. Le blog parle de « poids ouverts » et d’un modèle « prêt pour la production », sans publier le texte de la licence, les clauses d’usage commercial ou les conditions de redistribution. Le fichier LICENSE du dépôt HuggingFace fait autorité : vérifiez-le avant de livrer un travail générant des revenus.

Bien prompter Music 3.0 avec les Structured Captions

L’interface de contrôle de Music 3.0 repose sur les Structured Captions : des descriptions détaillées, organisées dans le temps, qui indiquent au modèle ce qui doit se produire dans chaque partie du morceau. D’après le blog officiel, une caption bien construite précise :

  • Genre et sous-genre (par exemple, « progressive house / EDM »)
  • Tempo et tonalité (par exemple, « 126 BPM, si bémol majeur »)
  • Instrumentation (par exemple, « ténor masculin aérien, synthés side-chainés, basse club, réverbération de salle »)
  • Interprétation vocale (par exemple, « ténor rauque avec ruptures en falsetto »)
  • Progression émotionnelle (par exemple, « couplet aérien montant vers un refrain énergique »)
  • Caractère de production (par exemple, « mix room vintage », « claviers brillants »)

Les paroles utilisent les balises de sections standard reconnues par la plupart des modèles de musique IA :

[intro]
[verse]
[pre-chorus]
[chorus]
[bridge]
[instrumental]
[solo]
[outro]

Un Prompt Enhancement System peut développer une demande simple, telle que « chanson pop entraînante avec voix féminine », en Structured Caption complète utilisant le vocabulaire de l’industrie musicale. Les non-musiciens peuvent ainsi accéder à un contrôle détaillé sans maîtriser le jargon. Les instrumentaux se génèrent sans paroles ; les morceaux vocaux exigent des paroles fournies par l’utilisateur ou l’optimiseur de paroles à 0,01 $ par morceau.

MiniMax Music 3.0 face à Suno et Udio

La vraie question est simple : vaut-il mieux payer 0,15 $ par morceau à MiniMax ou s’abonner à un acteur déjà établi ?

FonctionnalitéMiniMax Music 3.0SunoUdio
Durée maximale d’un morceau5 min~4 min~2–4 min
Modèle tarifaire0,15 $/morceau (à l’usage)10 $/mois Pro (500 morceaux)10 $/mois Standard (~600 morceaux)
Option gratuiteAPI à 3 RPM + poids ouverts10 morceaux/jourCrédits limités
Poids ouvertsOui (HuggingFace)NonNon
Déploiement localOui (ComfyUI)NonNon
Usage commercialVérifier la licence HuggingFaceInclus dans les offres payantesInclus dans les offres payantes
Comparaison du coût de MiniMax Music 3.0, Suno et Udio selon le volume mensuel de morceaux

Le seuil de rentabilité se situe autour de 67 morceaux par mois. En dessous, la facturation à l’usage de MiniMax à 0,15 $ par morceau coûte moins cher que n’importe quel abonnement. Au-delà, Suno Pro ou Udio Standard, à 10 $ par mois pour plus de 500 morceaux, deviennent plus avantageux sur le seul critère du prix. Mais l’option locale à poids ouverts de MiniMax change la donne : les générations sont gratuites et illimitées si vous possédez déjà le GPU.

Les discussions sur r/SunoAI et r/comfyui placent Music 3.0 au niveau de Suno v4 pour le naturel des voix et le respect du prompt, avec des retours particulièrement positifs sur l’électro et la pop. Les avis sont plus partagés pour le rock, le metal et les styles acoustiques plus anciens : certains utilisateurs signalent un manque de clarté dans les mix denses. La prise en charge multilingue semble solide, avec du mandarin et de l’anglais dans les démos officielles, ainsi que du rap Bollywood testé par la communauté.

FAQ

MiniMax Music 3.0 est-il gratuit ?

Le modèle API Music-3.0-free génère des morceaux sans frais, dans la limite de 3 RPM. Il est également possible d’exécuter gratuitement le modèle à poids ouverts en local avec ComfyUI.

Music 3.0 peut-il créer des instrumentaux ?

Oui. La génération instrumentale ne nécessite pas de paroles ; la génération vocale demande des paroles fournies par l’utilisateur ou l’optimiseur de paroles à 0,01 $ par morceau.

Quel est l’identifiant API de Music 3.0 ?

Music-3.0 (120 RPM, 0,15 $/morceau) et Music-3.0-free (3 RPM), tous deux via POST /v1/music_generation. Attention : la documentation de l’API mentionne encore music-2.6 sur certaines pages.

Music 3.0 prend-il en charge des langues autres que l’anglais ?

Les démos officielles incluent le mandarin et l’anglais. Des tests communautaires montrent des générations réussies en hindi (test de rap Bollywood). Aucune liste officielle des langues prises en charge n’a été publiée.

Puis-je exploiter commercialement des morceaux MiniMax Music 3.0 ?

Consultez le fichier LICENSE de HuggingFace ainsi que les conditions d’utilisation de l’API. Le blog ne précise pas les droits d’usage commercial.

De combien de VRAM ai-je besoin pour exécuter Music 3.0 en local ?

Moins de 24 Go en pleine précision, ~22 Go avec déport sur CPU, ou 8 Go en mode streaming des couches. Consultez le tableau matériel ci-dessus.

Quelle option choisir selon votre usage ?

Votre situationOption recommandéeCoût
Tester ou prototyper quelques morceauxAPI Music-3.0-free0 $
Usage de production occasionnel (<67 morceaux/mois)API Music-3.00,15 $/morceau
Génération en volume (>67 morceaux/mois)Suno Pro ou Udio Standard10 $/mois
Vous possédez un GPU de 24 Go et voulez générer gratuitement sans limiteComfyUI en local avec les poids HuggingFace0 $ (calcul uniquement)
Vous développez une application avec génération musicale programmableAPI Music-3.0 via la plateforme MiniMax0,15 $/morceau

Deux lacunes subsistent : le retard de la documentation de l’API, encore centrée sur Music 2.6, et les conditions de licence non détaillées pour les poids ouverts. Ces deux points devraient être clarifiés à mesure que la sortie se stabilise, mais aucun n’empêche l’API de fonctionner dès aujourd’hui.