MiniMax Music 3.0は2026年8月13日に公開された音楽生成モデルだ。HuggingFaceではオープンウェイトとして提供され、APIでは1曲0.15ドルで最大5分の楽曲を生成できる。一方で、APIエンドポイントのドキュメントには依然としてMusic 2.6の記載が残り、ローカル推論では最大24 GBのVRAMを求められる場合がある。
Music 3.0で変わったこと:最大5分の楽曲を一度に生成
Music 3.0は、MiniMaxが推奨モデルとしてMusic 2.6の後継に位置付ける新バージョンだ。最大のポイントは、最長5分の楽曲を1回の生成で仕上げられること。作曲、アレンジ、演奏、プロダクションまでをまとめて出力する。MiniMaxによれば、従来版では曲が最初のセクションを越えるにつれ、ジャンル感、使用楽器、ボーカルの一貫性が崩れやすかったという課題への対応だという(公式ブログ)。
| コンポーネント | パラメータ数 | 役割 |
|---|---|---|
| グローバルLLM(Qwen3.5-8Bベース) | 8B | 楽曲全体にわたる音楽構造と意味情報を予測 |
| ローカルLLM | 0.6B | 各フレーム内の細かな音響ディテールを補完 |
| Flow-matching + Flow-VAE | 2.4B + 123M | 隠れ状態を連続的な音声へ変換(離散トークンではない) |
内部では、8層のResidual Vector Quantization(RVQ)スタックを採用する。粗い音楽構造はLayer 1の16,384エントリーのコードブック、細かな音響情報はLayers 2~8の各1,024エントリーのコードブックで扱う構成だ。グローバルLLMが曲全体の文脈を追い、ローカルLLMがフレーム単位の音響予測を担う。さらにflow-matchingスタックは、離散トークンだけを復号するのではなく、統合した隠れ状態から最終音声をレンダリングする。公式ブログでは、従来のAI音楽モデルで目立った高域のアーティファクトや硬直したフレージングを抑えるとしている。ただしMiniMaxは、Music 2.6、Suno、Udioとの統制された比較ベンチマークは公開していない。
APIの料金、モデルID、レート制限
MiniMaxの公式プラットフォームには、従量課金で使えるMusic 3.0向けのモデルIDが2つ掲載されている。
| モデルID | 1曲あたりの料金 | レート制限 | 備考 |
|---|---|---|---|
Music-3.0 | $0.15 | 120 RPM | より高い制限は営業窓口へ問い合わせ |
Music-3.0-free | $0 | 3 RPM | 無料トライアル枠 |
Music-3.0の歌詞生成・編集 | $0.01 | — | 歌詞の自動生成または最適化 |
どちらのモデルも、API呼び出し1回につき、ボーカル入りで最大5分の完成曲を生成する。エンドポイントはMusic 2.6と同じPOST /v1/music_generationだ。公開日時点でAPIリファレンスのインデックス済みサンプルにはmusic-2.6がまだ表示されている。そのためドキュメントが更新されるまでは、開発者側でMusic-3.0のIDを手動で試す必要があるかもしれない。
Music 3.0をローカルで動かす:ComfyUIと必要なハードウェア
コミュニティが特に注目したのは、オープンウェイトでの公開だ。ウェイトはHuggingFaceのMiniMaxAI/MiniMax-Music3から入手でき、ComfyUI向けに最適化された配布版もComfy-Org/MiniMax-Music-3で公開されている。
モデルカードと初期のコミュニティ報告では、ハードウェア要件は次の3段階に整理されている。
| モード | VRAM | おおよその速度 | 品質 |
|---|---|---|---|
| フル精度 | <24 GB(例:RTX 4090) | 最速 | 最高 |
| CPUオフロード | ~22 GB GPU + 32 GB以上のRAM | 中程度 | ほぼフル精度相当 |
| レイヤーストリーミング | 8 GB GPU + 32 GB以上のRAM | 低速 | 制約あり |
ローカルで始めるには、まずComfyUI 0.33.0以降をインストールする(ComfyUIコミュニティスレッドで確認)。次に、上記いずれかのHuggingFaceリポジトリからモデルファイルをダウンロードし、MiniMax-Music3用のComfyUIワークフローを読み込む。VRAMに合わせて精度モードを選び、生成すればよい。現時点で対応する計算バックエンドはCUDAのみで、ROCmやMPS向けの経路はまだない(コミュニティ報告より)。ComfyUIを使わないPythonネイティブ推論への道を開くDiffusers統合PRも進行中だ。
r/comfyuiのあるRedditユーザーは、AMD RX 7900 GRE(16 GB VRAM、32 GB RAM)で、カントリースタイルの140秒の音楽を約125秒で生成できたと報告している。r/StableDiffusionの別スレッドでは、コミュニティの空気を端的に表す次のコメントもあった。
「MiniMax Musicのおかげで、今日Sunoを解約した」 — r/StableDiffusion
商用利用を考えるなら、ライセンス条項は必ず確認しておきたい。ブログでは「オープンウェイト」「本番環境対応」と説明されている一方、ライセンス本文、商用利用条項、再配布条件は掲載されていない。HuggingFaceリポジトリのLICENSEファイルが一次情報となるため、収益を生む用途に投入する前に確認が必要だ。
Music 3.0のプロンプト設計:Structured Captionsとセクションタグ
Music 3.0の操作性の中心にあるのがStructured Captionsだ。楽曲の各セクションで何を起こしたいかを、時間の流れに沿って具体的に記述する形式を指す。公式ブログによると、適切なキャプションには次の要素を含める。
- ジャンルとサブジャンル(例:「progressive house / EDM」)
- テンポとキー(例:「126 BPM, B-flat major」)
- 使用楽器(例:「breathy male tenor, side-chained synths, club bass, hall reverb」)
- ボーカルの歌唱表現(例:「gravelly tenor with falsetto breaks」)
- 感情の展開(例:「airy verse building to high-energy chorus」)
- プロダクションの質感(例:「vintage room mix」「glossy keys」)
歌詞では、多くの音楽AIモデルが認識する標準的なセクションタグを使える。
[intro]
[verse]
[pre-chorus]
[chorus]
[bridge]
[instrumental]
[solo]
[outro]
Prompt Enhancement Systemは、「女性ボーカルのアップテンポなポップ曲」といった簡単な依頼を、音楽業界の用語を含むStructured Caption形式へ展開できる。専門語彙を知らない非ミュージシャンでも、細かくコントロールしやすくなる仕組みだ。インスト曲は歌詞なしで生成できる。ボーカル曲では、ユーザーが歌詞を用意するか、1曲0.01ドルの歌詞オプティマイザーを使う必要がある。
MiniMax Music 3.0とSuno・Udioを比較
判断したいのは、MiniMaxに1曲0.15ドルを支払うべきか、それとも既存サービスをサブスクで使うべきか、という点だ。
| 機能 | MiniMax Music 3.0 | Suno | Udio |
|---|---|---|---|
| 最大曲長 | 5分 | 約4分 | 約2~4分 |
| 料金モデル | 1曲0.15ドル(従量課金) | Pro:月額10ドル(500曲) | Standard:月額10ドル(約600曲) |
| 無料利用 | APIは3 RPM + オープンウェイト | 1日10曲 | 限定クレジット |
| オープンウェイト | あり(HuggingFace) | なし | なし |
| ローカル実行 | 可能(ComfyUI) | 不可 | 不可 |
| 商用利用 | HuggingFaceライセンスを確認 | 有料プランに含まれる | 有料プランに含まれる |
損益分岐点は月あたり約67曲だ。それより少なければ、1曲0.15ドルのMiniMax従量課金がどのサブスクリプションよりも安い。67曲を超えるなら、月額10ドルで500曲以上を生成できるSuno ProまたはUdio Standardのほうが、単純なコスト面では有利になる。ただし、すでにGPUを持っているなら無制限・無料で生成できるMiniMaxのオープンウェイト版が変数になる。
r/SunoAIとr/comfyuiのスレッドでは、ボーカルの自然さとプロンプト追従性においてMusic 3.0をSuno v4と競合できる水準と見る声が多く、特にエレクトロニックやポップで評価されている。一方、ロック、メタル、古いアコースティック系への反応はより割れており、密度の高いミックスでは濁りを指摘するユーザーもいる。多言語対応は、公式デモの中国語・英語に加え、コミュニティで試されたボリウッドラップでも良好に見える。
FAQ
MiniMax Music 3.0は無料で使える?
Music-3.0-free APIモデルなら、3 RPMの制限付きで無料生成が可能だ。また、オープンウェイトモデルはComfyUIを通じてローカルで無料実行できる。
Music 3.0でインスト曲は作れる?
可能。インスト曲の生成に歌詞は不要だ。ボーカル曲では、ユーザーが用意した歌詞、または1曲0.01ドルの歌詞オプティマイザーが必要になる。
Music 3.0のAPIモデルIDは?
Music-3.0(120 RPM、1曲0.15ドル)とMusic-3.0-free(3 RPM)の2つで、いずれもPOST /v1/music_generation経由で利用する。なお、APIドキュメントの一部には今もmusic-2.6への言及が残っている。
Music 3.0は英語以外の言語にも対応する?
公式デモには中国語と英語が含まれる。コミュニティテストではヒンディー語でも生成成功例がある(ボリウッドラップテスト)。公式の対応言語リストは公開されていない。
MiniMax Music 3.0で作った曲は商用利用できる?
HuggingFaceのLICENSEファイルとAPI利用規約を確認してほしい。ブログでは商用利用権について明記されていない。
Music 3.0をローカル実行するにはどれくらいのVRAMが必要?
フル精度では24 GB未満、CPUオフロードでは約22 GB、レイヤーストリーミングモードでは8 GBが目安となる。詳細は上のハードウェア表を参照してほしい。
用途別:どの選択肢が向くか
| 利用状況 | 推奨ルート | コスト |
|---|---|---|
| 数曲だけ試す、またはプロトタイプを作る | Music-3.0-free API | $0 |
| ときどき制作に使う(月67曲未満) | Music-3.0 API | $0.15/曲 |
| 大量に生成する(月67曲超) | Suno ProまたはUdio Standard | $10/月 |
| 24 GB GPUを所有し、無制限かつ無料で生成したい | HuggingFaceウェイトを使うローカルComfyUI | $0(計算コストのみ) |
| プログラムから音楽を生成するアプリを開発する | MiniMax platform経由のMusic-3.0 API | $0.15/曲 |
残る懸念は2つある。APIドキュメントがまだMusic 2.6中心であることと、オープンウェイトのライセンス条件が明確でないことだ。リリースが安定すればどちらも解消されるはずだが、少なくとも現時点でAPIの利用を妨げるものではない。