AIREITER

MiniMax Music 3.0レビュー:API料金・ローカル環境のセットアップガイド

最終更新日: 2026-08-14 00:22:41

MiniMax Music 3.0は2026年8月13日に公開された音楽生成モデルだ。HuggingFaceではオープンウェイトとして提供され、APIでは1曲0.15ドルで最大5分の楽曲を生成できる。一方で、APIエンドポイントのドキュメントには依然としてMusic 2.6の記載が残り、ローカル推論では最大24 GBのVRAMを求められる場合がある。

Music 3.0で変わったこと:最大5分の楽曲を一度に生成

Music 3.0は、MiniMaxが推奨モデルとしてMusic 2.6の後継に位置付ける新バージョンだ。最大のポイントは、最長5分の楽曲を1回の生成で仕上げられること。作曲、アレンジ、演奏、プロダクションまでをまとめて出力する。MiniMaxによれば、従来版では曲が最初のセクションを越えるにつれ、ジャンル感、使用楽器、ボーカルの一貫性が崩れやすかったという課題への対応だという(公式ブログ)。

コンポーネントパラメータ数役割
グローバルLLM(Qwen3.5-8Bベース)8B楽曲全体にわたる音楽構造と意味情報を予測
ローカルLLM0.6B各フレーム内の細かな音響ディテールを補完
Flow-matching + Flow-VAE2.4B + 123M隠れ状態を連続的な音声へ変換(離散トークンではない)

内部では、8層のResidual Vector Quantization(RVQ)スタックを採用する。粗い音楽構造はLayer 1の16,384エントリーのコードブック、細かな音響情報はLayers 2~8の各1,024エントリーのコードブックで扱う構成だ。グローバルLLMが曲全体の文脈を追い、ローカルLLMがフレーム単位の音響予測を担う。さらにflow-matchingスタックは、離散トークンだけを復号するのではなく、統合した隠れ状態から最終音声をレンダリングする。公式ブログでは、従来のAI音楽モデルで目立った高域のアーティファクトや硬直したフレージングを抑えるとしている。ただしMiniMaxは、Music 2.6、Suno、Udioとの統制された比較ベンチマークは公開していない。

APIの料金、モデルID、レート制限

MiniMaxの公式プラットフォームには、従量課金で使えるMusic 3.0向けのモデルIDが2つ掲載されている。

モデルID1曲あたりの料金レート制限備考
Music-3.0$0.15120 RPMより高い制限は営業窓口へ問い合わせ
Music-3.0-free$03 RPM無料トライアル枠
Music-3.0の歌詞生成・編集$0.01—歌詞の自動生成または最適化

どちらのモデルも、API呼び出し1回につき、ボーカル入りで最大5分の完成曲を生成する。エンドポイントはMusic 2.6と同じPOST /v1/music_generationだ。公開日時点でAPIリファレンスのインデックス済みサンプルにはmusic-2.6がまだ表示されている。そのためドキュメントが更新されるまでは、開発者側でMusic-3.0のIDを手動で試す必要があるかもしれない。

Music 3.0をローカルで動かす:ComfyUIと必要なハードウェア

コミュニティが特に注目したのは、オープンウェイトでの公開だ。ウェイトはHuggingFaceのMiniMaxAI/MiniMax-Music3から入手でき、ComfyUI向けに最適化された配布版もComfy-Org/MiniMax-Music-3で公開されている。

モデルカードと初期のコミュニティ報告では、ハードウェア要件は次の3段階に整理されている。

モードVRAMおおよその速度品質
フル精度<24 GB(例:RTX 4090)最速最高
CPUオフロード~22 GB GPU + 32 GB以上のRAM中程度ほぼフル精度相当
レイヤーストリーミング8 GB GPU + 32 GB以上のRAM低速制約あり

ローカルで始めるには、まずComfyUI 0.33.0以降をインストールする(ComfyUIコミュニティスレッドで確認)。次に、上記いずれかのHuggingFaceリポジトリからモデルファイルをダウンロードし、MiniMax-Music3用のComfyUIワークフローを読み込む。VRAMに合わせて精度モードを選び、生成すればよい。現時点で対応する計算バックエンドはCUDAのみで、ROCmやMPS向けの経路はまだない(コミュニティ報告より)。ComfyUIを使わないPythonネイティブ推論への道を開くDiffusers統合PRも進行中だ。

r/comfyuiのあるRedditユーザーは、AMD RX 7900 GRE(16 GB VRAM、32 GB RAM)で、カントリースタイルの140秒の音楽を約125秒で生成できたと報告している。r/StableDiffusionの別スレッドでは、コミュニティの空気を端的に表す次のコメントもあった。

「MiniMax Musicのおかげで、今日Sunoを解約した」 — r/StableDiffusion

商用利用を考えるなら、ライセンス条項は必ず確認しておきたい。ブログでは「オープンウェイト」「本番環境対応」と説明されている一方、ライセンス本文、商用利用条項、再配布条件は掲載されていない。HuggingFaceリポジトリのLICENSEファイルが一次情報となるため、収益を生む用途に投入する前に確認が必要だ。

Music 3.0のプロンプト設計:Structured Captionsとセクションタグ

Music 3.0の操作性の中心にあるのがStructured Captionsだ。楽曲の各セクションで何を起こしたいかを、時間の流れに沿って具体的に記述する形式を指す。公式ブログによると、適切なキャプションには次の要素を含める。

  • ジャンルとサブジャンル(例:「progressive house / EDM」)
  • テンポとキー(例:「126 BPM, B-flat major」)
  • 使用楽器(例:「breathy male tenor, side-chained synths, club bass, hall reverb」)
  • ボーカルの歌唱表現(例:「gravelly tenor with falsetto breaks」)
  • 感情の展開(例:「airy verse building to high-energy chorus」)
  • プロダクションの質感(例:「vintage room mix」「glossy keys」)

歌詞では、多くの音楽AIモデルが認識する標準的なセクションタグを使える。

[intro]
[verse]
[pre-chorus]
[chorus]
[bridge]
[instrumental]
[solo]
[outro]

Prompt Enhancement Systemは、「女性ボーカルのアップテンポなポップ曲」といった簡単な依頼を、音楽業界の用語を含むStructured Caption形式へ展開できる。専門語彙を知らない非ミュージシャンでも、細かくコントロールしやすくなる仕組みだ。インスト曲は歌詞なしで生成できる。ボーカル曲では、ユーザーが歌詞を用意するか、1曲0.01ドルの歌詞オプティマイザーを使う必要がある。

MiniMax Music 3.0とSuno・Udioを比較

判断したいのは、MiniMaxに1曲0.15ドルを支払うべきか、それとも既存サービスをサブスクで使うべきか、という点だ。

機能MiniMax Music 3.0SunoUdio
最大曲長5分約4分約2~4分
料金モデル1曲0.15ドル(従量課金)Pro:月額10ドル(500曲)Standard:月額10ドル(約600曲)
無料利用APIは3 RPM + オープンウェイト1日10曲限定クレジット
オープンウェイトあり(HuggingFace)なしなし
ローカル実行可能(ComfyUI)不可不可
商用利用HuggingFaceライセンスを確認有料プランに含まれる有料プランに含まれる
MiniMax Music 3.0、Suno、Udioの月間楽曲数別コスト比較

損益分岐点は月あたり約67曲だ。それより少なければ、1曲0.15ドルのMiniMax従量課金がどのサブスクリプションよりも安い。67曲を超えるなら、月額10ドルで500曲以上を生成できるSuno ProまたはUdio Standardのほうが、単純なコスト面では有利になる。ただし、すでにGPUを持っているなら無制限・無料で生成できるMiniMaxのオープンウェイト版が変数になる。

r/SunoAIとr/comfyuiのスレッドでは、ボーカルの自然さとプロンプト追従性においてMusic 3.0をSuno v4と競合できる水準と見る声が多く、特にエレクトロニックやポップで評価されている。一方、ロック、メタル、古いアコースティック系への反応はより割れており、密度の高いミックスでは濁りを指摘するユーザーもいる。多言語対応は、公式デモの中国語・英語に加え、コミュニティで試されたボリウッドラップでも良好に見える。

FAQ

MiniMax Music 3.0は無料で使える?

Music-3.0-free APIモデルなら、3 RPMの制限付きで無料生成が可能だ。また、オープンウェイトモデルはComfyUIを通じてローカルで無料実行できる。

Music 3.0でインスト曲は作れる?

可能。インスト曲の生成に歌詞は不要だ。ボーカル曲では、ユーザーが用意した歌詞、または1曲0.01ドルの歌詞オプティマイザーが必要になる。

Music 3.0のAPIモデルIDは?

Music-3.0(120 RPM、1曲0.15ドル)とMusic-3.0-free(3 RPM)の2つで、いずれもPOST /v1/music_generation経由で利用する。なお、APIドキュメントの一部には今もmusic-2.6への言及が残っている。

Music 3.0は英語以外の言語にも対応する?

公式デモには中国語と英語が含まれる。コミュニティテストではヒンディー語でも生成成功例がある(ボリウッドラップテスト)。公式の対応言語リストは公開されていない。

MiniMax Music 3.0で作った曲は商用利用できる?

HuggingFaceのLICENSEファイルとAPI利用規約を確認してほしい。ブログでは商用利用権について明記されていない。

Music 3.0をローカル実行するにはどれくらいのVRAMが必要?

フル精度では24 GB未満、CPUオフロードでは約22 GB、レイヤーストリーミングモードでは8 GBが目安となる。詳細は上のハードウェア表を参照してほしい。

用途別:どの選択肢が向くか

利用状況推奨ルートコスト
数曲だけ試す、またはプロトタイプを作るMusic-3.0-free API$0
ときどき制作に使う(月67曲未満)Music-3.0 API$0.15/曲
大量に生成する(月67曲超)Suno ProまたはUdio Standard$10/月
24 GB GPUを所有し、無制限かつ無料で生成したいHuggingFaceウェイトを使うローカルComfyUI$0(計算コストのみ)
プログラムから音楽を生成するアプリを開発するMiniMax platform経由のMusic-3.0 API$0.15/曲

残る懸念は2つある。APIドキュメントがまだMusic 2.6中心であることと、オープンウェイトのライセンス条件が明確でないことだ。リリースが安定すればどちらも解消されるはずだが、少なくとも現時点でAPIの利用を妨げるものではない。