MiniMax Music 3.0 於 2026 年 8 月 13 日推出,同步釋出 HuggingFace 開放權重、每首 $0.15 的 API,單次最長可生成 5 分鐘歌曲。不過,API 端點文件目前仍以 Music 2.6 為主,本機推論的顯示卡記憶體需求最高也可能來到 24 GB。
一次生成 5 分鐘歌曲,Music 3.0 升級了什麼?
MiniMax 已將 Music 3.0 定位為取代 Music 2.6 的推薦音樂模型。這次最關鍵的變化,是能在一次生成中完成最長 5 分鐘的歌曲,從作曲、編曲、演奏到製作一併產出。MiniMax 認為,這正是前代模型的痛點:歌曲超過第一個段落後,曲風、樂器配置與人聲的一致性往往會逐漸流失(官方部落格)。
| 元件 | 參數量 | 負責工作 |
|---|---|---|
| Global LLM(基於 Qwen3.5-8B) | 8B | 預測整首歌的音樂結構與語意 |
| Local LLM | 0.6B | 補足每個影格內的細緻聲學細節 |
| Flow-matching + Flow-VAE | 2.4B + 123M | 將隱藏狀態轉換為連續音訊,而非離散 token |
底層架構採用 8 層殘差向量量化(RVQ):第 1 層使用 16,384 項 codebook,處理較粗略的音樂結構;第 2 至第 8 層則各有 1,024 項,用來保留細微聲學資訊。Global LLM 掌握全曲脈絡,Local LLM 負責逐影格的聲學預測;最後由 flow-matching 堆疊根據融合後的隱藏狀態生成音訊,而非只從離散 token 解碼。官方表示,這能降低早期 AI 音樂模型常見的高頻雜訊與僵硬樂句,但 MiniMax 尚未公布對比 Music 2.6、Suno 或 Udio 的受控基準測試。
Music 3.0 API:模型 ID、費用與速率限制
MiniMax 官方平台列出兩個 Music 3.0 模型 ID,均採簡單的隨用隨付計費:
| 模型 ID | 每首價格 | 速率限制 | 說明 |
|---|---|---|---|
Music-3.0 | $0.15 | 120 RPM | 如需更高限制,請聯絡業務 |
Music-3.0-free | $0 | 3 RPM | 免費試用層級 |
Music-3.0 歌詞生成/編輯 | $0.01 | — | 自動生成或最佳化歌詞 |
兩個模型每次 API 呼叫都能生成一首完整歌曲,最長 5 分鐘且可包含人聲。端點為 POST /v1/music_generation,與 Music 2.6 使用相同端點。截至發布當日,API 參考文件的索引範例仍顯示 music-2.6;在文件更新前,開發者可能得自行測試 Music-3.0 ID。
本機跑 Music 3.0:ComfyUI 安裝與硬體門檻
這次真正讓社群沸騰的,是開放權重版本。權重已上架 HuggingFace:官方倉庫為 MiniMaxAI/MiniMax-Music3,另有針對 ComfyUI 最佳化的版本 Comfy-Org/MiniMax-Music-3。
模型卡列出三種硬體模式,早期社群回報也大致印證了這些需求:
| 模式 | VRAM | 大致速度 | 品質 |
|---|---|---|---|
| 全精度 | <24 GB(例如 RTX 4090) | 最快 | 最佳 |
| CPU 卸載 | ~22 GB GPU + 32 GB 以上 RAM | 中等 | 接近全精度 |
| 分層串流 | 8 GB GPU + 32 GB 以上 RAM | 慢 | 受限 |
本機使用流程不複雜:先安裝 ComfyUI 0.33.0 或更新版本(ComfyUI 社群討論串已確認),從上述任一 HuggingFace 倉庫下載模型檔,再載入 MiniMax-Music3 的 ComfyUI 工作流,依照可用 VRAM 選擇精度模式後即可生成。目前唯一受支援的運算後端是 CUDA,尚未提供 ROCm 或 MPS 路徑(依社群回報)。此外,Diffusers 整合 PR正在進行,未來可望在 ComfyUI 之外提供原生 Python 推論。
r/comfyui 有位 Reddit 使用者回報,在 AMD RX 7900 GRE(16 GB VRAM、32 GB RAM)上生成 140 秒鄉村風格音樂,耗時約 125 秒。另一則 r/StableDiffusion 討論串則直白地概括了社群心聲:
「多虧 Minimax Music,我今天取消訂閱 Suno 了。」— r/StableDiffusion
若打算商用,授權條款務必先看清楚。官方部落格稱其為「開放權重」且「適合正式生產環境」,卻沒有公布授權全文、商用條款或再散布條件。HuggingFace 倉庫內的 LICENSE 檔才是權威來源;在發布任何具營收性質的作品前,應先自行確認。
Music 3.0 提示怎麼寫:Structured Captions 與段落標籤
Music 3.0 的控制核心是 Structured Captions,也就是按時間與歌曲段落安排的詳細描述,明確告訴模型每一段該發生什麼。根據官方部落格,一份完整 caption 應包含:
- 曲風與子曲風(例如「progressive house / EDM」)
- 速度與調性(例如「126 BPM、降 B 大調」)
- 樂器編制(例如「帶氣音的男高音、side-chain synths、club bass、hall reverb」)
- 人聲唱法(例如「帶沙啞質感、穿插假音斷點的男高音」)
- 情緒走向(例如「空靈主歌逐步堆疊至高能量副歌」)
- 製作風格(例如「vintage room mix」、「glossy keys」)
歌詞可使用多數音樂 AI 模型都能辨識的標準段落標籤:
[intro]
[verse]
[pre-chorus]
[chorus]
[bridge]
[instrumental]
[solo]
[outro]
Prompt Enhancement System 可將簡單需求,例如「帶女聲的輕快流行歌」,以音樂產業術語擴寫成完整 Structured Caption。即使不是音樂人,也能在無須熟悉專業詞彙的情況下取得更細緻的控制。純演奏曲不需要歌詞;人聲歌曲則必須自行提供歌詞,或使用每首 $0.01 的歌詞最佳化工具。
MiniMax Music 3.0、Suno、Udio 怎麼選?
真正值得比較的是:該付每首 $0.15 給 MiniMax,還是訂閱已成熟的服務?
| 功能 | MiniMax Music 3.0 | Suno | Udio |
|---|---|---|---|
| 最長歌曲長度 | 5 分鐘 | ~4 分鐘 | ~2–4 分鐘 |
| 計費模式 | 每首 $0.15(隨用隨付) | Pro 每月 $10(500 首) | Standard 每月 $10(~600 首) |
| 免費選項 | 3 RPM API + 開放權重 | 每天 10 首 | 有限額度 |
| 開放權重 | 是(HuggingFace) | 否 | 否 |
| 本機部署 | 是(ComfyUI) | 否 | 否 |
| 商業使用 | 請確認 HuggingFace 授權 | 付費方案包含 | 付費方案包含 |
成本損益兩平點約在每月 67 首歌。低於這個數量時,MiniMax 每首 $0.15 的隨用隨付方案,比任何訂閱制都便宜;超過後,Suno Pro 或 Udio Standard 每月 $10、可生成 500 首以上的方案,在純成本上較有利。但 MiniMax 的開放權重本機方案才是最大變數:如果手上已有 GPU,就能不限量免費生成。
r/SunoAI 與 r/comfyui 的討論認為,Music 3.0 在人聲自然度與提示遵循度上足以和 Suno v4 競爭,電子與流行曲風尤其獲得好評。不過,搖滾、金屬與較老派的木吉他風格,評價就比較分歧;部分使用者指出複雜混音會顯得混濁。多語言表現看來不錯,官方展示了中文與英文,社群也測試過 Bollywood rap。
常見問題
MiniMax Music 3.0 是免費的嗎?
Music-3.0-free API 模型可免費生成歌曲,但限制為 3 RPM。也能透過 ComfyUI 在本機免費執行開放權重模型。
Music 3.0 能生成純音樂嗎?
可以。生成純演奏曲不需要歌詞;生成有人聲的歌曲則需自行提供歌詞,或使用每首 $0.01 的歌詞最佳化工具。
Music 3.0 的 API 模型 ID 是什麼?
Music-3.0(120 RPM、每首 $0.15)與 Music-3.0-free(3 RPM),兩者都透過 POST /v1/music_generation 呼叫。請注意,部分API 文件頁面仍引用 music-2.6。
Music 3.0 支援英文以外的語言嗎?
官方展示包含中文與英文。社群測試顯示,印地語也能成功生成(Bollywood rap 測試)。官方尚未公布完整支援語言清單。
MiniMax Music 3.0 生成的歌曲能商用嗎?
請確認 HuggingFace 的 LICENSE 檔案與 API 服務條款。官方部落格沒有明確說明商用權利。
本機執行 Music 3.0 需要多少 VRAM?
全精度模式需低於 24 GB;CPU 卸載約需 22 GB;分層串流模式則可在 8 GB 下執行。請參考上方硬體表格。
依你的使用情境選方案
| 你的情況 | 建議方案 | 費用 |
|---|---|---|
| 測試或製作少量歌曲原型 | Music-3.0-free API | $0 |
| 偶爾用於製作(每月 <67 首) | Music-3.0 API | 每首 $0.15 |
| 大量生成(每月 >67 首) | Suno Pro 或 Udio Standard | 每月 $10 |
| 擁有 24 GB GPU,想不限量免費生成 | 使用 HuggingFace 權重在本機透過 ComfyUI 執行 | $0(僅運算成本) |
| 開發需要程式化生成音樂的應用程式 | 透過 MiniMax platform 使用 Music-3.0 API | 每首 $0.15 |
目前仍有兩個缺口:API 文件尚未跟上,內容仍以 Music 2.6 為主;開放權重的授權條款也未明確說明。隨著版本發布逐漸穩定,這兩項問題應會改善,但都不影響 API 今天就能正常運作。