MiniMax Music 3.0 于 2026 年 8 月 13 日发布,带来 HuggingFace 开放权重、每首 0.15 美元的 API,以及最长 5 分钟的完整歌曲生成能力。不过,API 接口文档目前仍在引用 Music 2.6;本地推理则可能需要最高 24 GB 显存。
Music 3.0 更新了什么?为什么 5 分钟歌曲很重要
Music 3.0 已取代 Music 2.6,成为 MiniMax 推荐的音乐模型。最明显的升级是:一次生成即可产出最长 5 分钟的歌曲,作曲、编曲、演唱和制作同步完成。MiniMax 表示,这解决了早期版本的一个典型问题:歌曲进入第一段之后,曲风、乐器配置和人声一致性容易逐渐失控(详见官方博客)。
| 组件 | 参数量 | 作用 |
|---|---|---|
| 全局 LLM(基于 Qwen3.5-8B) | 8B | 预测整首歌曲的音乐结构和语义 |
| 局部 LLM | 0.6B | 补充每一帧中的精细声学细节 |
| Flow matching + Flow-VAE | 2.4B + 123M | 将隐状态转换为连续音频,而不是离散 token |
在模型底层,8 层残差向量量化(RVQ)将粗粒度的音乐结构与精细声学细节分开:第 1 层使用包含 16,384 个条目的码本,第 2 至第 8 层则各使用 1,024 个条目的码本。全局 LLM 负责跟踪歌曲级上下文,局部 LLM 负责逐帧声学预测;随后,flow matching 模块根据融合后的隐状态渲染最终音频,而不是单纯从离散 token 解码。官方博客称,这种设计减少了早期 AI 音乐模型常见的高频伪影和僵硬乐句,但 MiniMax 尚未公布针对 Music 2.6、Suno 或 Udio 的受控基准测试。
API 价格、模型 ID 与速率限制
MiniMax 的官方平台列出了两个 Music 3.0 模型 ID,按量计费规则也很直观:
| 模型 ID | 每首价格 | 速率限制 | 说明 |
|---|---|---|---|
Music-3.0 | $0.15 | 120 RPM | 更高限制需联系销售 |
Music-3.0-free | $0 | 3 RPM | 免费试用层级 |
Music-3.0 歌词生成/编辑 | $0.01 | — | 自动生成或优化歌词 |
这两个模型每次 API 调用都会生成一首完整歌曲,带人声时最长可达 5 分钟。接口仍是 POST /v1/music_generation,与 Music 2.6 相同。不过在发布当天,API 参考文档中的示例仍然写着 music-2.6。在文档更新之前,开发者可能需要手动测试 Music-3.0 这个模型 ID。
本地运行 Music 3.0:ComfyUI 与硬件要求
真正让社区兴奋的是开放权重版本。模型权重已发布在 HuggingFace 的 MiniMaxAI/MiniMax-Music3,同时还有针对 ComfyUI 优化的版本:Comfy-Org/MiniMax-Music-3。
模型卡记录了三档硬件方案,早期社区反馈也基本印证了这些要求:
| 模式 | 显存 | 大致速度 | 质量 |
|---|---|---|---|
| 全精度 | <24 GB(例如 RTX 4090) | 最快 | 最佳 |
| CPU 卸载 | 约 22 GB GPU + 32 GB 以上内存 | 中等 | 接近完整模式 |
| 分层流式加载 | 8 GB GPU + 32 GB 以上内存 | 较慢 | 受限 |
本地上手流程并不复杂:先安装 0.33.0 或更高版本的 ComfyUI(ComfyUI 社区帖子已确认),再从上面的任一 HuggingFace 仓库下载模型文件,载入 MiniMax-Music3 的 ComfyUI 工作流,根据显存选择精度模式,最后开始生成。目前唯一支持的计算后端是 CUDA,还没有 ROCm 或 MPS 方案(据社区反馈)。此外,一个Diffusers 集成 PR正在推进,未来有望让用户脱离 ComfyUI,直接通过原生 Python 推理。
一位 r/comfyui 的Reddit 用户表示,他在 AMD RX 7900 GRE(16 GB 显存、32 GB 内存)上生成了 140 秒的乡村风格音乐,用时约 125 秒。r/StableDiffusion 的另一篇帖子则用一句话概括了社区情绪:
“感谢 Minimax Music,我今天已经取消了 Suno 订阅。”——r/StableDiffusion
如果准备商用,授权条款一定要先看清楚。博客使用了“开放权重”和“可用于生产环境”等表述,但没有公开许可证文本、商业使用条款或再分发条件。HuggingFace 仓库中的 LICENSE 文件才是最终依据;在发布任何营收相关作品前,请先完成确认。
Music 3.0 提示词怎么写:Structured Captions 与分段标签
Music 3.0 的核心控制方式是 Structured Captions。你需要用详细且按时间组织的描述,告诉模型歌曲每个段落应该发生什么。根据官方博客,一条完整的 caption 通常应包含:
- 曲风与子类型(例如“progressive house / EDM”)
- 速度与调性(例如“126 BPM,降 B 大调”)
- 乐器配置(例如“气声男高音、侧链合成器、俱乐部低音、厅堂混响”)
- 人声演绎(例如“带假声断句的沙哑男高音”)
- 情绪走向(例如“空灵主歌逐步推进至高能副歌”)
- 制作质感(例如“复古房间混音”“通透亮泽的键盘音色”)
歌词则使用大多数音乐 AI 模型都能识别的标准分段标签:
[intro]
[verse]
[pre-chorus]
[chorus]
[bridge]
[instrumental]
[solo]
[outro]
Prompt Enhancement System 可以把“带女声的欢快流行歌曲”这类简单需求,扩展成完整的 Structured Caption,并自动加入音乐行业常用术语。这样即使不了解专业词汇,非音乐从业者也能获得较细的控制能力。器乐曲无需歌词即可生成;人声歌曲则需要用户提供歌词,或者使用 0.01 美元/首的歌词优化器。
MiniMax Music 3.0 对比 Suno 和 Udio
真正需要考虑的问题是:按每首 0.15 美元向 MiniMax 付费,还是订阅一个更成熟的平台?
| 功能 | MiniMax Music 3.0 | Suno | Udio |
|---|---|---|---|
| 最长歌曲时长 | 5 分钟 | 约 4 分钟 | 约 2–4 分钟 |
| 定价模式 | 0.15 美元/首(按量付费) | Pro 每月 10 美元(500 首) | Standard 每月 10 美元(约 600 首) |
| 免费选项 | 3 RPM API + 开放权重 | 每天 10 首 | 有限额度 |
| 开放权重 | 有(HuggingFace) | 无 | 无 |
| 本地部署 | 有(ComfyUI) | 无 | 无 |
| 商业使用 | 查看 HuggingFace 许可证 | 付费套餐包含 | 付费套餐包含 |
按价格计算,盈亏平衡点约为每月 67 首歌曲。低于这个数量时,MiniMax 按 0.15 美元/首计费,比任何订阅都便宜;超过这个数量后,Suno Pro 或 Udio Standard 每月 10 美元、可生成 500 首以上歌曲,在单纯成本上更占优势。不过,MiniMax 的开放权重本地方案是最大的变量:如果你已经有一块合适的 GPU,就能不限量免费生成。
r/SunoAI 和 r/comfyui 的社区讨论普遍认为,Music 3.0 的人声自然度和提示词遵循能力已经能与 Suno v4 竞争,电子乐和流行乐尤其获得好评。摇滚、金属和较老派的原声风格反馈更为分化,有用户指出密集编曲中容易出现浑浊感。多语言表现看起来也不错:官方演示包含普通话和英语,社区测试还覆盖了宝莱坞说唱。
常见问题
MiniMax Music 3.0 免费吗?
Music-3.0-free API 模型可以免费生成歌曲,但速率限制为 3 RPM。你也可以通过 ComfyUI 在本地免费运行开放权重模型。
Music 3.0 能生成器乐曲吗?
可以。生成器乐曲不需要歌词;生成带人声的歌曲则需要用户提供歌词,或者使用 0.01 美元/首的歌词优化器。
Music 3.0 的 API 模型 ID 是什么?
Music-3.0(120 RPM,0.15 美元/首)和 Music-3.0-free(3 RPM),两者都通过 POST /v1/music_generation 调用。需要注意的是,API 文档部分页面仍在引用 music-2.6。
Music 3.0 支持英语以外的语言吗?
官方演示包含普通话和英语。社区测试显示,印地语也能成功生成(宝莱坞说唱测试)。目前官方尚未公布完整的语言列表。
MiniMax Music 3.0 生成的歌曲可以商用吗?
请查看 HuggingFace 的 LICENSE 文件以及 API 服务条款。博客没有明确说明商业使用权。
本地运行 Music 3.0 需要多少显存?
全精度模式需要低于 24 GB,CPU 卸载模式约需 22 GB,分层流式加载模式则需要 8 GB。具体要求请参考上方硬件表。
你该选择哪种方式?
| 使用场景 | 推荐方案 | 成本 |
|---|---|---|
| 测试或制作少量歌曲原型 | Music-3.0-free API | $0 |
| 偶尔用于生产(每月 <67 首) | Music-3.0 API | $0.15/首 |
| 高频生成(每月 >67 首) | Suno Pro 或 Udio Standard | $10/月 |
| 拥有 24 GB 显卡,希望不限量免费生成 | 使用 HuggingFace 权重进行本地 ComfyUI 部署 | $0(仅计算成本) |
| 开发需要程序化生成音乐的应用 | 通过 MiniMax 平台调用 Music-3.0 API | $0.15/首 |
目前还有两个问题没有解决:API 文档仍滞后于发布版本,开放权重的许可证条款也没有明确说明。随着版本逐渐稳定,这两点应该会得到处理,但它们都不影响 API 当前正常使用。