MiniMax Music 3.0 вышла 13 августа 2026 года сразу в трёх вариантах: с открытыми весами на HuggingFace, API за $0,15 за песню и генерацией треков длительностью до пяти минут. При этом в документации API всё ещё фигурирует Music 2.6, а для локального запуска может потребоваться до 24 ГБ видеопамяти.
Что нового в Music 3.0 и зачем нужны пятиминутные треки
Music 3.0 сменила Music 2.6 в роли основной музыкальной модели MiniMax. Главное обновление — полноценная композиция длиной до пяти минут за один запуск: модель одновременно создаёт структуру, аранжировку, исполнение и продакшен. По версии MiniMax, это решает проблему предыдущих поколений, где после первой секции постепенно распадались жанровая стилистика, инструменты и цельность вокала (официальный блог).
| Компонент | Параметры | Роль |
|---|---|---|
| Глобальная LLM (на базе Qwen3.5-8B) | 8B | Предсказывает музыкальную структуру и смысловое содержание всей песни |
| Локальная LLM | 0,6B | Заполняет каждый фрейм мелкими акустическими деталями |
| Flow matching + Flow-VAE | 2,4B + 123M | Преобразуют скрытые состояния в непрерывный аудиосигнал, а не в дискретные токены |
В основе архитектуры лежит 8-слойная остаточная векторная квантизация (RVQ). Она отделяет общую музыкальную структуру от акустических нюансов: в первом слое используется кодовая книга на 16 384 элемента, а в слоях 2–8 — по 1 024 элемента. Глобальная LLM следит за развитием композиции целиком, локальная отвечает за акустическое предсказание в каждом фрейме, а связка flow matching формирует финальный звук из объединённых скрытых состояний, не ограничиваясь декодированием одних дискретных токенов. В блоге утверждается, что такой подход уменьшает высокочастотные артефакты и неестественную фразировку, характерные для ранних AI-моделей музыки. Однако контролируемого сравнения с Music 2.6, Suno или Udio MiniMax пока не публиковала.
Цены API, идентификаторы моделей и лимиты запросов
На официальной платформе MiniMax указаны две модели Music 3.0 с простой оплатой по факту использования:
| Идентификатор модели | Цена за песню | Лимит запросов | Примечания |
|---|---|---|---|
Music-3.0 | $0,15 | 120 RPM | Для увеличения лимита нужно обратиться в отдел продаж |
Music-3.0-free | $0 | 3 RPM | Бесплатный пробный уровень |
Генерация и редактирование текста для Music-3.0 | $0,01 | — | Автоматическая генерация или оптимизация текста песни |
Обе модели создают за один вызов API полноценную песню с вокалом длительностью до пяти минут. Используется эндпоинт POST /v1/music_generation — тот же, что и в Music 2.6. На момент запуска в справочнике API в примерах всё ещё встречается music-2.6. Поэтому разработчикам, вероятно, придётся вручную проверить идентификатор Music-3.0, пока документацию не обновят.
Локальный запуск Music 3.0: ComfyUI и требования к железу
Больше всего сообщество заинтересовал релиз открытых весов. Они доступны на HuggingFace в репозитории MiniMaxAI/MiniMax-Music3, а оптимизированная для ComfyUI версия опубликована здесь: Comfy-Org/MiniMax-Music-3.
В карточке модели описаны три конфигурации, их же подтверждают первые отчёты пользователей:
| Режим | Видеопамять | Примерная скорость | Качество |
|---|---|---|---|
| Полная точность | <24 ГБ (например, RTX 4090) | Максимальная | Лучшее |
| Выгрузка на CPU | ~22 ГБ GPU + 32 ГБ и более RAM | Средняя | Почти максимальное |
| Потоковая загрузка слоёв | 8 ГБ GPU + 32 ГБ и более RAM | Низкая | Ограниченное |
Для локального запуска установите ComfyUI 0.33.0 или новее (это подтверждает обсуждение сообщества ComfyUI), скачайте файлы модели из одного из указанных выше репозиториев HuggingFace, загрузите workflow ComfyUI для MiniMax-Music3, выберите режим точности под доступный объём VRAM и запустите генерацию. Сейчас поддерживается только CUDA: вариантов для ROCm и MPS пока нет (по данным сообщества). Также идёт работа над PR с интеграцией Diffusers — после его принятия модель можно будет запускать нативно из Python, без ComfyUI.
Один из пользователей Reddit на r/comfyui сообщил, что сгенерировал 140 секунд музыки в стиле кантри примерно за 125 секунд на AMD RX 7900 GRE (16 ГБ VRAM, 32 ГБ RAM). А участник r/StableDiffusion выразил общий настрой сообщества предельно прямолинейно:
«Сегодня я отменил подписку на Suno благодаря Minimax Music». — r/StableDiffusion
Перед коммерческим использованием обязательно изучите условия лицензии. В блоге используются формулировки «открытые веса» и «готовая к продакшену модель», но сам текст лицензии, правила коммерческого применения и условия распространения не опубликованы. Авторитетным источником остаётся файл LICENSE в репозитории HuggingFace — проверьте его до того, как выпускать работу, приносящую доход.
Как задавать промпты для Music 3.0: Structured Captions и теги секций
Главный инструмент управления Music 3.0 — Structured Captions, подробные описания, организованные по времени. В них указывается, что должно происходить в каждой части композиции. Согласно официальному блогу, хороший caption включает:
- Жанр и поджанр (например, «progressive house / EDM»)
- Темп и тональность (например, «126 BPM, си-бемоль мажор»)
- Инструменты (например, «воздушный мужской тенор, синтезаторы с сайдчейном, клубный бас, реверберация концертного зала»)
- Манеру исполнения вокала (например, «хрипловатый тенор с переходами в фальцет»)
- Эмоциональную дугу (например, «воздушный куплет, переходящий в энергичный припев»)
- Характер продакшена (например, «винтажный комнатный микс», «глянцевые клавишные»)
Для текста песни используются стандартные теги секций, которые распознаёт большинство музыкальных AI-моделей:
[intro]
[verse]
[pre-chorus]
[chorus]
[bridge]
[instrumental]
[solo]
[outro]
Система улучшения промптов может превратить короткий запрос вроде «бодрая поп-песня с женским вокалом» в полноценный Structured Caption с терминологией музыкальной индустрии. Благодаря этому подробный контроль доступен и тем, кто не разбирается в музыке. Инструментальные треки создаются без текста; для вокальных композиций нужны собственные слова или оптимизатор текста за $0,01 за песню.
MiniMax Music 3.0 против Suno и Udio
Вопрос здесь простой: платить MiniMax $0,15 за песню или оформить подписку на уже известных конкурентов?
| Параметр | MiniMax Music 3.0 | Suno | Udio |
|---|---|---|---|
| Максимальная длина песни | 5 минут | ~4 минуты | ~2–4 минуты |
| Модель оплаты | $0,15 за песню (оплата по факту) | $10/мес. Pro (500 песен) | $10/мес. Standard (~600 песен) |
| Бесплатный вариант | API с лимитом 3 RPM + открытые веса | 10 песен в день | Ограниченное число кредитов |
| Открытые веса | Да (HuggingFace) | Нет | Нет |
| Локальный запуск | Да (ComfyUI) | Нет | Нет |
| Коммерческое использование | Проверяйте лицензию HuggingFace | Включено в платные планы | Включено в платные планы |
Точка безубыточности — примерно 67 песен в месяц. Если создавать меньше, оплата MiniMax по тарифу $0,15 за трек будет выгоднее любой подписки. При большем объёме Suno Pro или Udio Standard за $10 в месяц и 500+ песен выигрывают по чистой стоимости. Но локальный запуск MiniMax с открытыми весами меняет расклад: если у вас уже есть подходящая видеокарта, генерация становится безлимитной и бесплатной.
Обсуждения на r/SunoAI и r/comfyui показывают, что Music 3.0 воспринимается как конкурент Suno v4 по естественности вокала и следованию промпту. Особенно хорошо пользователи отзываются об электронной и поп-музыке. С роком, металом и старой акустической стилистикой мнения менее однозначны: в плотных миксах некоторые слышат мутность. Мультиязычная генерация — в официальных демо есть мандаринский и английский, а сообщество также проверяло Bollywood rap — выглядит убедительно.
FAQ
MiniMax Music 3.0 бесплатна?
API-модель Music-3.0-free создаёт песни бесплатно, но ограничена скоростью 3 RPM. Кроме того, модель с открытыми весами можно бесплатно запускать локально через ComfyUI.
Умеет ли Music 3.0 создавать инструментальные треки?
Да. Для инструментальной генерации текст песни не нужен. Для вокальных треков потребуются собственные слова или оптимизатор текста стоимостью $0,01 за песню.
Какой идентификатор API у Music 3.0?
Music-3.0 (120 RPM, $0,15 за песню) и Music-3.0-free (3 RPM). Обе модели вызываются через POST /v1/music_generation. Учтите, что на некоторых страницах документации API всё ещё указан music-2.6.
Поддерживает ли Music 3.0 языки, кроме английского?
В официальных демо представлены мандаринский и английский. Тесты сообщества показывают успешную генерацию на хинди (тест Bollywood rap). Официального списка поддерживаемых языков пока нет.
Можно ли использовать треки MiniMax Music 3.0 в коммерческих проектах?
Проверьте файл LICENSE на HuggingFace и условия использования API. В блоге права на коммерческое применение не уточняются.
Сколько VRAM нужно для локального запуска Music 3.0?
Менее 24 ГБ в режиме полной точности, около 22 ГБ при выгрузке на CPU или 8 ГБ в режиме потоковой загрузки слоёв. Подробности — в таблице с требованиями к железу выше.
Какой вариант выбрать
| Сценарий | Рекомендуемый вариант | Стоимость |
|---|---|---|
| Проверка модели или создание нескольких прототипов | API Music-3.0-free | $0 |
| Периодическое использование в продакшене (<67 песен/мес.) | API Music-3.0 | $0,15 за песню |
| Генерация в больших объёмах (>67 песен/мес.) | Pro-план Suno или Standard-план Udio | $10/мес. |
| Есть GPU на 24 ГБ, нужна безлимитная бесплатная генерация | Локальный ComfyUI с весами HuggingFace | $0 (только вычислительные ресурсы) |
| Разработка приложения с программной генерацией музыки | API Music-3.0 через платформу MiniMax | $0,15 за песню |
Пока остаются два пробела: документация API не успела обновиться и всё ещё описывает Music 2.6, а условия лицензии открытых весов не раскрыты. По мере стабилизации релиза оба вопроса, вероятно, прояснятся, но уже сейчас ни один из них не мешает пользоваться API.