AIREITER

Обзор MiniMax Music 3.0: API, цены и локальный запуск

Последнее обновление: 2026-08-14 00:24:09

MiniMax Music 3.0 вышла 13 августа 2026 года сразу в трёх вариантах: с открытыми весами на HuggingFace, API за $0,15 за песню и генерацией треков длительностью до пяти минут. При этом в документации API всё ещё фигурирует Music 2.6, а для локального запуска может потребоваться до 24 ГБ видеопамяти.

Что нового в Music 3.0 и зачем нужны пятиминутные треки

Music 3.0 сменила Music 2.6 в роли основной музыкальной модели MiniMax. Главное обновление — полноценная композиция длиной до пяти минут за один запуск: модель одновременно создаёт структуру, аранжировку, исполнение и продакшен. По версии MiniMax, это решает проблему предыдущих поколений, где после первой секции постепенно распадались жанровая стилистика, инструменты и цельность вокала (официальный блог).

КомпонентПараметрыРоль
Глобальная LLM (на базе Qwen3.5-8B)8BПредсказывает музыкальную структуру и смысловое содержание всей песни
Локальная LLM0,6BЗаполняет каждый фрейм мелкими акустическими деталями
Flow matching + Flow-VAE2,4B + 123MПреобразуют скрытые состояния в непрерывный аудиосигнал, а не в дискретные токены

В основе архитектуры лежит 8-слойная остаточная векторная квантизация (RVQ). Она отделяет общую музыкальную структуру от акустических нюансов: в первом слое используется кодовая книга на 16 384 элемента, а в слоях 2–8 — по 1 024 элемента. Глобальная LLM следит за развитием композиции целиком, локальная отвечает за акустическое предсказание в каждом фрейме, а связка flow matching формирует финальный звук из объединённых скрытых состояний, не ограничиваясь декодированием одних дискретных токенов. В блоге утверждается, что такой подход уменьшает высокочастотные артефакты и неестественную фразировку, характерные для ранних AI-моделей музыки. Однако контролируемого сравнения с Music 2.6, Suno или Udio MiniMax пока не публиковала.

Цены API, идентификаторы моделей и лимиты запросов

На официальной платформе MiniMax указаны две модели Music 3.0 с простой оплатой по факту использования:

Идентификатор моделиЦена за песнюЛимит запросовПримечания
Music-3.0$0,15120 RPMДля увеличения лимита нужно обратиться в отдел продаж
Music-3.0-free$03 RPMБесплатный пробный уровень
Генерация и редактирование текста для Music-3.0$0,01—Автоматическая генерация или оптимизация текста песни

Обе модели создают за один вызов API полноценную песню с вокалом длительностью до пяти минут. Используется эндпоинт POST /v1/music_generation — тот же, что и в Music 2.6. На момент запуска в справочнике API в примерах всё ещё встречается music-2.6. Поэтому разработчикам, вероятно, придётся вручную проверить идентификатор Music-3.0, пока документацию не обновят.

Локальный запуск Music 3.0: ComfyUI и требования к железу

Больше всего сообщество заинтересовал релиз открытых весов. Они доступны на HuggingFace в репозитории MiniMaxAI/MiniMax-Music3, а оптимизированная для ComfyUI версия опубликована здесь: Comfy-Org/MiniMax-Music-3.

В карточке модели описаны три конфигурации, их же подтверждают первые отчёты пользователей:

РежимВидеопамятьПримерная скоростьКачество
Полная точность<24 ГБ (например, RTX 4090)МаксимальнаяЛучшее
Выгрузка на CPU~22 ГБ GPU + 32 ГБ и более RAMСредняяПочти максимальное
Потоковая загрузка слоёв8 ГБ GPU + 32 ГБ и более RAMНизкаяОграниченное

Для локального запуска установите ComfyUI 0.33.0 или новее (это подтверждает обсуждение сообщества ComfyUI), скачайте файлы модели из одного из указанных выше репозиториев HuggingFace, загрузите workflow ComfyUI для MiniMax-Music3, выберите режим точности под доступный объём VRAM и запустите генерацию. Сейчас поддерживается только CUDA: вариантов для ROCm и MPS пока нет (по данным сообщества). Также идёт работа над PR с интеграцией Diffusers — после его принятия модель можно будет запускать нативно из Python, без ComfyUI.

Один из пользователей Reddit на r/comfyui сообщил, что сгенерировал 140 секунд музыки в стиле кантри примерно за 125 секунд на AMD RX 7900 GRE (16 ГБ VRAM, 32 ГБ RAM). А участник r/StableDiffusion выразил общий настрой сообщества предельно прямолинейно:

«Сегодня я отменил подписку на Suno благодаря Minimax Music». — r/StableDiffusion

Перед коммерческим использованием обязательно изучите условия лицензии. В блоге используются формулировки «открытые веса» и «готовая к продакшену модель», но сам текст лицензии, правила коммерческого применения и условия распространения не опубликованы. Авторитетным источником остаётся файл LICENSE в репозитории HuggingFace — проверьте его до того, как выпускать работу, приносящую доход.

Как задавать промпты для Music 3.0: Structured Captions и теги секций

Главный инструмент управления Music 3.0 — Structured Captions, подробные описания, организованные по времени. В них указывается, что должно происходить в каждой части композиции. Согласно официальному блогу, хороший caption включает:

  • Жанр и поджанр (например, «progressive house / EDM»)
  • Темп и тональность (например, «126 BPM, си-бемоль мажор»)
  • Инструменты (например, «воздушный мужской тенор, синтезаторы с сайдчейном, клубный бас, реверберация концертного зала»)
  • Манеру исполнения вокала (например, «хрипловатый тенор с переходами в фальцет»)
  • Эмоциональную дугу (например, «воздушный куплет, переходящий в энергичный припев»)
  • Характер продакшена (например, «винтажный комнатный микс», «глянцевые клавишные»)

Для текста песни используются стандартные теги секций, которые распознаёт большинство музыкальных AI-моделей:

[intro]
[verse]
[pre-chorus]
[chorus]
[bridge]
[instrumental]
[solo]
[outro]

Система улучшения промптов может превратить короткий запрос вроде «бодрая поп-песня с женским вокалом» в полноценный Structured Caption с терминологией музыкальной индустрии. Благодаря этому подробный контроль доступен и тем, кто не разбирается в музыке. Инструментальные треки создаются без текста; для вокальных композиций нужны собственные слова или оптимизатор текста за $0,01 за песню.

MiniMax Music 3.0 против Suno и Udio

Вопрос здесь простой: платить MiniMax $0,15 за песню или оформить подписку на уже известных конкурентов?

ПараметрMiniMax Music 3.0SunoUdio
Максимальная длина песни5 минут~4 минуты~2–4 минуты
Модель оплаты$0,15 за песню (оплата по факту)$10/мес. Pro (500 песен)$10/мес. Standard (~600 песен)
Бесплатный вариантAPI с лимитом 3 RPM + открытые веса10 песен в деньОграниченное число кредитов
Открытые весаДа (HuggingFace)НетНет
Локальный запускДа (ComfyUI)НетНет
Коммерческое использованиеПроверяйте лицензию HuggingFaceВключено в платные планыВключено в платные планы
Сравнение стоимости MiniMax Music 3.0, Suno и Udio в зависимости от числа песен в месяц

Точка безубыточности — примерно 67 песен в месяц. Если создавать меньше, оплата MiniMax по тарифу $0,15 за трек будет выгоднее любой подписки. При большем объёме Suno Pro или Udio Standard за $10 в месяц и 500+ песен выигрывают по чистой стоимости. Но локальный запуск MiniMax с открытыми весами меняет расклад: если у вас уже есть подходящая видеокарта, генерация становится безлимитной и бесплатной.

Обсуждения на r/SunoAI и r/comfyui показывают, что Music 3.0 воспринимается как конкурент Suno v4 по естественности вокала и следованию промпту. Особенно хорошо пользователи отзываются об электронной и поп-музыке. С роком, металом и старой акустической стилистикой мнения менее однозначны: в плотных миксах некоторые слышат мутность. Мультиязычная генерация — в официальных демо есть мандаринский и английский, а сообщество также проверяло Bollywood rap — выглядит убедительно.

FAQ

MiniMax Music 3.0 бесплатна?

API-модель Music-3.0-free создаёт песни бесплатно, но ограничена скоростью 3 RPM. Кроме того, модель с открытыми весами можно бесплатно запускать локально через ComfyUI.

Умеет ли Music 3.0 создавать инструментальные треки?

Да. Для инструментальной генерации текст песни не нужен. Для вокальных треков потребуются собственные слова или оптимизатор текста стоимостью $0,01 за песню.

Какой идентификатор API у Music 3.0?

Music-3.0 (120 RPM, $0,15 за песню) и Music-3.0-free (3 RPM). Обе модели вызываются через POST /v1/music_generation. Учтите, что на некоторых страницах документации API всё ещё указан music-2.6.

Поддерживает ли Music 3.0 языки, кроме английского?

В официальных демо представлены мандаринский и английский. Тесты сообщества показывают успешную генерацию на хинди (тест Bollywood rap). Официального списка поддерживаемых языков пока нет.

Можно ли использовать треки MiniMax Music 3.0 в коммерческих проектах?

Проверьте файл LICENSE на HuggingFace и условия использования API. В блоге права на коммерческое применение не уточняются.

Сколько VRAM нужно для локального запуска Music 3.0?

Менее 24 ГБ в режиме полной точности, около 22 ГБ при выгрузке на CPU или 8 ГБ в режиме потоковой загрузки слоёв. Подробности — в таблице с требованиями к железу выше.

Какой вариант выбрать

СценарийРекомендуемый вариантСтоимость
Проверка модели или создание нескольких прототиповAPI Music-3.0-free$0
Периодическое использование в продакшене (<67 песен/мес.)API Music-3.0$0,15 за песню
Генерация в больших объёмах (>67 песен/мес.)Pro-план Suno или Standard-план Udio$10/мес.
Есть GPU на 24 ГБ, нужна безлимитная бесплатная генерацияЛокальный ComfyUI с весами HuggingFace$0 (только вычислительные ресурсы)
Разработка приложения с программной генерацией музыкиAPI Music-3.0 через платформу MiniMax$0,15 за песню

Пока остаются два пробела: документация API не успела обновиться и всё ещё описывает Music 2.6, а условия лицензии открытых весов не раскрыты. По мере стабилизации релиза оба вопроса, вероятно, прояснятся, но уже сейчас ни один из них не мешает пользоваться API.