AIREITER

MiniMax Music 3.0 리뷰: API 가격, 로컬 설치와 활용 가이드

마지막 업데이트: 2026-08-14 00:22:45

MiniMax Music 3.0는 2026년 8월 13일 공개됐다. HuggingFace 오픈 웨이트, 곡당 $0.15의 API, 한 번에 최대 5분짜리 곡 생성이 핵심이다. 다만 API 엔드포인트 문서는 아직 Music 2.6를 가리키고 있으며, 로컬 추론에는 최대 24 GB의 VRAM이 필요할 수 있다.

최대 5분 생성, Music 3.0에서 달라진 점

MiniMax는 Music 2.6의 후속 권장 모델로 Music 3.0를 내세운다. 가장 눈에 띄는 변화는 한 번의 생성으로 최대 5분 길이의 완성곡을 만들 수 있다는 점이다. 작곡, 편곡, 연주, 프로덕션이 동시에 생성되며, 곡이 첫 섹션을 넘어서면서 장르감·악기 구성·보컬 톤의 일관성이 무너지던 이전 버전의 문제를 겨냥했다는 설명이다(공식 블로그).

구성 요소파라미터역할
글로벌 LLM(Qwen3.5-8B 기반)8B곡 전체에 걸친 음악 구조와 의미를 예측
로컬 LLM0.6B각 프레임 안의 세밀한 음향 디테일을 보완
Flow-matching + Flow-VAE2.4B + 123M은닉 상태를 연속적인 오디오로 변환하며, 이산 토큰에만 의존하지 않음

내부적으로는 8단계 잔차 벡터 양자화(RVQ) 스택을 쓴다. 거친 음악 구조는 Layer 1의 16,384개 항목 코드북이, 세밀한 음향 정보는 각각 1,024개 항목을 가진 Layers 2–8이 맡는다. 글로벌 LLM은 곡 전반의 문맥을 추적하고 로컬 LLM은 프레임별 음향 예측을 담당한다. 이후 flow-matching 스택이 이산 토큰만 디코딩하는 방식이 아니라 결합된 은닉 상태에서 최종 오디오를 렌더링한다. 블로그는 이 구조가 기존 AI 음악 모델의 고주파 아티팩트와 경직된 프레이징을 줄인다고 주장하지만, MiniMax는 Music 2.6·Suno·Udio와의 통제된 벤치마크는 공개하지 않았다.

API 요금, 모델 ID, 호출 제한

MiniMax 공식 플랫폼에는 Music 3.0용 모델 ID 두 가지와 종량제 가격이 안내돼 있다.

모델 ID곡당 가격속도 제한비고
Music-3.0$0.15120 RPM더 높은 한도는 영업팀 문의
Music-3.0-free$03 RPM무료 체험 티어
Music-3.0 가사 생성·편집$0.01—가사 자동 생성 또는 최적화

두 모델 모두 API 호출 1회당 보컬을 포함한 최대 5분 길이의 완성곡을 생성한다. 엔드포인트는 Music 2.6와 동일한 POST /v1/music_generation다. 출시 당일 기준 API 레퍼런스 문서의 인덱싱된 예시는 여전히 music-2.6를 사용한다. 문서가 갱신되기 전까지는 개발자가 Music-3.0 ID를 직접 테스트해야 할 수 있다.

로컬에서 돌리는 방법: ComfyUI와 하드웨어 조건

커뮤니티가 특히 주목한 부분은 오픈 웨이트 공개다. 가중치는 HuggingFace의 MiniMaxAI/MiniMax-Music3에서 받을 수 있고, ComfyUI에 최적화된 배포판은 Comfy-Org/MiniMax-Music-3에 있다.

모델 카드와 초기 커뮤니티 보고에서 확인되는 하드웨어 구성은 세 가지다.

모드VRAM대략적인 속도품질
풀 프리시전<24 GB (예: RTX 4090)가장 빠름최상
CPU 오프로딩~22 GB GPU + 32 GB+ RAM보통풀 프리시전에 근접
레이어 스트리밍8 GB GPU + 32 GB+ RAM느림제한적

로컬 실행은 다음 순서로 시작하면 된다. ComfyUI 0.33.0 이상을 설치하고(ComfyUI 커뮤니티 스레드에서 확인), 위 HuggingFace 리포지토리 중 하나에서 모델 파일을 내려받는다. 이어 MiniMax-Music3용 ComfyUI 워크플로를 불러온 뒤, 보유 VRAM에 맞춰 정밀도 모드를 선택해 생성하면 된다. 현재 지원하는 컴퓨팅 백엔드는 CUDA뿐이며 ROCm이나 MPS 경로는 아직 없다(커뮤니티 보고 기준). ComfyUI 밖에서 Python 네이티브 추론을 가능하게 할 Diffusers 통합 PR도 진행 중이다.

r/comfyui의 한 Reddit 사용자는 AMD RX 7900 GRE(16 GB VRAM, 32 GB RAM)에서 컨트리 스타일 음악 140초 분량을 약 125초 만에 생성했다고 전했다. r/StableDiffusion의 다른 스레드는 커뮤니티 반응을 직설적으로 요약한다.

"MiniMax Music 덕분에 오늘 Suno 구독을 해지했습니다." — r/StableDiffusion

상업적으로 활용하기 전에는 라이선스 조건을 반드시 확인해야 한다. 블로그는 “open weights”, “production-ready”라고 표현하지만 라이선스 원문이나 상업 이용 조항, 재배포 조건은 공개하지 않았다. HuggingFace 리포지토리의 LICENSE 파일이 기준 문서이므로, 수익이 발생하는 작업에 적용하기 전 확인이 필요하다.

Music 3.0 프롬프트 작성법: Structured Captions와 섹션 태그

Music 3.0의 제어 방식은 Structured Captions를 중심으로 설계됐다. 곡의 각 구간에서 어떤 변화가 일어나야 하는지 시간 순서에 맞춰 상세히 적는 설명 형식이다. 공식 블로그에 따르면, 잘 작성된 캡션에는 다음 요소가 포함된다.

  • 장르와 하위 장르 (예: "progressive house / EDM")
  • 템포와 조성 (예: "126 BPM, B-flat major")
  • 악기 구성 (예: "breathy male tenor, side-chained synths, club bass, hall reverb")
  • 보컬 표현 방식 (예: "gravelly tenor with falsetto breaks")
  • 감정선의 흐름 (예: "airy verse building to high-energy chorus")
  • 프로덕션 질감 (예: "vintage room mix," "glossy keys")

가사에는 대부분의 음악 AI 모델이 인식하는 표준 섹션 태그를 사용한다.

[intro]
[verse]
[pre-chorus]
[chorus]
[bridge]
[instrumental]
[solo]
[outro]

Prompt Enhancement System은 “여성 보컬의 경쾌한 팝송” 같은 간단한 요청을 음악 업계 용어를 포함한 완전한 Structured Caption 형식으로 확장할 수 있다. 전문 용어를 몰라도 세밀한 제어를 활용할 수 있게 하는 기능이다. 연주곡은 가사 없이 생성할 수 있지만, 보컬곡에는 사용자가 제공한 가사 또는 곡당 $0.01의 가사 최적화 기능이 필요하다.

MiniMax Music 3.0, Suno, Udio 비교

결국 판단할 지점은 간단하다. MiniMax에 곡당 $0.15를 낼 것인가, 아니면 이미 자리 잡은 서비스의 구독제를 선택할 것인가다.

항목MiniMax Music 3.0SunoUdio
최대 곡 길이5분~4분~2–4분
가격 모델곡당 $0.15(종량제)Pro 월 $10(500곡)Standard 월 $10(~600곡)
무료 옵션API 3 RPM + 오픈 웨이트하루 10곡제한된 크레딧
오픈 웨이트예 (HuggingFace)아니오아니오
로컬 배포예 (ComfyUI)아니오아니오
상업적 이용HuggingFace 라이선스 확인 필요유료 플랜에 포함유료 플랜에 포함
월간 곡 생성량별 MiniMax Music 3.0, Suno, Udio 비용 비교

손익분기점은 월 약 67곡이다. 이보다 적게 만들면 곡당 $0.15인 MiniMax 종량제가 어떤 구독제보다 저렴하다. 반대로 그 이상이라면 500곡 이상을 제공하는 월 $10 Suno Pro 또는 Udio Standard가 순수 비용 측면에서 유리하다. 다만 이미 GPU를 갖고 있다면 MiniMax의 오픈 웨이트 로컬 옵션으로 제한 없이 무료 생성할 수 있다는 점이 변수다.

r/SunoAI와 r/comfyui의 커뮤니티 스레드에서는 Music 3.0를 보컬 자연스러움과 프롬프트 준수 측면에서 Suno v4와 경쟁할 만한 모델로 평가한다. 특히 일렉트로닉과 팝 장르에서 좋은 반응을 얻었다. 반면 록, 메탈, 오래된 스타일의 어쿠스틱 음악은 평가가 더 엇갈렸고, 밀도 높은 믹스에서 소리가 뭉개진다는 의견도 있었다. 공식 데모의 중국어와 영어, 커뮤니티가 테스트한 볼리우드 랩을 보면 다국어 지원은 강해 보이지만, 공식 언어 목록은 공개되지 않았다.

FAQ

MiniMax Music 3.0는 무료인가요?

Music-3.0-free API 모델은 무료로 곡을 생성할 수 있으며 제한은 3 RPM이다. 오픈 웨이트 모델을 ComfyUI로 로컬 실행하는 방법도 무료다.

Music 3.0로 연주곡을 만들 수 있나요?

가능하다. 연주곡 생성에는 가사가 필요 없으며, 보컬곡을 만들 때는 사용자가 가사를 제공하거나 곡당 $0.01의 가사 최적화 기능을 사용해야 한다.

Music 3.0의 API 모델 ID는 무엇인가요?

Music-3.0(120 RPM, 곡당 $0.15)과 Music-3.0-free(3 RPM)다. 둘 다 POST /v1/music_generation로 호출한다. 단, API 문서 일부는 아직 music-2.6를 참조한다.

Music 3.0는 영어 외 언어도 지원하나요?

공식 데모에는 중국어와 영어가 포함돼 있다. 커뮤니티 테스트에서는 힌디어 생성도 성공했다(Bollywood rap test). 다만 공식 지원 언어 목록은 공개되지 않았다.

MiniMax Music 3.0로 만든 트랙을 상업적으로 써도 되나요?

HuggingFace의 LICENSE 파일과 API 서비스 약관을 확인해야 한다. 블로그에는 상업적 이용 권리가 명시돼 있지 않다.

Music 3.0를 로컬에서 실행하려면 VRAM이 얼마나 필요한가요?

풀 프리시전은 24 GB 미만, CPU 오프로딩은 약 22 GB, 레이어 스트리밍 모드는 8 GB가 필요하다. 자세한 내용은 위 하드웨어 표를 참고하면 된다.

상황별 추천 선택지

사용 상황추천 경로비용
몇 곡만 테스트하거나 프로토타입을 만들 때Music-3.0-free API$0
가끔 제작에 사용할 때(월 <67곡)Music-3.0 API곡당 $0.15
대량 생성할 때(월 >67곡)Suno Pro 또는 Udio Standard월 $10
24 GB GPU를 보유했고 무제한 무료 생성을 원할 때HuggingFace weights를 이용한 로컬 ComfyUI$0(컴퓨팅 비용만)
프로그래밍 방식의 음악 생성 앱을 개발할 때MiniMax platform을 통한 Music-3.0 API곡당 $0.15

남은 과제는 두 가지다. 아직 Music 2.6에 머물러 있는 API 문서와, 오픈 웨이트에 대해 구체적으로 명시되지 않은 라이선스 조건이다. 출시가 안정화되면 모두 정리될 가능성이 높지만, 현재 API를 사용하는 데 장애가 되는 문제는 아니다.