Muse Spark 1.2, 결론부터 말하면
Meta는 2026년 8월 5일 Muse Spark 1.2와 이를 구동하기 위한 새 터미널 에이전트 Muse Code를 함께 공개했다. 1.1보다 코딩 벤치마크 점수는 분명히 올랐지만, Claude Opus 5와의 비교에서는 세 가지 코딩 차트 모두 패했다. Muse Spark 1.2를 이해하는 핵심도 바로 여기에 있다. Meta는 코딩 학습 컴퓨팅을 늘리고 Muse Code 에이전트와 모델을 공동 학습했으며, 실제 수치도 개선됐다. 다만 세대 간 상승폭에는 모델 자체뿐 아니라 새 하니스의 효과도 섞여 있다. Terminal-Bench, DeepSWE, Meta 내부 코딩 평가에서는 Anthropic 모델이 여전히 4~9점 앞선다.
그럼에도 관심을 둘 이유는 가격이다. 일반 요금은 100만 토큰당 $1.25/$4.25로 유지됐고, contributor 티어를 쓰면 대략 12분의 1 수준까지 내려간다. 대신 기본 경로에서는 사용자의 코드가 Meta 학습에 활용된다. 또 최고 추론 강도에서는 첫 토큰이 나오기까지 걸리는 시간이 약 9배로 늘었다. Muse Spark 1.2를 프로덕션 코딩에 검토한다면, 리더보드 순위보다 이 두 조건을 먼저 봐야 한다.
1.1에서 달라진 점
Muse Spark 1.2는 Meta의 프런티어 추론 모델을 코딩에 맞춰 업데이트한 버전이다. 8월 5일 베타 단계의 터미널 기반 코딩 에이전트 Muse Code와 함께 출시됐다. Meta도 Muse Spark 1.1 대비 "중간 수준의 개선"이라고 표현한다. 과장 없는 표현이지만, 개선의 초점은 코딩 에이전트가 가장 버거워하는 영역에 맞춰져 있다. 여러 파일에 걸친 리팩터링, 긴 디버깅 세션, 단일 프롬프트를 한참 넘어가는 작업이 대상이다.
성능 향상의 배경에는 두 가지 학습 방식이 있다. 먼저 Muse Code가 처음부터 학습 루프에 들어갔다. Meta는 리젝션 샘플링한 하니스 실행 경로를 활용해 모델과 에이전트를 공동 학습했고, 모델이 자체 에이전트 안에서 특히 잘 작동하도록 조정했다. 회사 측은 여러 하니스에서 학습했기 때문에 다른 코딩 도구에도 일반화할 수 있다고 설명한다. 또 Meta는 자체 개선 루프도 운영했다. Muse Spark 1.1이 난도 높은 코딩 환경과 지시 이행 템플릿을 생성하고, 후보 답안을 이를 기준으로 채점해 1.2의 학습 데이터를 만들었다. Meta는 이 과정을 통해 1.2의 복잡한 지시 이행 능력이 측정 가능한 수준으로 좋아졌다고 본다.
이번 업데이트는 Muse 계열의 약점을 정면으로 겨냥한다. Muse Spark가 2026년 4월 처음 나왔을 때 에이전틱 코딩에서는 Claude Opus 4.6에 뒤졌다. SWE-Bench Verified 점수는 77.4였고 Claude Opus 4.6은 80.8이었다. 코딩 특화 체크포인트와 전용 하니스의 조합은 이에 대한 직접적인 답이며, 전반적인 에이전틱 역량도 유지한다는 것이 Meta의 입장이다.
벤치마크는 이렇게 읽어야 한다
Terminal-Bench 2.1에서 Muse Code로 구동한 Muse Spark 1.2는 82.9%를 기록했다. Codex의 GPT-5.6 Terra 81.8%, Grok Build의 Grok 4.5 81.6%를 근소하게 앞섰다. 하지만 Claude Code에서 최대 노력 수준으로 실행한 Claude Opus 5가 86.7%로 선두를 차지했다. DeepSWE 1.1에서는 59.3%로, Opus 5의 65.0%와 GPT-5.6 Terra의 64.8%에 이은 3위다. Meta 내부 코딩 벤치마크가 세 지표 가운데 가장 솔직하다. Muse Spark 1.2의 70.6%는 GPT-5.6 Terra 65.4%와 Gemini 3.6 Flash 63.9%를 넘지만, Opus 5의 79.4%와는 거의 9점 차이가 난다. 세 차트 모두 Claude가 1위다.
세대 간 향상 자체는 분명하다. Muse Spark 1.2는 1.1보다 Terminal-Bench에서 6.7점, DeepSWE에서 6.3점 높다. 다만 버전을 비교할 때 차트 라벨의 세부 사항을 놓치면 안 된다. 1.1 점수는 범용 mini-swe-agent 하니스에서 측정했고, 1.2는 Muse Code에서 실행했다. 따라서 상승분 일부는 새 모델이 아니라 새 하니스의 몫이다. Artificial Analysis의 혼합 Intelligence Index에서는 1.2가 54점을 받아 186개 모델 중 14위에 올랐다. 해당 등급의 중앙값은 32다. 1.1의 51점에서 오른 수치지만, 코딩 차트가 암시하는 것보다 변화 폭은 더 조용하다.
Claude와 GPT를 상대로 어느 정도인지가 구매자가 계속 묻는 질문이다. 1.2 데이터가 나오기 전 Reddit의 한 개발자는 이를 간단히 이렇게 물었다.
"Meta의 MUSE Spark 1.1을 써본 사람이 있나요? 추론, 코딩, 속도, 정확성, 컨텍스트 처리에서 Claude와 GPT와 비교하면 어떤지 궁금합니다."
1.2 벤치마크는 이 질문에 처음으로 엄밀한 답을 내놓는다. 경쟁력은 충분하지만 코딩에서는 명확한 2위이며, 대부분의 차트에서 GPT-5.6과 Gemini 선택지보다 앞선다.
실전 도입 전 확인할 두 가지
Muse Spark 1.2가 실제 워크플로에서 맞는 선택인지는 리더보드에 없는 두 가지 조건이 좌우한다.
xhigh에서는 첫 응답이 크게 느려진다
Muse Spark는 답하기 전에 생각하는 추론 모델이며, 이 과정을 끌 수는 없다. /effort 설정은 minimal부터 xhigh까지 다섯 단계로 나뉘고, 사고 토큰도 출력 토큰으로 과금된다. 최고 설정의 비용은 두 가지 의미에서 크다. OrcaRouter가 공개한 독립 측정 결과에 따르면 xhigh에서 첫 토큰까지 걸리는 시간은 1.1의 2.90초에서 26.12초로 늘어 약 9배가 됐다. 출력 속도도 초당 213.5토큰에서 165.0토큰으로 떨어졌다. Artificial Analysis Intelligence Index 평가를 1.2로 실행하는 비용은 $637.85로, 1.1의 $548.07보다 16% 높았다. 모델이 더 오래 숙고하기 때문이다. 개발자가 답변을 기다리는 대화형 코딩 작업에서는 최대 노력 수준이 주는 정확도 향상이 이 지연 시간을 감수할 만큼의 가치가 없는 경우가 많다.
contributor 티어는 할인 대신 코드를 제공한다
Meta는 Muse Spark 1.2를 두 가지 요금제로 제공하며, 신규 사용자가 주로 접하게 되는 티어에는 조건이 있다. contributor 티어는 입력/출력 100만 토큰당 $0.10/$0.20으로, 일반 요금 $1.25/$4.25와 비교해 입력은 약 12배, 출력은 약 21배 저렴하다. 캐시 입력은 $0.002로 거의 무료에 가깝다. 그 대가로 Meta가 프롬프트와 완료 결과를 향후 모델 학습에 사용할 수 있도록 명시적으로 허용해야 한다. 위 비교에서 가장 저렴한 요금이지만, 데이터로 비용을 치르는 구조다.
Muse Code의 기본 시작 경로도 이 티어로 연결된다. VentureBeat가 보도한 테스트에서는 한 줄 설치 프로그램이 Mac mini에서 정상 작동했다. 97 MB를 내려받고 로그인하면 됐다. 다만 에이전트는 사용 가능한 모델이 없다고 표시하며 어떤 작업도 실행하지 못했고, 할인 티어에서도 결제 수단을 요구했다. 저렴하다는 말은 맞지만 무료는 아니다. 요청 제한도 일반 티어의 분당 3,000회와 달리 분당 60회로 더 엄격하다. 이 티어가 프로덕션보다 개인 사용자와 프로토타이핑을 겨냥했다는 신호다. 독점 코드베이스를 다루는 팀이라면 일반 요금으로 의식적으로 전환하거나 Meta 영업팀을 통해 데이터 보존 없음 옵션을 요청해야 한다.
가격으로 보면 어느 위치인가
Muse Spark 1.2 일반 티어는 입력 100만 토큰당 $1.25, 캐시 입력 $0.15, 출력 $4.25다. 컨텍스트 윈도우는 100만 토큰이며 장문 컨텍스트 추가 요금은 없다. 코딩 모델 시장에서는 중저가 구간에 위치한다. 프런티어 코딩 선두 모델과 비교하면 확실히 저렴하다. Claude Opus 5는 $5/$25, GPT-5.5는 $5/$30으로 출력 가격이 대략 4~7배 높다. Z.ai의 GLM-5.2는 $1.40/$4.40으로 거의 같은 가격대이고, Grok 4.5의 $2/$6보다도 한 단계 낮다. 시장 최저가 쪽의 DeepSeek V4 Pro는 $0.435/$0.87로 몇 배 더 저렴하며, Muse Spark contributor 티어 역시 마찬가지다.
| 모델 | 입력 $/M | 출력 $/M | 캐시 $/M | 컨텍스트 |
|---|---|---|---|---|
| Muse Spark 1.2 (일반) | 1.25 | 4.25 | 0.15 | 1M |
| Muse Spark 1.2 (contributor)* | 0.10 | 0.20 | 0.002 | 1M |
| Claude Opus 5 | 5.00 | 25.00 | — | — |
| GPT-5.5 | 5.00 | 30.00 | — | — |
| GLM-5.2 | 1.40 | 4.40 | — | — |
| Grok 4.5 | 2.00 | 6.00 | — | — |
| DeepSeek V4 Pro | 0.435 | 0.87 | — | — |
\*contributor 티어는 Meta에 사용자의 데이터 학습 권한을 부여하며, 분당 60회 요청 제한이 적용된다.
어디서 쓸 수 있나, 지금의 대안은?
Muse Spark 1.2는 Meta Model API, Muse Code 터미널 에이전트, OpenRouter에서 사용할 수 있다. 다만 아직 모든 애그리게이터에 올라온 것은 아니다. 2026년 8월 6일 확인한 AIReiter 카탈로그에는 아직 등록되지 않았다. 통합 API 기반 스택을 쓰면서 지금 당장 코딩 모델이 필요하다면, 이미 라우팅되는 모델 중에서 골라야 한다.
현재 이용 가능한 모델 중 가격대가 가장 가까운 것은 GLM-5.2로, $1.40/$4.40이다. 2026년 8월 6일, "지금 사용할 수 있는" 모델의 실제 결과를 보기 위해 플랫폼 API를 통해 라우팅한 glm-5.2로 단발성 코딩 추론 작업을 실행했다. 초과 인출 검사가 빠진 Python 출금 함수가 과제였다. GLM-5.2는 3.2초 만에 응답했고(프롬프트 85토큰, 완료 128토큰), 누락된 잔액 검사를 정확히 짚었다. 이어 if amount > 0 and account_balance >= amount: 수정안을 제시하고, 수정 전에는 실패하고 수정 후에는 통과하는 테스트까지 작성했다. 단 하나의 작업일 뿐 벤치마크는 아니지만, 같은 가격대에서 지금 호출 가능한 작동하는 코딩 모델이라는 점은 확인할 수 있다. AIReiter 카탈로그에는 DeepSeek V4 Pro, Kimi K3, Claude Sonnet 5, GPT-5.6 계열도 코딩 가능한 선택지로 올라와 있다.
Muse Spark 1.2를 선택해야 할까?
무엇을 최우선으로 두는지에 따라 선택은 세 갈래로 나뉜다.
Muse Spark 1.2를 고를 경우 가격에 민감한 대규모 코딩 작업을 한다면 적합하다. 여러 파일 리팩터링, 긴 디버깅 세션, 장기 에이전틱 작업이 대표적이다. Meta, Muse Code 또는 OpenRouter를 직접 이용할 의향도 있어야 한다. $1.25/$4.25로 중간 가격대에서 프런티어급 코딩 역량을 제공하며, 컨텍스트 압축 기능을 갖춘 100만 토큰 컨텍스트 윈도우는 단일 프롬프트를 넘어서는 작업에 잘 맞는다. 작업이 첫 토큰 26초를 감당할 수 있는 경우가 아니라면 추론 노력은 xhigh 아래로 유지하는 편이 낫다.
Claude Opus 5를 고를 경우 코딩 벤치마크 최상위 성능이 필요하다면 이쪽이다. Muse Spark 1.2가 참여한 세 가지 벤치마크 모두에서 선두다. 정확도 우위를 얻는 대신 토큰당 비용은 4~6배 더 낸다.
이미 사용하는 애그리게이터의 모델을 고를 경우 지금 바로 출시해야 하는데 플랫폼에 Muse Spark가 없다면, 이미 올라와 있는 모델을 선택하는 편이 현실적이다. GLM-5.2는 기다릴 필요 없이 같은 가격대를 제공하고, 순수 비용이 가장 중요하다면 DeepSeek V4 Pro가 더 저렴하다.
FAQ
Muse Spark 1.2는 코딩에서 Claude Opus 5보다 나은가?
아니다. Claude Opus 5는 Meta가 공개한 세 가지 코딩 벤치마크(Terminal-Bench 2.1, DeepSWE 1.1, Meta 내부 코딩 평가) 모두에서 3.8~9점 차이로 앞선다. Muse Spark 1.2는 명확한 2위이며, 대부분의 차트에서 GPT-5.6 Terra와 Gemini 3.6 Flash보다 높다.
Muse Spark 1.2는 오픈소스인가?
아니다. Meta의 Llama 계열과 달리 Muse Spark는 독점 모델이다. 클라우드 전용이며, 내려받을 수 있는 가중치도 셀프 호스팅도 제공하지 않는다. Mark Zuckerberg는 오픈소스 출시 가능성에 대해 "더 공유할 내용이 있을 것"이라고 말했지만, 1.2는 가중치와 라이선스 없이 출시됐다.