MiMo-V2.6-Pro는 실제로 공개됐고, 초기 벤치마크 성적을 감안하면 이례적으로 저렴한 모델입니다. 그렇다고 모든 프런티어 모델을 대체할 수 있는 만능 해법은 아닙니다. Xiaomi는 2026년 9월 21일 이 오픈 웨이트 모델을 공개했으며, 가장 설득력 있는 용도는 에이전트 자동화와 비용을 중시하는 API 작업입니다. 반면 로컬 배포와 장시간 실행 안정성은 아직 신중하게 접근해야 합니다.
MiMo-V2.6-Pro 리뷰: 결론부터 표로 정리하면
| 필요한 것 | 추천 | 이유 |
|---|---|---|
| 저렴한 에이전트 API 실험 | MiMo-V2.6-Pro를 시도해볼 만함 | Artificial Analysis 기준 입력 토큰 1M개당 $0.435, 출력 토큰 1M개당 $0.87이며 Intelligence Index 점수는 46입니다. |
| 오픈 웨이트와 멀티모달 입력 | 후보 목록에 넣을 만함 | Xiaomi와 독립 모델 페이지는 텍스트, 이미지, 오디오·음성, 동영상 입력과 1M 토큰 컨텍스트 윈도우를 지원한다고 설명합니다. |
| 간단한 로컬 설치 | 첫 선택으로는 피하는 편이 좋음 | OpenLM의 서빙 예시는 SGLang에 16-way 텐서 병렬 처리, 전문가 병렬 처리, 2개 노드를 사용합니다. |
| 가장 까다로운 터미널 또는 보안 작업 | 자체 워크로드로 벤치마크할 것 | 공개 결과에서는 일부 에이전트 테스트에서 MiMo가 앞서지만 Terminal Bench 4.0과 ExploitBench에서는 뒤처집니다. |
| 현재 바로 투입할 장시간 자율 에이전트 | 모니터링을 붙여 파일럿 운영 | 초기 사용자들은 멈춤, 장황한 응답, 늦은 동작을 보고했습니다. 공개된 사용자 사례도 아직 공개 후 몇 시간 안에 나온 초기 정보에 불과합니다. |
독립 분석 사이트인 Artificial Analysis 모델 페이지는 점수 46, 초당 약 129.7토큰의 출력 속도, Intelligence Index 작업당 추정 비용 $0.13을 기록하고 있습니다. 다만 이 수치는 비교를 위한 참고값이지, 여러분의 프롬프트나 실제 사용 provider에서 그대로 보장되는 결과는 아닙니다.
2026년 9월 21일 Xiaomi가 공개한 것
Xiaomi의 공식 MiMo-V2.6 발표는 단일 체크포인트가 아니라 하나의 모델 제품군을 소개합니다. MiMo-V2.6-Pro가 플래그십 모델이고, MiMo-V2.6-Flash는 효율성을 앞세운 소형 자매 모델입니다. 여기에 강화학습 연구를 위한 Qwen 기반 9B 증류 모델도 포함됐습니다.
Pro 체크포인트는 오픈 웨이트 방식의 희소 혼합 전문가 모델입니다. 공개 사양에 따르면 전체 파라미터는 약 1.02T개, 활성 파라미터는 42B개입니다. 컨텍스트 길이는 1M 토큰으로 명시돼 있으며, 텍스트·이미지·동영상·오디오를 기본 지원한다고 설명합니다.
Artificial Analysis는 Pro의 라이선스를 MIT로 표시하고 있으며, 가중치를 직접 호스팅할 수 있다고 설명합니다. 다만 모든 호스팅 API나 서빙 구성이 동일해지는 것은 아닙니다. provider별 제한, 구현 방식, 운영 비용은 별도로 따져봐야 합니다.
이번 출시에서 눈여겨볼 부분은 학습 방식이기도 합니다. Xiaomi는 코딩, 일반 에이전트, 시각 작업, 사이버보안을 하나의 혼합 강화학습 과정으로 다뤘다고 밝혔습니다. OpenLM의 기술 요약에는 Xiaomi가 공개한 학습 정보로 스텝당 1,568개 프롬프트와 프롬프트당 16개 롤아웃, 그룹 단위 평가, RL 이후 증류가 기록돼 있습니다.
MiMo-V2.6-Pro가 실제로 강한 영역
MiMo-V2.6-Pro는 순수 학술 코딩보다 에이전트 작업에서 더 강한 모습을 보입니다. OpenLM이 재현한 평가표에서 Pro는 AutomationBench 53.1점을 기록했습니다. Claude Opus 5는 50.3점, GPT-5.6 Sol은 45.8점입니다. Terminal Bench 2.1에서도 89.9점으로, 표에 기재된 Claude Opus 5의 89.1점과 GPT-5.6 Sol의 88.8점을 근소하게 앞섰습니다.
물론 모든 테스트에서 우세한 것은 아닙니다. DeepSWE v1.1에서는 71.9점으로 Claude Opus 5의 74.0점과 GPT-5.6 Sol의 73.0점에 못 미쳤습니다. MiMo VisualCoding 점수는 72.3점으로 GPT-5.6 Sol의 73.4점보다 낮지만, Claude Opus 5의 70.0점보다는 높았습니다.
이 결과가 뒷받침하는 추천은 분명합니다. MiMo-V2.6-Pro는 도구 사용, 워크플로 자동화, 비주얼 코딩, 비용을 중시하는 소프트웨어 에이전트의 후보로 검토할 만합니다. 하지만 공개된 ProgramBench 점수가 Claude Opus 5의 37.0점에 비해 26.5점인 만큼, 모든 코딩 작업에서 최고의 모델이라고 말해서는 안 됩니다.
Artificial Analysis는 유명 벤치마크 점수 외에도 실사용에 가까운 지표를 제공합니다. 해당 페이지에 따르면 출력 속도는 초당 129.7토큰, 첫 토큰까지 걸리는 시간은 2.17초, 컨텍스트 윈도우는 1M 토큰입니다. Model Picker 스냅샷에는 초당 134토큰과 종단 간 처리 시간 20.8초가 기록돼 있지만, 당시 스냅샷의 인덱스 버전은 기록되지 않았습니다. 따라서 이 수치는 고정된 사양이 아니라 특정 시점에 측정된 값으로 봐야 합니다.
추천을 바꿀 수 있는 trade-off
가장 큰 성능상의 주의점은 결과의 편차입니다. OpenLM 표에서 MiMo-V2.6-Pro는 Terminal Bench 4.0에서 34.9점을 기록했습니다. Claude Opus 5는 49.0점, GPT-5.6 Sol은 39.9점, Claude Fable 5는 42.4점입니다. ExploitBench에서는 Pro가 47.9점으로, Claude Opus 5의 70.0점과 GPT-5.6 Sol의 78.5점에 크게 못 미쳤습니다.
사이버보안 성능은 특히 과대해석하기 쉽습니다. Pro는 CyberGym에서 94.0점을 받았지만 ExploitBench 점수는 훨씬 낮습니다. 특정 보안 평가 세트에서 높은 점수를 받았다고 해서 광범위한 공격적 보안 역량까지 입증되는 것은 아닙니다.
초기 커뮤니티 반응에서는 벤치마크 표로는 확인하기 어려운 운영상의 단서도 나왔습니다. 모델이 공개된 지 불과 몇 시간밖에 지나지 않아 초기 X 논의 자체가 많지 않습니다. 사용자 @nilansaha는 다음과 같이 적었습니다.
“제가 불만인 점은 답변이 조금 지나치게 장황하고, 실제로 동작을 수행하기까지 꽤 오래 걸린다는 것입니다.”
또 다른 사용자 @benjitusk는 “mimo-v2.6-pro가 5분 동안 멈췄다”고 전했습니다. 이는 측정된 장애율이 아니라 초기 사용자 한 명의 경험에 불과합니다. 그래도 사람의 감독 없이 신속하게 행동해야 하는 에이전트라면 참고할 만한 사례입니다.
별도의 사용자 @luislucatero21는 Pelican SVG 테스트에서 MiMo-V2.6-Pro가 자신의 환경에서 $0.05의 비용으로 6분 9초가 걸렸다고 보고했습니다. 같은 테스트에서 Grok 4.7은 $1.20, 14분이 소요됐습니다. 비용과 시간을 함께 보여주는 흥미로운 사례지만, 통제된 벤치마크는 아닙니다.
가격과 배포: API를 먼저, 로컬은 그다음
| MiMo-V2.6-Pro API 항목 | 표시 가격 |
|---|---|
| 캐시 적중 입력 | 토큰 1M개당 $0.0036 |
| 캐시 미적중 입력 | 토큰 1M개당 $0.435 |
| 출력 | 토큰 1M개당 $0.87 |
| Artificial Analysis 작업 추정 비용 | 작업당 $0.13 |
토큰 가격은 Brocker의 출시 분석에 실린 기술 가격 비교를 기준으로 했습니다. Artificial Analysis도 동일하게 약 $0.435/$0.87의 일반 요금과 99% 캐시 할인을 제시합니다. 실제 청구액은 캐시 정책, 추론 토큰 계산 방식, 사용 provider에 따라 달라질 수 있습니다.
로컬 배포는 훨씬 까다롭습니다. OpenLM의 배포 메모에 따르면 SGLang 예시는 --tp 16, --dp 2, --ep 16, 2노드 구성, 최대 128개 실행 요청을 사용합니다. vLLM 예시는 텐서 병렬 처리 8과 GPU 메모리 사용률 95%를 적용합니다. 이 명령어들은 자체 호스팅이 가능하다는 중요한 근거이지만, 일반 소비자가 가볍게 설치할 수 있는 구성은 아닙니다.
대부분의 팀에게 합리적인 순서는 API 파일럿을 먼저 진행하고, 그다음 인프라 도입을 결정하는 것입니다. 1.02T 파라미터 규모의 희소 모델을 구동할 하드웨어를 구매하기 전에 작업 성공률, 도구 호출 지연, 출력 길이, 재시도 횟수, 전체 토큰 비용을 측정해보세요.
지금 MiMo-V2.6-Pro를 써볼 만한 사용자
오픈 웨이트, 멀티모달 입력, 긴 컨텍스트, 낮은 출력 비용이 필요한 작업이라면 API 파일럿 대상으로 MiMo-V2.6-Pro를 선택해볼 만합니다. 특히 개별 코딩 문제의 정답보다 실제 워크플로 완료 여부로 평가하는 자동화 중심 애플리케이션에 잘 맞습니다.
자체 호스팅은 이미 분산 GPU 서빙 환경을 운영하고 있거나, 모델 가중치와 배포 환경을 직접 통제해야 할 때 고려하는 편이 좋습니다. MIT 라이선스와 공개 체크포인트는 분명 장점이지만, 공개된 배포 레시피가 보여주듯 메모리, 네트워크, 서빙, 관측성 구축 작업까지 없애주지는 않습니다.
가장 까다로운 터미널 환경, 공격적 보안 평가, 또는 5분간의 멈춤도 허용할 수 없는 무감독 작업이 핵심이라면 다른 모델을 선택하거나 fallback을 함께 두는 편이 낫습니다. MiMo-V2.6-Pro의 아직 풀리지 않은 핵심 trade-off는 분명합니다. 토큰 단가는 매력적이지만, 그 비용 절감을 안정적인 운영으로 연결하는 데 드는 비용은 API 가격만 보고 예상한 것보다 훨씬 클 수 있습니다.
MiMo-V2.6-Pro FAQ
MiMo-V2.6-Pro는 공식 출시됐나요?
네. Xiaomi의 MiMo 계정과 공식 MiMo 문서는 2026년 9월 21일 Pro와 Flash를 발표했으며, 오픈 웨이트와 관련 연구 자료도 함께 공개했습니다.
MiMo-V2.6-Pro는 오픈 소스인가요?
오픈 웨이트 모델로 배포되고 있으며, Artificial Analysis는 MIT 라이선스로 표시하고 있습니다. 상업적으로 배포하기 전에는 사용하려는 체크포인트와 provider 약관을 별도로 확인해야 합니다.
MiMo-V2.6-Pro의 컨텍스트 윈도우는 얼마인가요?
공개 사양은 최대 1M 토큰입니다. 실제로 사용할 수 있는 컨텍스트 길이는 서빙 엔드포인트, 프롬프트 구성, 장문 작업에서의 품질에 따라 달라집니다.
MiMo-V2.6-Pro는 코딩에 좋은가요?
공개된 표 기준으로 DeepSWE v1.1에서 71.9점, AutomationBench에서 53.1점을 기록하는 등 여러 에이전트 코딩·자동화 평가에서 강점을 보입니다. 다만 ProgramBench와 Terminal Bench 4.0에서는 일부 폐쇄형 경쟁 모델보다 약한 결과를 냈습니다.
MiMo-V2.6-Pro API 가격은 얼마인가요?
표시된 일반 요금은 캐시 미적중 입력 토큰 1M개당 $0.435, 출력 토큰 1M개당 $0.87입니다. 캐시 적중 입력은 토큰 1M개당 $0.0036으로 표시돼 있습니다. 실제 출시 전에는 현재 provider의 청구 정책을 확인하세요.
Pro와 Flash 중 무엇을 써야 하나요?
공개 비교 자료만 보면 Pro가 더 높은 성능을 목표로 한 선택입니다. Flash는 효율성을 앞세운 자매 모델이며 Brocker의 가격표에서는 더 저렴하지만, 모델 이름만으로 운영 환경에 적합한 쪽을 판단하기보다는 자신의 워크로드에서 지연 시간과 작업 성공률을 직접 테스트해야 합니다.