MiMo-V2.6-Pro 不只是發表消息,而是一款已公開、在早期基準表現上又異常便宜的模型。不過,它還稱不上能取代所有前沿模型的萬用方案。小米在 September 21, 2026 發表這款開放權重模型;目前最有說服力的用途是 Agent 自動化與成本敏感型 API 工作,至於本地部署和長時間運作的穩定性,仍然需要保守看待。
MiMo-V2.6-Pro 評測:先用這張表看懂是否適合你
| 如果你需要…… | 建議 | 原因 |
|---|---|---|
| 低成本的 Agent API 實驗 | 可以試試 MiMo-V2.6-Pro | Artificial Analysis 列出的價格為每 1M input tokens $0.435、每 1M output tokens $0.87,Intelligence Index 分數為 46。 |
| 開放權重與多模態輸入 | 值得列入候選 | 小米與獨立模型頁面都指出,它支援文字、圖片、音訊/語音與影片輸入,Context window 則達 1M tokens。 |
| 簡單的本地安裝 | 不建議從它開始 | OpenLM 的服務範例使用 16-way tensor parallelism、expert parallelism,並以兩個節點執行 SGLang。 |
| 最艱難的終端機或資安工作 | 先用自己的工作負載測試 | 公開結果顯示,MiMo 在部分 Agent 測試領先,但在 Terminal Bench 4.0 與 ExploitBench 落後。 |
| 目前就要長時間自主運作的 Agent | 搭配監控進行試點 | 早期使用者回報過凍結、內容過於冗長與行動延遲;而公開證據目前也只有數小時的觀察。 |
獨立的 Artificial Analysis model page 顯示,MiMo-V2.6-Pro 的分數為 46,輸出速度約每秒 129.7 tokens,完成一項 Intelligence Index 任務的估算成本為 $0.13。這些數字適合拿來比較,不代表你的 Prompt 或所選 Provider 一定能得到相同結果。
小米在 September 21, 2026 發表了什麼
小米的 official MiMo-V2.6 announcement 介紹的是一整個模型家族,而非單一 Checkpoint。MiMo-V2.6-Pro 是旗艦版本;MiMo-V2.6-Flash 則是體積更小、偏重效率的兄弟產品。此外,這次發布也包含一款以 Qwen 為基礎、參數量 9B 的蒸餾模型,供強化學習研究使用。
Pro Checkpoint 採用開放權重的稀疏 Mixture-of-Experts 架構。公開規格顯示,它總參數量約為 1.02 trillion,實際啟用參數為 42 billion。官方標示的 Context length 為 1 million tokens,並宣稱原生支援文字、圖片、影片與音訊。
Artificial Analysis 將 Pro 的授權標示為 MIT,並指出模型權重可供自行託管。這不代表所有託管 API 或服務配置都完全相同:Provider 限制、實作細節與營運成本,仍然是另外幾個需要評估的問題。
這次發布的訓練方式也相當值得注意。小米表示,單一混合式強化學習流程涵蓋程式設計、一般 Agent、視覺任務與資安工作。OpenLM’s technical summary 記錄了小米提出的數據:每一步使用 1,568 個 Prompts、每個 Prompt 進行 16 次 Rollouts,並搭配分組評分與 Post-RL distillation。
MiMo-V2.6-Pro 真正有優勢的地方
MiMo-V2.6-Pro 最突出的場景,是需要 Agent 能力的工作,而不是單純的學術型程式設計。在 OpenLM 整理的評測表中,Pro 在 AutomationBench 得分 53.1,高於 Claude Opus 5 的 50.3 與 GPT-5.6 Sol 的 45.8。在 Terminal Bench 2.1,它也拿到 89.9,略高於表中 Claude Opus 5 的 89.1,以及 GPT-5.6 Sol 的 88.8。
但這種優勢並非每項測試都成立。Pro 在 DeepSWE v1.1 的分數為 71.9,低於 Claude Opus 5 的 74.0 與 GPT-5.6 Sol 的 73.0。在 MiMo VisualCoding 中,它的分數是 72.3,落後 GPT-5.6 Sol 的 73.4,但高於 Claude Opus 5 的 70.0。
這些結果支持一個更精準的結論:MiMo-V2.6-Pro 值得作為工具使用、工作流程自動化、視覺化程式設計與成本敏感型軟體 Agent 的候選方案。但在公開的 ProgramBench 分數為 26.5、低於 Claude Opus 5 的 37.0 之後,就不應把它描述成所有程式設計任務的最佳模型。
Artificial Analysis 還提供了一些比主流基準測試更貼近實務的訊號。該頁面記錄的輸出速度為每秒 129.7 tokens、首次 Token 延遲為 2.17 秒,Context window 則為 1M tokens。Model Picker 的快照則顯示每秒 134 tokens,以及 20.8 秒的端到端數據,但同時註明快照沒有記錄 Index 版本。這些數字應視為特定時間的測量結果,而不是永久不變的規格。
會改變採用決定的幾個取捨
最大的效能警訊,在於不同任務之間的表現並不平均。在 OpenLM 的表格中,MiMo-V2.6-Pro 在 Terminal Bench 4.0 只拿到 34.9,低於 Claude Opus 5 的 49.0、GPT-5.6 Sol 的 39.9,以及 Claude Fable 5 的 42.4。在 ExploitBench 中,Pro 的分數為 47.9,明顯落後 Claude Opus 5 的 70.0 與 GPT-5.6 Sol 的 78.5。
資安測試結果尤其容易被過度解讀。Pro 在 CyberGym 得分 94.0,但在 ExploitBench 的分數卻低得多。某一套資安測試拿到高分,不能直接證明模型具備廣泛的進攻性資安能力。
早期社群回饋也補上了基準表看不到的營運層面問題。由於模型發布才過了幾個小時,最初的 X 討論規模仍然很小。使用者 @nilansaha 寫道:
「我唯一不滿的是,它有點太愛講,而且要等上一段時間才會採取行動。」
另一位使用者 @benjitusk 則表示:「mimo-v2.6-pro 凍結了整整 5 分鐘。」這些都是個別的早期回報,不是經過測量的失敗率;但如果你的 Agent 必須在沒有人工監督的情況下即時行動,這類回饋仍然值得納入評估。
另一位使用者 @luislucatero21 分享了一項 Pelican SVG 測試:在該使用者的設定中,MiMo-V2.6-Pro 花費 $0.05、耗時 6 分鐘 9 秒;Grok 4.7 則花費 $1.20、耗時 14 分鐘。這是有參考價值的成本與時間案例,但不是受控的基準測試。
價格與部署:先用 API,再考慮本地部署
| MiMo-V2.6-Pro API 項目 | 列出價格 |
|---|---|
| Cache-hit input | 每 1M tokens $0.0036 |
| Cache-miss input | 每 1M tokens $0.435 |
| Output | 每 1M tokens $0.87 |
| Artificial Analysis 任務估算 | 每項任務 $0.13 |
Token 價格來自 Brocker’s release analysis 的技術定價比較;Artificial Analysis 也列出約 $0.435/$0.87 的標準價格,以及 99% 的 Cache 折扣。實際帳單仍可能受到 Cache 政策、Reasoning tokens 計算方式,以及你採用的 Provider 影響。
本地部署的情況就複雜得多。OpenLM’s deployment notes 提供的 SGLang 範例包含 --tp 16、--dp 2、--ep 16、兩節點配置,以及最多 128 個執行中的請求。vLLM 範例則使用 8 路 Tensor parallelism,並將 GPU 記憶體使用率設為 95%。這些指令證明自行託管是可行的,但絕不是一般消費者能輕鬆完成的部署方式。
對大多數團隊而言,更合理的順序是先進行 API 試點,再決定基礎設施。先量測任務成功率、工具呼叫延遲、輸出長度、重試次數與總 Token 成本,再考慮是否要為一個 1.02T-parameter 的稀疏模型添購硬體。
現在適合哪些人使用 MiMo-V2.6-Pro
如果你的工作負載需要開放權重、多模態輸入、長 Context 或低廉的輸出價格,可以先用 MiMo-V2.6-Pro 進行 API 試點。對於以自動化為核心、能用完整工作流程是否成功來評估模型,而不是只看單一程式題表現的應用,它尤其具吸引力。
只有在你已經具備分散式 GPU 服務能力,並且確實需要掌控模型權重或部署方式時,才建議考慮自行託管。MIT 授權與公開 Checkpoint 的確降低了門檻,但無法消除公開部署配方所反映的記憶體、網路、服務化與可觀測性工作。
如果任務主要集中在最艱難的終端機環境、進攻性資安測試,或是不允許出現五分鐘凍結的無人監督操作,那麼應該選擇其他模型,或至少準備備援方案。MiMo-V2.6-Pro 尚未解決的取捨很清楚:Token 經濟性相當吸引人,但要讓這些節省穩定地轉化為可靠服務,所需付出的營運成本,可能遠高於 API 價格本身。
MiMo-V2.6-Pro 常見問題
MiMo-V2.6-Pro 已經正式發布了嗎?
是。小米的 MiMo 帳號與官方 MiMo 文件在 September 21, 2026 公布了 Pro 和 Flash,並提供開放權重及相關研究材料。
MiMo-V2.6-Pro 是開源模型嗎?
它以開放權重模型形式發布,Artificial Analysis 將其授權標示為 MIT。在投入商業部署前,仍應確認特定 Checkpoint 與 Provider 的條款。
MiMo-V2.6-Pro 的 Context window 有多大?
公開規格標示上限為 1 million tokens。實際可用的 Context 取決於服務端點、Prompt 結構,以及模型在你的長 Context 任務上的實際品質。
MiMo-V2.6-Pro 適合程式設計嗎?
在多項 Agent 型程式設計與自動化評測中,它都有不錯表現,包括公開表格中的 DeepSWE v1.1 分數 71.9,以及 AutomationBench 分數 53.1。不過,在 ProgramBench 與 Terminal Bench 4.0 上,它不如部分閉源競爭模型。
MiMo-V2.6-Pro API 要多少錢?
目前列出的標準價格為每 1M cache-miss input tokens $0.435、每 1M output tokens $0.87;cache-hit input 則是每 1M tokens $0.0036。正式上線前,請確認 Provider 的最新計費方式。
我該選 Pro 還是 Flash?
在公開比較中,Pro 是能力較高的選擇。Flash 則定位為更重視效率的兄弟模型,Brocker 的價格表也顯示它成本較低。不過,與其只看產品名稱推測哪個更適合正式環境,不如用自己的工作負載實際測試延遲與任務成功率。