Microsoft 首款完全自主研發的推理模型,終於在 2026 年 8 月 12 日透過 Microsoft Foundry 開放公開預覽。MAI-Thinking-1 採用稀疏 MoE 架構,啟用參數為 35B、總參數約 1T,並提供 256K 上下文視窗。它主打以較小的推論負擔,交出具競爭力的數學與程式能力;不過實際數據沒那麼單純:SWE-Bench Pro 為 52.8%,幾乎追平 Claude Opus 4.6 的 53.4%,但 Terminal-Bench 2.0 僅 46.0%,明顯落後 GPT-5.4 的 75.1%。更大的問題是,Microsoft 至今仍未公布按 token 計費的價格,儘管多次強調會是「中量級價格」。
MAI-Thinking-1 的定位與技術規格
MAI-Thinking-1 是由 Microsoft AI 完全內部開發的稀疏 Mixture-of-Experts 推理模型,約有 350 億個啟用參數,總參數則接近 1 兆。技術報告列出的基礎模型規格更精確:34.7B 啟用參數、962B 總參數、78 層;每個經路由的 token,會從 512 個專家中選取 8 個。它的 256,000 tokens 上下文視窗約可容納 600 頁文字,與 Claude Sonnet 4.6、GPT-5.4 處於相近級距。
API 部分,MAI-Thinking-1 支援主流的 Chat Completions API 格式,也具備 function calling、developer instructions 與 structured output。因此,既有採用 OpenAI chat endpoints 的程式碼,通常只需少量調整即可接入。這是一款純文字模型,不支援影像、音訊或影片的輸入與輸出;Microsoft 將 MAI-Image 2.5 與 MAI-Voice 2 分別定位為處理這些模態的獨立模型。
Microsoft 最強調的差異點在訓練流程。根據技術論文,模型預訓練使用了 30T tokens、來自商業授權與公開來源的人類生成資料,另有 3.55T mid-training tokens;訓練動用了 8,000 張 GB200 GPU,而 RL 階段則使用 4,600 張 GB300。Microsoft 表示模型訓練時沒有採用第三方模型蒸餾,也排除了由其他實驗室模型產生的合成資料。
MAI-Thinking-1 最早於 2026 年 6 月 2 日的 Microsoft Build 發表,當時是七款 MAI 系列模型的一員;直到 2026 年 8 月 12 日前,皆處於私人預覽階段。
基準測試看實力:強項與短板在哪裡
最完整的成績仍來自 Microsoft 自家的技術論文。MAI-Thinking-1 的測試結果皆為四次執行平均,設定為 temperature 1、top-p 0.97;代理式程式測試採用 256K 總上下文長度。競品數值則引自各家官方 model card,並非獨立重現結果。
| 基準測試 | MAI-Thinking-1 | Sonnet 4.6 | Opus 4.6 | GPT-5.4 | Kimi K2.6 | DeepSeek V4 | GLM-5.1 |
|---|---|---|---|---|---|---|---|
| AIME 2025 | 97.0 | 95.6 | 99.8 | — | — | — | — |
| AIME 2026 | 94.5 | — | — | — | 96.4 | — | 95.3 |
| GPQA Diamond | 84.2 | 89.9 | 91.3 | 92.8 | 90.5 | 90.1 | 85.2 |
| LiveCodeBench v6 | 87.7 | — | — | — | 89.6 | 93.5 | — |
| SWE-Bench Verified | 73.5 | 79.6 | 80.8 | — | 80.2 | 80.6 | — |
| SWE-Bench Pro | 52.8 | — | 53.4 | 57.7 | 58.6 | 55.4 | 58.4 |
| Terminal-Bench 2.0 | 46.0 | 59.1 | 65.4 | 75.1 | 66.7 | 67.9 | 69.0 |
趨勢其實相當清楚。若看純數學能力,MAI-Thinking-1 表現不錯:AIME 2025 的 97.0% 超越 Sonnet 4.6 的 95.6%,但仍低於 Opus 4.6 的 99.8%。到了 AIME 2026,MAI-Thinking-1 為 94.5%,落後 Kimi K2.6 的 96.4% 與 GLM-5.1 的 95.3%。
進入代理式程式開發後,差距就更顯著了。Microsoft 主打的 SWE-Bench Pro 成績為 52.8%,確實接近 Opus 4.6 的 53.4%;但 GPT-5.4 為 57.7%、Kimi K2.6 為 58.6%、DeepSeek V4 為 55.4%、GLM-5.1 為 58.4%,全數更高。衡量多步驟終端機代理能力的 Terminal-Bench 2.0 上,MAI-Thinking-1 的 46.0% 比 Sonnet 4.6 的 59.1% 少了 13 個百分點,與 GPT-5.4 的 75.1% 更相差 29 個百分點。
技術論文也直接承認,這個模型「並未領先整個領域」。MAI-Thinking-1 的競爭力在於 35B 啟用參數所對應的效能,而非衝上排行榜最前段。
以下是技術論文中的其他基準成績,並與 Sonnet 4.6 對照:
| 項目 | MAI-Thinking-1 | Sonnet 4.6 |
|---|---|---|
| MMLU-Pro | 85 | 87 |
| SimpleQA Verified | 31 | 29 |
| BFCL v3(工具呼叫) | 72 | 76 |
| CyberSecEval Instruct | 63 | 62 |
| GraphWalks(≤128K) | 90 | 96 |
「勝過 Sonnet 4.6」的偏好評測,該怎麼看?
Microsoft 行銷力道最大的成果,是與 Surge 專業評測員合作進行的盲測一對一人類評估,涵蓋 1,276 項任務,其中 30% 為多輪對話。技術論文揭露了發表文章未列出的精確數字:
對上 Claude Sonnet 4.6:
- MAI-Thinking-1 勝出:49%;平手:6%;落敗:45%
- 整體偏好差值:+0.07 ± 0.06
- 最具優勢的面向:簡潔/相關性(+0.11 ± 0.02)與風格/語氣(+0.08 ± 0.02)
- 在指令遵循、事實正確性與完整性上,統計結果為平手
對上 Claude Opus 4.6:
- MAI-Thinking-1 勝出:43%;平手:5%;落敗:52%
- 整體偏好差值:-0.07 ± 0.06
整體來看,與 Sonnet 的比較確實達到「較受偏好」的門檻;只是 +0.07、信賴區間 ±0.06 的優勢非常小。至於對 Opus 的結果,則是明確落敗。值得注意的是,這批任務偏重開放式問答、內容撰寫與摘要,而非 MAI-Thinking-1 相對弱勢的大量程式工作或多步驟推理工作負載。
在 Reddit 的 r/LocalLLaMA,使用者正討論 MAI-Thinking-1 是否實質接替了 Microsoft Phi 系列,並指出這個新系列並非開放權重。策略脈絡同樣值得關注:根據 Bloomberg 的報導,Microsoft 已開始在 Excel 與 Outlook 中以 MAI 模型取代 OpenAI 和 Anthropic 模型。這暗示 MAI-Thinking-1 的核心價值,可能更在於替 Microsoft 自家產品控制成本。
定價與取得方式:現實問題還不少
MAI-Thinking-1 目前沒有公開 token 定價。無論是產品發布公告、模型頁面或技術報告,Microsoft 都只使用「中量級價格」、「具成本效益」、「較小推論負擔」等定性描述,沒有給出任何美元數字。對於考慮將它導入正式環境的團隊來說,這正是目前最大的阻礙。
作為參考,以下是同級推理模型的收費(OpenAI pricing、Google AI pricing):
| 模型 | 輸入($/1M tokens) | 輸出($/1M tokens) |
|---|---|---|
| OpenAI o3 | ~$10 | ~$40 |
| Gemini 2.5 Pro | ~$1.25 | ~$10 |
| Claude Sonnet 4.6* | ~$3 | ~$15 |
\*Claude 定價依方案層級而異;此處為參考 Anthropic pricing 得出的約略中間區間。
Microsoft 所謂的「中量級」定位,代表 MAI-Thinking-1 的成本可能會落在 Gemini 2.5 Pro 與 Claude Sonnet 之間;但在正式費率公布前,任何預算估算都只能算是推測。
存取方面,MAI-Thinking-1 已透過 Microsoft Foundry 以公開預覽形式提供,模型頁面也附有 playground 連結。6 月的發布公告曾列出 OpenRouter、Fireworks AI 與 Baseten 為預定發行合作夥伴,但截至本篇評測時,三者皆尚未上線。模型採封閉權重,沒有 Hugging Face 版本、GGUF 或自行部署途徑。
目前若要實際使用 MAI-Thinking-1,可依下列方式操作:
- 使用 Azure 帳戶登入 Microsoft Foundry
- 在 Foundry 內前往 MAI-Thinking-1 模型頁面
- 以 playground 測試,或透過相容 Chat Completions 的 endpoint 部署
- 費用將經由 Azure 訂用帳戶計算,但預覽期間費率仍未公開
目前適合使用 MAI-Thinking-1 的對象
以下情境值得考慮:
- 已全面採用 Azure 或 Microsoft Foundry,並想要具備企業治理控制的一方推理模型的團隊
- 工作負載以數學、形式化推理或競賽型題目為主;AIME 2025 的 97% 確實有說服力
- 因合規需求而重視資料來源可追溯性的組織;Microsoft「無蒸餾、採授權資料」的說法,對受監管產業特別重要
- 進行程式碼審查與分析,且能從人類評測所指出的簡潔優勢中獲益的團隊
若你需要以下能力,暫時不建議選它:
- 多模態輸入/輸出:它僅支援文字
- 長時程代理式任務:Terminal-Bench 2.0 的 46% 對終端機自動化而言是致命限制
- 自行部署或開放權重:模型為專有產品,且綁定 Foundry
- 可預測的正式環境成本:沒有定價,就無從做預算
- 頂尖程式代理效能:Kimi K2.6、GPT-5.4 與 DeepSeek V4 在 SWE-Bench Pro 和 Verified 均有更高分數
常見問題
MAI-Thinking-1 是開源模型嗎?
不是。這是專有、封閉權重模型,沒有可下載的權重、沒有 Hugging Face 發布版本,也無法自行部署。目前僅能透過 Microsoft Foundry 存取。
MAI-Thinking-1 是否正在驅動 Copilot?
根據 Bloomberg 報導,Microsoft 已開始在 Excel 和 Outlook 中以 MAI 模型取代 OpenAI 與 Anthropic 模型。不過,目前沒有證實 MAI-Thinking-1 是提供給終端使用者的 GitHub Copilot 或 Microsoft 365 Copilot 背後模型。
MAI-Thinking-1 是 Microsoft Phi 的後繼者嗎?
Microsoft 並未將它定位為後繼者,但社群普遍將此視為方向轉變。Phi 是 Microsoft 的開放權重小型模型系列;MAI 則是 Microsoft 新的專有模型家族。關鍵差異在於:MAI-Thinking-1 為封閉模型,規模也更大,啟用參數為 35B,相較 Phi 的 3-14B,目標是企業部署而非本機執行。
MAI-Thinking-1 支援影像、音訊或影片嗎?
不支援。無論輸入或輸出,它都僅處理文字。Microsoft 針對其他模態另有 MAI-Image 2.5(文字生成圖片)、MAI-Transcribe-1.5(語音轉文字)與 MAI-Voice-2(語音生成)。
MAI-Thinking-1 的訓練資料截止日期是何時?
模型卡標示的訓練截止日期是 2025 年 7 月,但技術報告顯示,來源蒐集延續至 2026 年初:網頁 HTML 至 2025 年 9 月、網頁 PDF 至 2025 年 12 月,書籍與期刊則至 2026 年 3 月。這項落差表示,該截止日期可能是指後訓練資料蒐集停止的時間,而不是所有來源停止蒐集的時間。
我可以透過 OpenRouter 使用 MAI-Thinking-1 嗎?
目前還不行。Microsoft 在 6 月 2 日發布時,將 OpenRouter、Fireworks AI 和 Baseten 列為預定發行合作夥伴,但截至 2026 年 8 月仍沒有任何一家上線。目前唯一可用的存取方式是 Microsoft Foundry 公開預覽。
| 你的工作負載 | 目前更合適的選擇 |
|---|---|
| 競賽數學、形式化證明 | MAI-Thinking-1(97% AIME)或 Claude Opus 4.6(99.8%) |
| 代理式程式開發、終端機自動化 | GPT-5.4(75.1% Terminal-Bench)或 Kimi K2.6(66.7%) |
| 程式碼審查、錯誤偵測 | Claude Sonnet 4.6(79.6% SWE-Verified)或 Opus 4.6(80.8%) |
| Azure 原生企業推理 | MAI-Thinking-1(一方模型、Foundry 治理) |
| 預算受限的正式環境 | Gemini 2.5 Pro($1.25/$10) |
| 自行部署或開放權重 | MAI 無法提供;可考慮 DeepSeek V4 或 Qwen3.8 開放權重 |