Thinking Machines Inkling:975B、開放且難以執行

最近更新: 2026-07-16 10:39:19

Thinking Machines Inkling 是一個於 2026 年 7 月 15 日發布的 9750 億參數開放權重模型,採用稀疏專家混合架構,每個 token 只啟用 410 億個參數,並可接受文字、圖片和音訊輸入。它以 Apache-2.0 授權釋出,因此你可以下載完整權重並進行商業微調。不過要注意:即使是 4-bit 量化,也大約需要 600GB 的 VRAM,所以這是一個團隊會在叢集上評估的模型,而不是你能在遊戲顯示卡上執行的東西。

規格,以及標題報導錯了什麼

以下是 Hugging Face model cardofficial Inkling page 所說明的內容(存取於 2026 年 7 月 16 日)。

規格Inkling
總參數量975B
啟用參數量每個 token 41B
架構66 層僅解碼器、稀疏 MoE(256 個專家,6 個路由 + 2 個共享)
模態輸入文字、圖片、音訊;輸出文字(UTF-8)
訓練資料45 兆個 token
授權Apache-2.0
下載Hugging Face (thinkingmachines/inkling)

關於發佈報導,有三件事需要更正:

  • 上下文視窗。 多篇文章引述了 1M token 的視窗。官方 Inkling 頁面列出標準為 64K,透過 Tinker 平台執行時則為 256K;Hugging Face 的模型卡則完全沒有說明數字。請將可驗證的數字視為 64K/256K,而 1M 仍屬未經確認。
  • 授權。 已確認為 Apache-2.0,這是目前最寬鬆的授權之一,且允許商業使用。Thinking Machines 也確實將微調安全性的責任交由你承擔。
  • "Inkling-Small." 某些報導提到了一個較小的變體,約有 12B 個活躍參數,但 Hugging Face 的模型卡上並未列出。在它出現在那裡之前,先不要把它納入規劃。

這裡的「975B 參數」真正代表什麼

Inkling 會將每個 token 路由到 256 個專家中的 6 個,再加上 2 個共享專家,因此即使完整參數池有 975B,實際同時啟用的也只有約 41B 參數。這就是為什麼 Thinking Machines 宣稱它在程式編寫方面可與 Nvidia 的 Nemotron 3 Ultra 匹敵,同時為了達成同樣效果所需的 token 數量大約少了三分之一:你以中型模型的推理成本,獲得了大型模型的廣度。

Inkling 也提供一個「thinking effort」旋鈕。將其調高可用於更難的問題,並接受更慢、更審慎的回答;或將其調低以提升速度。它經過訓練,會標示不確定性而不是猜測,這對於微調基礎模型比對消費級聊天機器人更重要。

你真的可以執行 Inkling 嗎?

這就是「open weights」標籤變得複雜的地方,因為 open 不代表輕量。以下大致說明要部署完整的 975B 模型需要什麼,根據 model card 和社群早期估算(這些都是粗略數字,並非保證):

Approximate VRAM required to run Inkling at different quantization levels
  • BF16(全精度): 僅權重就約需要 2TB 的 VRAM,因此在加入 serving 開銷之前,至少需要 16+ 張 H200 等級 GPU,或一台 8-GPU B300 節點。
  • NVFP4 / 4-bit: 約 600GB,仍屬於多 GPU 伺服器範疇(大致相當於 4× H200 或 8× 80GB 卡)。
  • 1-2 bit GGUF(llama.cpp / Unsloth quants): 需要約 280-350GB 的 RAM+VRAM 總和,可在高階工作站或配備到頂的 Mac Studio Ultra 上實現;但一旦把上下文長度推高,因為 KV cache 會增大,速度也會變慢。

坦白說:資金充足的團隊可以評估並微調 Inkling,但目前沒有可在本機執行它的消費級 GPU 路徑。如果你是希望把它載入到單張 24GB 顯卡上的獨立開發者,這不是適合你的模型。你可以從 Hugging Face 下載,網址是 thinkingmachines/inkling,或透過 Thinking Machines 的 Tinker 平台對它進行微調,該平台也能解鎖 256K context。

Inkling 與其他模型相比的表現

Thinking Machines 直接表示 Inkling 不是目前可用的最強模型,而 model card 的基準測試也證實了這一點:Inkling 的表現不錯,但在推理和編碼方面落後於封閉式前沿模型。

Inkling benchmark scores compared with the best rival on each test
基準測試Inkling引用的最佳競爭對手
AIME 202697.1%GPT 5.6 Sol, 99.9%
SWE-bench Verified77.6%Claude Fable 5, 95.0%
MMMU Pro73.3%Claude Fable 5, 84.2%
VoiceBench91.4%Gemini 3.1 Pro, 94.3%

*來源:Inkling 模型卡與官方基準頁面,存取於 2026 年 7 月 16 日。*

官方雷達圖也以視覺方式呈現了同樣的結果。Inkling 在推理和多模態任務上表現不俗,但在 agentic coding(SWE-bench Pro、Terminal Bench)方面仍落後於 GPT 5.6 Sol 和 Claude Fable 5。

Official Inkling benchmark radar comparing it with GPT 5.6 Sol and Claude Fable 5

它的強項在於廣度:在一個開放模型中同時具備原生音訊與影像理解能力,而且透過微調可以縮小編碼方面的差距。如果你需要開箱即用、同級最佳的 agentic coding,封閉式前沿模型仍然更勝一籌。如果你需要一個可自主掌控的開放式多模態基礎模型,Inkling 會是更有趣的選擇。

Inkling 真正適合誰

Inkling 是一個可供建構的基礎,而不是一個完成品助理。Thinking Machines 的收入來自 Tinker,也就是它的微調平台,而不是來自按量計費的 API 呼叫,因此這個模型本身是免費的,而其訴求是「拿去,並將它專門化。」

最明確的證明案例是 Bridgewater Associates:根據 Thinking Machines,該模型的財務調校版本在該公司的推理測試中取得了 84.7% 的分數,而成本大約只有專有模型的十四分之一。這正是其預期用途,也就是一個能力強大的通用型模型,由團隊針對特定領域進行重新調整。

因此,如果你擁有基礎架構與 fine-tuning 專業能力,能夠將開放模型專門化並掌握成果,且願意承擔 safety tuning 的責任,那它就很適合你。如果你想要開箱即用的 chatbot,或是你是用消費級硬體工作,那就可以略過,因為通用的 closed models 更容易取得,且一開始就更強。還有一個值得知道的注意事項:Inkling 的 post-training 使用了由其他 open models 產生的資料,包括 Moonshot 的 Kimi K2.5,而 Thinking Machines 表示其下一代將會完全由自身訓練。

Inkling 常見問題

Inkling 可否免費用於商業用途?

是的。它採用 Apache-2.0 授權發布,允許商業用途和修改。在您部署之前,您需自行負責任何安全微調。

我可以在哪裡下載 Inkling?

完整權重可在 Hugging Face 上的 thinkingmachines/inkling 取得。社群製作的量化 GGUF 版本也出現在那裡。

Inkling 真的有 1M token 的上下文視窗嗎?

官方頁面預設列出 64K,並可透過 Tinker 平台使用 256K。某些報導中的 1M 數字未在 model card 上確認,因此請以 64K/256K 為規劃基準。

Inkling vs DeepSeek 或 Qwen,哪個更好?

這取決於任務,而不是單一分數。Inkling 的優勢在於原生多模態輸入(文字、圖片、音訊)整合於一個 Apache-2.0 模型,再加上 Tinker 微調路徑;中國領先的開源模型在通用與程式碼任務上仍然是很強的選擇。請先針對你的實際任務進行基準測試,再做決定。

什麼是 Tinker,我需要它嗎?

Tinker 是 Thinking Machines 的託管微調平台。你不需要它來執行開放權重,但它是自訂 Inkling 的官方途徑,而且能將上下文視窗提升到 256K。

---

相關閱讀