Thinking Machines Inkling:975B、开放且难以运行

最后更新: 2026-07-16 10:39:03

Thinking Machines Inkling 是一个于 2026 年 7 月 15 日发布的 9750 亿参数开源权重模型,采用稀疏混合专家架构,每个 token 仅激活 410 亿参数,并支持文本、图像和音频输入。它采用 Apache-2.0 许可发布,因此你可以下载完整权重并进行商业微调。但问题在于:即使是 4 位量化,也大约需要 600GB 的 VRAM,所以这是一个团队会在集群上评估的模型,而不是你能在游戏显卡上运行的东西。

规格参数,以及头条新闻搞错了什么

以下是 Hugging Face 模型卡Inkling 官方页面 所述内容(访问于 2026 年 7 月 16 日)。

规格Inkling
总参数量975B
活跃参数量每个 token 41B
架构66 层仅解码器,稀疏 MoE(256 个专家,6 个路由 + 2 个共享)
模态输入:文本、图像、音频;输出:文本(UTF-8)
训练数据45 万亿 token
许可Apache-2.0
下载Hugging Face (thinkingmachines/inkling)

关于发布报道,有三点需要更正:

  • 上下文窗口。 一些报道提到 1M-token 窗口。官方 Inkling 页面标注标准为 64K,通过 Tinker 平台运行时为 256K;Hugging Face 模型卡完全没有说明具体数字。请将 64K/256K 视为可验证的数据,而 1M 视为未经证实。
  • 许可证。 已确认采用 Apache-2.0,这是最宽松的许可证之一,并且允许商业用途。不过,Thinking Machines 确实将微调安全的责任交给你。
  • “Inkling-Small”。 一些报道称存在一个更小的变体,约有 12B 活跃参数,但它并未列在 Hugging Face 模型卡上。在它真正出现在那里之前,不要围绕它做规划。

这里的“975B parameters”到底意味着什么

Inkling 将每个 token 路由到 256 个专家中的 6 个,再加上 2 个共享专家,因此即使完整参数池达到 975B,每次实际激活的也只有约 41B 参数。这就是 Thinking Machines 声称它在编程方面可与 Nvidia 的 Nemotron 3 Ultra 匹敌、同时大约少用三分之一的 token 就能达到这一效果的原因:你以中等规模模型的推理成本,获得了大模型的广度。

Inkling 还提供一个“thinking effort”调节项。对于更难的问题,可以将其调高,以接受更慢、更经过深思熟虑的回答;或者将其调低,以提高速度。它经过训练,会标记不确定性而不是猜测,这对于微调基础模型比对于面向消费者的聊天机器人更为重要。

你真的能运行 Inkling 吗?

这里就是“开放权重”标签变得复杂的地方,因为 open 并不意味着轻量。根据模型卡和早期社区估计,以下大致是部署完整 975B 模型所需的资源(这些只是粗略估算,并非保证):

Approximate VRAM required to run Inkling at different quantization levels
  • BF16(全精度):仅权重就需要约 2TB 的 VRAM,因此在加入推理开销之前,就已经需要 16+ 块 H200 级 GPU,或者一台 8-GPU B300 节点。
  • NVFP4 / 4-bit:约 600GB,仍然属于多 GPU 服务器范围(大约 4× H200 或 8× 80GB 卡)。
  • 1-2 bit GGUF(llama.cpp / Unsloth quants):总计约 280-350GB 的 RAM+VRAM,可在高端工作站或满配的 Mac Studio Ultra 上运行,但当你推向更长上下文时速度会变慢,因为 KV cache 会增长。

坦诚地说:一个资金充足的团队可以评估并微调 Inkling,但如今没有面向消费级 GPU 的本地运行路径。如果你是一名单独开发者,希望把它加载到一张 24GB 显卡上,那它不适合你。你可以在 Hugging Face 上从 thinkingmachines/inkling 下载它,或者通过 Thinking Machines 的 Tinker 平台对其进行微调;该平台还可解锁 256K 上下文。

Inkling 与其他模型相比表现如何

Thinking Machines 直言 Inkling 不是目前可用的最强模型,而 model card 的基准测试也证实了这一点:Inkling 表现不错,但在推理和编码方面仍落后于闭源前沿模型。

Inkling benchmark scores compared with the best rival on each test
基准Inkling引用的最佳竞争对手
AIME 202697.1%GPT 5.6 Sol, 99.9%
SWE-bench Verified77.6%Claude Fable 5, 95.0%
MMMU Pro73.3%Claude Fable 5, 84.2%
VoiceBench91.4%Gemini 3.1 Pro, 94.3%

*来源:Inkling model card 和官方基准测试页面,访问于 2026 年 7 月 16 日。*

官方雷达图也直观地讲述了同样的故事。Inkling 在推理和多模态任务上表现不俗,但在代理式编码(SWE-bench Pro、Terminal Bench)方面仍处于 GPT 5.6 Sol 和 Claude Fable 5 之下。

Official Inkling benchmark radar comparing it with GPT 5.6 Sol and Claude Fable 5

它的强项在于广度:将原生音频和图像理解集成在一个开源模型中,并且通过 fine-tuning 可以缩小编码方面的差距。如果你需要开箱即用的一流 agentic coding,封闭的前沿模型仍然更胜一筹。如果你需要一个你可自行掌控的开源多模态基础模型,Inkling 会是更有意思的选择。

Inkling 真正适合谁

Inkling 是一个可供构建的基础,而不是一个成品助手。Thinking Machines 通过其微调平台 Tinker 盈利,而不是通过按量计费的 API 调用,因此模型本身是免费的,其宣传语是“拿去并将其专门化”。

最清晰的证据是桥水基金(Bridgewater Associates):据 Thinking Machines 称,该模型的一个金融调优版本在公司的推理测试中取得了 84.7% 的分数,而成本大约只有专有模型的十四分之一。这正是其预期用途:一个有能力的通用模型,由团队针对特定领域进行改造。

所以,如果你已经具备基础设施和微调专业能力,能够将开源模型专门化并拥有其成果,而且你可以承担安全调优的责任,那么它就很适合你。如果你想要开箱即用的聊天机器人,或者你是在消费级硬件上开发,那就跳过它吧,因为通用闭源模型更容易获得,而且在第一天就更强。有一点需要知道:Inkling 的后训练使用了由其他开源模型生成的数据,包括 Moonshot 的 Kimi K2.5,而 Thinking Machines 表示其下一代产品将完全由自身训练。

Inkling 常见问题

Inkling 可免费用于商业用途吗?

是的。它采用 Apache-2.0 许可证发布,允许商业使用和修改。在部署之前,您需要负责进行任何安全微调。

我可以在哪里下载 Inkling?

完整权重位于 Hugging Face 上的 thinkingmachines/inkling。来自社区的量化 GGUF 构建版本也会出现在那里。

Inkling 真的有 100 万 token 的上下文窗口吗?

官方页面默认列出 64K,并通过 Tinker 平台提供 256K。某些报道中的 1M 数字未在 model card 上得到确认,因此请按 64K/256K 进行规划。

Inkling 与 DeepSeek 或 Qwen,哪个更好?

这取决于具体任务,而不是单一分数。Inkling 的优势在于原生多模态输入(文本、图像、音频)集成于一个 Apache-2.0 模型,并且提供 Tinker 微调路径;而领先的中国开源模型仍然是强大的通用和编程选择。在做出决定之前,先在你自己的任务上对它们进行基准测试。

Tinker 是什么,我需要它吗?

Tinker 是 Thinking Machines 的托管微调平台。运行开放权重并不需要它,但它是定制 Inkling 的官方途径,并且将上下文窗口提升到 256K。

---

相关阅读