Thinking Machines Inkling 是一个于 2026 年 7 月 15 日发布的 9750 亿参数开源权重模型,采用稀疏混合专家架构,每个 token 仅激活 410 亿参数,并支持文本、图像和音频输入。它采用 Apache-2.0 许可发布,因此你可以下载完整权重并进行商业微调。但问题在于:即使是 4 位量化,也大约需要 600GB 的 VRAM,所以这是一个团队会在集群上评估的模型,而不是你能在游戏显卡上运行的东西。
规格参数,以及头条新闻搞错了什么
以下是 Hugging Face 模型卡 和 Inkling 官方页面 所述内容(访问于 2026 年 7 月 16 日)。
| 规格 | Inkling |
|---|---|
| 总参数量 | 975B |
| 活跃参数量 | 每个 token 41B |
| 架构 | 66 层仅解码器,稀疏 MoE(256 个专家,6 个路由 + 2 个共享) |
| 模态 | 输入:文本、图像、音频;输出:文本(UTF-8) |
| 训练数据 | 45 万亿 token |
| 许可 | Apache-2.0 |
| 下载 | Hugging Face (thinkingmachines/inkling) |
关于发布报道,有三点需要更正:
- 上下文窗口。 一些报道提到 1M-token 窗口。官方 Inkling 页面标注标准为 64K,通过 Tinker 平台运行时为 256K;Hugging Face 模型卡完全没有说明具体数字。请将 64K/256K 视为可验证的数据,而 1M 视为未经证实。
- 许可证。 已确认采用 Apache-2.0,这是最宽松的许可证之一,并且允许商业用途。不过,Thinking Machines 确实将微调安全的责任交给你。
- “Inkling-Small”。 一些报道称存在一个更小的变体,约有 12B 活跃参数,但它并未列在 Hugging Face 模型卡上。在它真正出现在那里之前,不要围绕它做规划。
这里的“975B parameters”到底意味着什么
Inkling 将每个 token 路由到 256 个专家中的 6 个,再加上 2 个共享专家,因此即使完整参数池达到 975B,每次实际激活的也只有约 41B 参数。这就是 Thinking Machines 声称它在编程方面可与 Nvidia 的 Nemotron 3 Ultra 匹敌、同时大约少用三分之一的 token 就能达到这一效果的原因:你以中等规模模型的推理成本,获得了大模型的广度。
Inkling 还提供一个“thinking effort”调节项。对于更难的问题,可以将其调高,以接受更慢、更经过深思熟虑的回答;或者将其调低,以提高速度。它经过训练,会标记不确定性而不是猜测,这对于微调基础模型比对于面向消费者的聊天机器人更为重要。
你真的能运行 Inkling 吗?
这里就是“开放权重”标签变得复杂的地方,因为 open 并不意味着轻量。根据模型卡和早期社区估计,以下大致是部署完整 975B 模型所需的资源(这些只是粗略估算,并非保证):
- BF16(全精度):仅权重就需要约 2TB 的 VRAM,因此在加入推理开销之前,就已经需要 16+ 块 H200 级 GPU,或者一台 8-GPU B300 节点。
- NVFP4 / 4-bit:约 600GB,仍然属于多 GPU 服务器范围(大约 4× H200 或 8× 80GB 卡)。
- 1-2 bit GGUF(llama.cpp / Unsloth quants):总计约 280-350GB 的 RAM+VRAM,可在高端工作站或满配的 Mac Studio Ultra 上运行,但当你推向更长上下文时速度会变慢,因为 KV cache 会增长。
坦诚地说:一个资金充足的团队可以评估并微调 Inkling,但如今没有面向消费级 GPU 的本地运行路径。如果你是一名单独开发者,希望把它加载到一张 24GB 显卡上,那它不适合你。你可以在 Hugging Face 上从 thinkingmachines/inkling 下载它,或者通过 Thinking Machines 的 Tinker 平台对其进行微调;该平台还可解锁 256K 上下文。
Inkling 与其他模型相比表现如何
Thinking Machines 直言 Inkling 不是目前可用的最强模型,而 model card 的基准测试也证实了这一点:Inkling 表现不错,但在推理和编码方面仍落后于闭源前沿模型。
| 基准 | Inkling | 引用的最佳竞争对手 |
|---|---|---|
| AIME 2026 | 97.1% | GPT 5.6 Sol, 99.9% |
| SWE-bench Verified | 77.6% | Claude Fable 5, 95.0% |
| MMMU Pro | 73.3% | Claude Fable 5, 84.2% |
| VoiceBench | 91.4% | Gemini 3.1 Pro, 94.3% |
*来源:Inkling model card 和官方基准测试页面,访问于 2026 年 7 月 16 日。*
官方雷达图也直观地讲述了同样的故事。Inkling 在推理和多模态任务上表现不俗,但在代理式编码(SWE-bench Pro、Terminal Bench)方面仍处于 GPT 5.6 Sol 和 Claude Fable 5 之下。
它的强项在于广度:将原生音频和图像理解集成在一个开源模型中,并且通过 fine-tuning 可以缩小编码方面的差距。如果你需要开箱即用的一流 agentic coding,封闭的前沿模型仍然更胜一筹。如果你需要一个你可自行掌控的开源多模态基础模型,Inkling 会是更有意思的选择。
Inkling 真正适合谁
Inkling 是一个可供构建的基础,而不是一个成品助手。Thinking Machines 通过其微调平台 Tinker 盈利,而不是通过按量计费的 API 调用,因此模型本身是免费的,其宣传语是“拿去并将其专门化”。
最清晰的证据是桥水基金(Bridgewater Associates):据 Thinking Machines 称,该模型的一个金融调优版本在公司的推理测试中取得了 84.7% 的分数,而成本大约只有专有模型的十四分之一。这正是其预期用途:一个有能力的通用模型,由团队针对特定领域进行改造。
所以,如果你已经具备基础设施和微调专业能力,能够将开源模型专门化并拥有其成果,而且你可以承担安全调优的责任,那么它就很适合你。如果你想要开箱即用的聊天机器人,或者你是在消费级硬件上开发,那就跳过它吧,因为通用闭源模型更容易获得,而且在第一天就更强。有一点需要知道:Inkling 的后训练使用了由其他开源模型生成的数据,包括 Moonshot 的 Kimi K2.5,而 Thinking Machines 表示其下一代产品将完全由自身训练。
Inkling 常见问题
Inkling 可免费用于商业用途吗?
是的。它采用 Apache-2.0 许可证发布,允许商业使用和修改。在部署之前,您需要负责进行任何安全微调。
我可以在哪里下载 Inkling?
完整权重位于 Hugging Face 上的 thinkingmachines/inkling。来自社区的量化 GGUF 构建版本也会出现在那里。
Inkling 真的有 100 万 token 的上下文窗口吗?
官方页面默认列出 64K,并通过 Tinker 平台提供 256K。某些报道中的 1M 数字未在 model card 上得到确认,因此请按 64K/256K 进行规划。
Inkling 与 DeepSeek 或 Qwen,哪个更好?
这取决于具体任务,而不是单一分数。Inkling 的优势在于原生多模态输入(文本、图像、音频)集成于一个 Apache-2.0 模型,并且提供 Tinker 微调路径;而领先的中国开源模型仍然是强大的通用和编程选择。在做出决定之前,先在你自己的任务上对它们进行基准测试。
Tinker 是什么,我需要它吗?
Tinker 是 Thinking Machines 的托管微调平台。运行开放权重并不需要它,但它是定制 Inkling 的官方途径,并且将上下文窗口提升到 256K。
---
相关阅读
