一款总参数达到 124B 的模型,通常意味着推理慢、部署贵。Ling 3.0 Flash 走的是另一条路线:它每生成一个 token 只激活约 5.1B 参数,而且目前可以免费调用。
inclusionAI 于 2026 年 7 月 23 日发布了这款混合推理 Mixture-of-Experts(MoE)模型,目标是生产级 Agent 场景,包括编程、工具调用、研究任务和长链路执行。
Ling 3.0 Flash 到底是什么
Ling 3.0 Flash 出自 inclusionAI,也就是蚂蚁集团 Ling 和 Ring 模型家族背后的研究团队。蚂蚁集团正是支付宝背后的金融科技公司。名称中的“Flash”代表高速、低成本档位,定位低于该团队规模更大的旗舰模型。
它采用 Mixture-of-Experts 架构:总计 124B 参数中,每个 token 实际只会调用约 5.1B 参数。因此,它的运行速度和成本更接近一款小模型。
它也是一款 混合推理 模型:面对简单问题会直接作答,遇到复杂问题则会切换到更长的思考模式。inclusionAI 将其面向“生产规模的 Agent”,即那些需要调用工具、浏览网页、编写和运行代码,并在多步流程中保持状态的工作负载。
124B 总参数,却只激活 5.1B
与前代 Ling 2.6 Flash 对比,Ling 3.0 Flash 的总参数增加了,从 104B 提升至 124B;但每个 token 的激活参数反而降低,从 7.4B 降至 5.1B。
更大的总参数量意味着模型有更多容量存储知识;更少的激活参数则意味着每生成一个 token 的成本更低。实际使用中,你大致是在支付一款约 5B 模型的推理成本,同时获得 124B 参数规模的能力储备。
这对 Agent 尤其重要。一项任务如果经过多轮工具调用、生成数千个 token,账单主要取决于单 token 成本。相比单纯堆高模型标称规模,降低激活参数往往更有价值。
底层架构采用混合线性注意力堆栈。inclusionAI 的描述是:每五层 KDA(线性注意力)层搭配一层全注意力(MLA)层,循环重复。线性注意力让长输入的成本保持可控,定期插入的全注意力层则弥补纯线性模型在精确召回上的损失。这也是 Flash 能原生支持 256K 上下文、并具备向 1M 扩展空间的原因。路由平台通常将其显示为 262K,精确 token 数为 262,144。
重点不是闲聊,而是 Agent 执行
Flash 优化的方向是 Agent 工作流,而不是开放式聊天。inclusionAI 在公告中提到,它提升了工具调用准确率、长程任务稳定性,并增强了与常见 Agent “harness”框架的兼容性。发布演示也体现了这一定位:用 Blender 创建 3D 城市、多 Agent 研究、基于 MCP 的 Office 任务,以及浏览器应用。
在编程方面,inclusionAI 不仅将它定位为常规代码生成模型,也强调其空间和结构推理能力,例如理解场景网格与相对位置关系。
基准测试需要谨慎看待。模型发布仅数天,目前流传的数据主要来自 inclusionAI 自己的说法和早期社区测试,并非独立评测。inclusionAI 表示,Flash 在许多任务上能够追平或超过其约 1 万亿参数的旗舰模型,同时只需其中一小部分激活参数;其结果表还列出了思考模式下 56.63 的 SWE-Bench Pro 分数。在第三方确认前,这些都应视为厂商数据。
现在如何免费试用 Ling 3.0 Flash
最快的入口是 OpenRouter。模型名称为 inclusionai/ling-3.0-flash,上线时输入和输出价格均为 $0,可免费使用至 2026 年 8 月 3 日,价格于 2026 年 7 月 24 日核实。它也可在 ZenMux 免费使用。两者均提供兼容 OpenAI 的 API。
最简调用示例:
curl https://openrouter.ai/api/v1/chat/completions \
-H "Authorization: Bearer $OPENROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "inclusionai/ling-3.0-flash",
"messages": [{"role": "user", "content": "Write a Python function to parse a CSV."}]
}'
凡是已经支持 chat/completions 的客户端,只需替换基础 URL、密钥和模型字符串即可使用。你也可以借助模型路由器,在不重写任何内容的前提下,用同一批提示词将 Ling 3.0 Flash 与现有模型做 A/B 对比。
有两点需要提前纳入预算。免费期属于推广活动,预计 8 月初之后会转为按量计费。作为参考,前代 Ling 2.6 Flash 的标价约为每百万 token 输入 $0.01、输出 $0.03。另外,发布时仅有一家服务商提供该模型,因此吞吐量和可用性都依赖这一套后端。
能下载模型权重吗?
搜索“Ling 3.0 flash download”或“Ling 3.0 flash github”目前会碰壁。模型发布时,权重并未公开;现阶段 Flash 仅能通过 API 使用。
这与此前有所不同。Ling 2.6 Flash 以开放权重形式发布在 Hugging Face 上,今天就可以本地运行;但 Flash 3.0 目前还不行。
如果你希望自行托管,或在自己的硬件上做量化,可以关注 inclusionAI Hugging Face 页面:2.6 的权重就在这里,如果团队延续此前模式,3.0 权重也会发布于此。在此之前,上述 API 路由平台是唯一的使用方式。
Ling 3.0 Flash 与 Ling 2.6 Flash 对比
| Ling 3.0 Flash | Ling 2.6 Flash | |
|---|---|---|
| 发布时间 | 2026 年 7 月 23 日 | 2026 年 4 月 21 日 |
| 总参数量 | 124B | 104B |
| 每个 token 激活参数 | ~5.1B | ~7.4B |
| 上下文窗口 | 原生 256K(路由平台为 262K) | 256K(路由平台为 262K) |
| 开放权重 | 发布时未开放 | 是(Hugging Face) |
| 上线价格 | 免费至 2026 年 8 月 3 日 | 每 1M token 输入约 $0.01 / 输出 $0.03 |
| 侧重点 | 混合推理 Agent、工具使用、编程 | 面向 Agent 的高速指令模型 |
简单来说,3.0 Flash 用更少的激活计算换取了更大的模型容量和混合推理模式,同时转向 API 优先的分发方式。如果你明确需要可本地离线运行的权重,仍然只能下载 2.6 Flash。
常见问题
Ling 3.0 Flash 免费吗?
目前免费。OpenRouter 可免费使用至 2026 年 8 月 3 日,ZenMux 上也可免费使用。免费窗口结束后,预计会转为按量计费。
Ling 3.0 Flash 是开源的吗?可以下载或在 GitHub 上找到吗?
发布时不是。官方没有发布权重,因此它仅支持 API 调用,没有下载链接或代码仓库。可通过 OpenRouter(inclusionai/ling-3.0-flash)或 ZenMux 使用。较早的 Ling 2.6 Flash 已在 Hugging Face 开放,因此如果 3.0 发布权重,也很可能会出现在那里。
Ling 3.0 Flash 是中国模型吗?
是。它由 inclusionAI 开发,该团队与蚂蚁集团有关联;蚂蚁集团是中国金融科技公司,也是支付宝背后的公司。
Ling 3.0 Flash 有多大?
总参数量为 124B,通过 MoE 设计每个 token 激活约 5.1B 参数;原生上下文为 256K,inclusionAI 表示其可向 1M 扩展。
Ling 3.0 Flash 和 Ling 2.6 Flash 该选哪个?
如果你需要混合推理 Agent 能力,并希望通过 API 降低单 token 成本,选 3.0 Flash。如果你需要下载权重并在本地运行,则应选择 2.6 Flash,因为 3.0 目前尚未开放。
