Ling 3.0 Flash:124B 参数、5.1B 激活,现可免费使用

最后更新: 2026-07-24 03:43:01

一款总参数达到 124B 的模型,通常意味着推理慢、部署贵。Ling 3.0 Flash 走的是另一条路线:它每生成一个 token 只激活约 5.1B 参数,而且目前可以免费调用。

inclusionAI 于 2026 年 7 月 23 日发布了这款混合推理 Mixture-of-Experts(MoE)模型,目标是生产级 Agent 场景,包括编程、工具调用、研究任务和长链路执行。

Ling 3.0 Flash 到底是什么

Ling 3.0 Flash 出自 inclusionAI,也就是蚂蚁集团 Ling 和 Ring 模型家族背后的研究团队。蚂蚁集团正是支付宝背后的金融科技公司。名称中的“Flash”代表高速、低成本档位,定位低于该团队规模更大的旗舰模型。

它采用 Mixture-of-Experts 架构:总计 124B 参数中,每个 token 实际只会调用约 5.1B 参数。因此,它的运行速度和成本更接近一款小模型。

它也是一款 混合推理 模型:面对简单问题会直接作答,遇到复杂问题则会切换到更长的思考模式。inclusionAI 将其面向“生产规模的 Agent”,即那些需要调用工具、浏览网页、编写和运行代码,并在多步流程中保持状态的工作负载。

124B 总参数,却只激活 5.1B

与前代 Ling 2.6 Flash 对比,Ling 3.0 Flash 的总参数增加了,从 104B 提升至 124B;但每个 token 的激活参数反而降低,从 7.4B 降至 5.1B。

Ling 2.6 Flash 与 Ling 3.0 Flash 的柱状图对比:总参数从 104B 增至 124B,而每个 token 的激活参数从 7.4B 降至 5.1B

更大的总参数量意味着模型有更多容量存储知识;更少的激活参数则意味着每生成一个 token 的成本更低。实际使用中,你大致是在支付一款约 5B 模型的推理成本,同时获得 124B 参数规模的能力储备。

这对 Agent 尤其重要。一项任务如果经过多轮工具调用、生成数千个 token,账单主要取决于单 token 成本。相比单纯堆高模型标称规模,降低激活参数往往更有价值。

底层架构采用混合线性注意力堆栈。inclusionAI 的描述是:每五层 KDA(线性注意力)层搭配一层全注意力(MLA)层,循环重复。线性注意力让长输入的成本保持可控,定期插入的全注意力层则弥补纯线性模型在精确召回上的损失。这也是 Flash 能原生支持 256K 上下文、并具备向 1M 扩展空间的原因。路由平台通常将其显示为 262K,精确 token 数为 262,144。

重点不是闲聊,而是 Agent 执行

Flash 优化的方向是 Agent 工作流,而不是开放式聊天。inclusionAI 在公告中提到,它提升了工具调用准确率、长程任务稳定性,并增强了与常见 Agent “harness”框架的兼容性。发布演示也体现了这一定位:用 Blender 创建 3D 城市、多 Agent 研究、基于 MCP 的 Office 任务,以及浏览器应用。

在编程方面,inclusionAI 不仅将它定位为常规代码生成模型,也强调其空间和结构推理能力,例如理解场景网格与相对位置关系。

基准测试需要谨慎看待。模型发布仅数天,目前流传的数据主要来自 inclusionAI 自己的说法和早期社区测试,并非独立评测。inclusionAI 表示,Flash 在许多任务上能够追平或超过其约 1 万亿参数的旗舰模型,同时只需其中一小部分激活参数;其结果表还列出了思考模式下 56.63 的 SWE-Bench Pro 分数。在第三方确认前,这些都应视为厂商数据。

现在如何免费试用 Ling 3.0 Flash

最快的入口是 OpenRouter。模型名称为 inclusionai/ling-3.0-flash,上线时输入和输出价格均为 $0,可免费使用至 2026 年 8 月 3 日,价格于 2026 年 7 月 24 日核实。它也可在 ZenMux 免费使用。两者均提供兼容 OpenAI 的 API。

最简调用示例:

curl https://openrouter.ai/api/v1/chat/completions \
  -H "Authorization: Bearer $OPENROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "inclusionai/ling-3.0-flash",
    "messages": [{"role": "user", "content": "Write a Python function to parse a CSV."}]
  }'
OpenRouter 上的 Ling-3.0-flash 模型页面,显示其为 124B MoE 模型、激活参数为 5.1B、上下文为 262K,发布日期为 2026 年 7 月 23 日

凡是已经支持 chat/completions 的客户端,只需替换基础 URL、密钥和模型字符串即可使用。你也可以借助模型路由器,在不重写任何内容的前提下,用同一批提示词将 Ling 3.0 Flash 与现有模型做 A/B 对比。

有两点需要提前纳入预算。免费期属于推广活动,预计 8 月初之后会转为按量计费。作为参考,前代 Ling 2.6 Flash 的标价约为每百万 token 输入 $0.01、输出 $0.03。另外,发布时仅有一家服务商提供该模型,因此吞吐量和可用性都依赖这一套后端。

能下载模型权重吗?

搜索“Ling 3.0 flash download”或“Ling 3.0 flash github”目前会碰壁。模型发布时,权重并未公开;现阶段 Flash 仅能通过 API 使用。

这与此前有所不同。Ling 2.6 Flash 以开放权重形式发布在 Hugging Face 上,今天就可以本地运行;但 Flash 3.0 目前还不行。

如果你希望自行托管,或在自己的硬件上做量化,可以关注 inclusionAI Hugging Face 页面:2.6 的权重就在这里,如果团队延续此前模式,3.0 权重也会发布于此。在此之前,上述 API 路由平台是唯一的使用方式。

Ling 3.0 Flash 与 Ling 2.6 Flash 对比

Ling 3.0 FlashLing 2.6 Flash
发布时间2026 年 7 月 23 日2026 年 4 月 21 日
总参数量124B104B
每个 token 激活参数~5.1B~7.4B
上下文窗口原生 256K(路由平台为 262K)256K(路由平台为 262K)
开放权重发布时未开放是(Hugging Face)
上线价格免费至 2026 年 8 月 3 日每 1M token 输入约 $0.01 / 输出 $0.03
侧重点混合推理 Agent、工具使用、编程面向 Agent 的高速指令模型

简单来说,3.0 Flash 用更少的激活计算换取了更大的模型容量和混合推理模式,同时转向 API 优先的分发方式。如果你明确需要可本地离线运行的权重,仍然只能下载 2.6 Flash。

常见问题

Ling 3.0 Flash 免费吗?

目前免费。OpenRouter 可免费使用至 2026 年 8 月 3 日,ZenMux 上也可免费使用。免费窗口结束后,预计会转为按量计费。

Ling 3.0 Flash 是开源的吗?可以下载或在 GitHub 上找到吗?

发布时不是。官方没有发布权重,因此它仅支持 API 调用,没有下载链接或代码仓库。可通过 OpenRouter(inclusionai/ling-3.0-flash)或 ZenMux 使用。较早的 Ling 2.6 Flash 已在 Hugging Face 开放,因此如果 3.0 发布权重,也很可能会出现在那里。

Ling 3.0 Flash 是中国模型吗?

是。它由 inclusionAI 开发,该团队与蚂蚁集团有关联;蚂蚁集团是中国金融科技公司,也是支付宝背后的公司。

Ling 3.0 Flash 有多大?

总参数量为 124B,通过 MoE 设计每个 token 激活约 5.1B 参数;原生上下文为 256K,inclusionAI 表示其可向 1M 扩展。

Ling 3.0 Flash 和 Ling 2.6 Flash 该选哪个?

如果你需要混合推理 Agent 能力,并希望通过 API 降低单 token 成本,选 3.0 Flash。如果你需要下载权重并在本地运行,则应选择 2.6 Flash,因为 3.0 目前尚未开放。

延伸阅读