對多數 1,240 億參數模型來說,推論速度與部署成本往往不太友善;Ling 3.0 Flash 則走了不同路線。它雖有 124B 總參數,但每個 Token 實際只啟用約 5.1B,現在還能免費使用。
inclusionAI 於 2026 年 7 月 23 日推出這款混合推理 Mixture-of-Experts(MoE)模型,定位很明確:面向 Agent 場景,包括寫程式、工具呼叫、研究,以及需要長時間執行的任務。
Ling 3.0 Flash 是什麼模型?
Ling 3.0 Flash 來自 inclusionAI,也就是 Ant Group 旗下 Ling 與 Ring 模型家族背後的研究團隊。(Ant Group 是支付寶背後的金融科技公司。)「Flash」代表速度與成本效率取向的產品級距,定位低於該集團規模更大的旗艦模型。
它採用 Mixture-of-Experts 架構:124B 總參數中,每次處理 Token 時僅會啟用約 5.1B。換句話說,它的運行速度與成本更接近小型模型。
它同時也是一款混合推理模型:遇到簡單問題會直接作答,面對困難問題則會切換到較長的思考模式。inclusionAI 將其瞄準「production-scale agents」,也就是需要呼叫工具、瀏覽網頁、撰寫與執行程式,並能跨多步驟維持狀態的工作負載。
124B 容量,卻用 5.1B 的推論成本運作
若與前代 Ling 2.6 Flash 相比,這款模型的總參數不減反增,從 104B 提高至 124B;但每個 Token 的活躍參數卻從 7.4B 降至 5.1B。
總參數更多,代表模型能容納更多知識;活躍參數更少,則表示生成每個 Token 的成本更低。實際上,你大致是在支付約 5B 模型的推論成本,卻能動用 124B 的模型容量。
這對 Agent 特別重要。一項任務若要經過多次工具呼叫、產生數千個 Token,帳單主要就取決於單 Token 成本;此時,降低活躍參數通常比堆高帳面模型規模更有意義。
架構底層採用混合式線性注意力堆疊。inclusionAI 的說法是,每個重複區塊由五層 KDA(線性注意力)與一層完整注意力(MLA)組成。線性注意力能壓低長輸入的成本,定期插入的完整注意力層則保留純線性模型容易流失的精確回憶能力。這也是 Flash 能支援原生 256K 上下文、並朝 1M 延伸的原因。(Router 會顯示為 262K,精確 Token 數為 262,144。)
它主要為 Agent 工作流而設計
Flash 的調校重點不是開放式聊天,而是 Agent 任務。inclusionAI 在公告中提到更高的工具呼叫準確度、更穩定的長鏈任務表現,以及與常見 Agent「harness」框架更好的相容性。首發展示也很符合這個定位:在 Blender 製作 3D 城市、多 Agent 研究、透過 MCP 執行 Office 工作,以及瀏覽器應用程式。
在程式能力方面,inclusionAI 除了標準程式生成,也將它定位為具備空間與結構推理能力的模型,例如理解場景網格與相對位置。
Benchmark 數字仍要保留一些判斷空間。模型推出才幾天,目前看到的資料主要是 inclusionAI 自行公布的成績與早期社群測試,尚非獨立評測。inclusionAI 表示,Flash 在許多任務上可追平或超越其約 1 兆參數的旗艦模型,同時只使用其中一小部分的活躍參數;其結果表中,思考模式下的 SWE-Bench Pro 分數為 56.63。在第三方驗證前,這些都應視為廠商數據。
現在如何免費試用 Ling 3.0 Flash?
最快的途徑是 OpenRouter。模型名稱為 inclusionai/ling-3.0-flash,上市時輸入與輸出價格皆為 $0,免費期限至 2026 年 8 月 3 日(價格查詢日期為 2026 年 7 月 24 日)。你也可以在 ZenMux 免費使用。兩者都提供相容於 OpenAI 的 API。
最基本的呼叫方式如下:
curl https://openrouter.ai/api/v1/chat/completions \
-H "Authorization: Bearer $OPENROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "inclusionai/ling-3.0-flash",
"messages": [{"role": "user", "content": "Write a Python function to parse a CSV."}]
}'
只要現有用戶端已支援 chat/completions,替換 base URL、金鑰與模型字串後就能使用。透過模型路由器,也能在不重寫任何內容的情況下,針對相同 Prompt 將 Ling 3.0 Flash 與你目前使用的模型進行 A/B 比較。
有兩件事需要先納入成本考量。免費期屬於促銷活動,因此 8 月初之後預期會改為按量計費。作為參考,前代 Ling 2.6 Flash 的標價約為每百萬 Token 輸入 $0.01、輸出 $0.03。此外,上市時僅有一家供應商提供此模型,吞吐量與正常運行時間都取決於這個單一後端。
可以下載模型權重嗎?
搜尋「Ling 3.0 flash download」或「Ling 3.0 flash github」時,答案會碰壁:上市時並未釋出權重。目前 Flash 僅能透過 API 使用。
這點和前代不同。Ling 2.6 Flash 曾以 Hugging Face 開放權重形式推出,因此現在就能在本機執行;Flash 3.0 則不行。
如果你的需求是自行託管,或在自有硬體上量化部署,建議關注 inclusionAI Hugging Face 頁面:2.6 的權重就在那裡;若該團隊延續既有做法,3.0 權重也會在那裡發布。在此之前,上述 API Router 是唯一的使用管道。
Ling 3.0 Flash 與 Ling 2.6 Flash 怎麼選?
| Ling 3.0 Flash | Ling 2.6 Flash | |
|---|---|---|
| 發布日期 | 2026 年 7 月 23 日 | 2026 年 4 月 21 日 |
| 總參數 | 124B | 104B |
| 每 Token 活躍參數 | ~5.1B | ~7.4B |
| 上下文視窗 | 原生 256K(Router 顯示 262K) | 256K(Router 顯示 262K) |
| 開放權重 | 上市時未提供 | 是(Hugging Face) |
| 上市價格 | 免費至 2026 年 8 月 3 日 | 每 1M Token 輸入約 $0.01/輸出 $0.03 |
| 定位 | 混合推理 Agent、工具使用、程式開發 | 供 Agent 使用的高速指令模型 |
簡單說,3.0 Flash 以部分活躍運算換取更大的模型容量與混合推理模式,並轉向 API 優先的發行方式。若你明確需要可在離線環境本機運行的權重,目前仍只有 2.6 Flash 能下載。
常見問題
Ling 3.0 Flash 是免費的嗎?
目前是。OpenRouter 免費至 2026 年 8 月 3 日,ZenMux 也可免費使用。免費期結束後,預期將改為按量計費。
Ling 3.0 Flash 是開源的嗎?可以下載或在 GitHub 找到嗎?
上市時不是。官方尚未發布權重,因此目前僅支援 API,沒有可下載的檔案或 repo。可透過 OpenRouter(inclusionai/ling-3.0-flash)或 ZenMux 使用。較早推出的 Ling 2.6 Flash 已在 Hugging Face 開放,因此若未來釋出 3.0 權重,很可能也會出現在那裡。
Ling 3.0 Flash 是中國模型嗎?
是。它由 inclusionAI 開發;該團隊隸屬於 Ant Group 相關的 AI 研究體系,而 Ant Group 是中國支付寶背後的金融科技公司。
Ling 3.0 Flash 有多大?
總參數為 124B,透過 MoE 設計每個 Token 約啟用 5.1B 參數;原生上下文長度為 256K,inclusionAI 表示可朝 1M 擴展。
Ling 3.0 Flash 與 Ling 2.6 Flash,該用哪一款?
如果你要做混合推理 Agent 工作,並希望透過 API 降低每 Token 成本,選 3.0 Flash。若你需要下載權重並在本機運行,則選 2.6 Flash,因為 3.0 目前尚未開放。
