Gemini 3.5 Flash-Lite:價格、速度與適用情境

最近更新: 2026-07-22 07:18:20

如果你的工作負載大多是分類、擷取資料或簡單對話,不見得需要為深度推理能力付費。Gemini 3.5 Flash-Lite 是目前執行 Gemini 模型最省錢的選擇:每 100 萬輸入 Token 僅 $0.30,輸出 Token 則為 $2.50。我用相同任務與 Gemini 3.6 Flash 對跑,Flash-Lite 成本低了 94%,串流速度更快,答案也都正確。不過它的定位是大量、快速處理,而不是複雜推理;若你的任務吞吐量高且多半直接明確,它會是優先考慮的模型。

Gemini 3.5 Flash-Lite 的定位

Flash-Lite 是 Gemini 快速模型系列中最入門的一層,專為單次呼叫成本與延遲比頂尖智慧能力更重要的簡單、大量任務打造。重點規格如下:

  • 價格:每 100 萬 Token,輸入 $0.30、輸出 $2.50。
  • 上下文長度:100 萬 Token,與較高階的 Flash 模型相同。
  • 速度:Google 標示的輸出速度約為每秒 350 Token。
  • 智慧能力:Artificial Analysis Index 為 36;較昂貴的 3.6 Flash 為 50。這段差距正是它的取捨所在。

它與 3.6 Flash,以及著重資安的 3.5 Flash Cyber 一同推出,但目標工作完全不同:大規模分類、資訊擷取、路由、標記,以及簡單聊天。

Gemini 系列中最便宜的價格帶

和同系列模型相比,Flash-Lite 的價格明顯更低。以下數字均來自 Google 官方定價頁面

模型輸入/100 萬 Token輸出/100 萬 Token
Gemini 3.5 Flash-Lite$0.30$2.50
Gemini 3.6 Flash$1.50$7.50
Gemini 3.5 Flash(前代)$1.50$9.00

光看牌價,Flash-Lite 的輸入成本就是 3.6 Flash 的五分之一,輸出成本則是三分之一。若再計入各模型實際消耗的 Token 數量,差距會進一步拉大。

與 3.6 Flash 實際對跑的結果

我在 2026 年 7 月 22 日透過 OpenRouter,以 temperature 0 對兩個模型送出相同三項提示:一個程式任務、一個推理問題,以及一個 JSON 擷取任務。

指標(3 項任務,temp 0)Gemini 3.5 Flash-LiteGemini 3.6 Flash
輸入 Token147148
輸出 Token5433,058
總成本$0.0014$0.023
平均首 Token 時間1.2 秒4.5 秒
生成速度超過 400 tok/s
答案正確3 / 33 / 3

Flash-Lite 的成本低了 94%,三項任務全數答對,包含多步驟的火車時刻問題。成本差距主要來自兩件事:它的串流速度超過每秒 400 Token,不只高於標示的 350,也因為不像 3.6 Flash 那樣暫停「思考」,首 Token 更快送出。此外,它的回答精簡許多,通常只需數百個輸出 Token;相較之下,3.6 Flash 會消耗大量你同樣得付費的隱藏推理 Token,總量可達數千。對於簡單任務,這些推理其實是不必要的額外開銷。

長條圖顯示 Gemini 3.5 Flash-Lite 處理相同三項任務的成本約為 Gemini 3.6 Flash 的 6%

實際使用時,回應速度的差異同樣明顯。Flash-Lite 平均約 1.2 秒就送出第一個 Token,3.6 Flash 則是 4.5 秒;無論是聊天介面或高吞吐量管線,Flash-Lite 的體感都更俐落。

平均首 Token 時間長條圖:Gemini 3.5 Flash-Lite 為 1.2 秒,Gemini 3.6 Flash 為 4.5 秒

不過有兩點要先說明。第一,這只是 temperature 0 的單次測試,模型每次執行都可能有差異,因此這些精確數字應視為參考,而非基準測試結果。第二,這三項任務都不難。Intelligence Index 的差異,也就是 36 對 50,確實存在;遇到更困難的問題、複雜的多步驟 Agent、細膩的程式工作,或任何需要嚴謹推理的情境時,Flash-Lite 較小的思考預算會從省錢優勢變成能力上限。

什麼時候該用 Flash-Lite?何時該升級?

  • 選 Gemini 3.5 Flash-Lite:適合高量、對延遲敏感且複雜度較低的工作,例如分類、實體擷取、路由與分流、標記、短文本摘要及簡單聊天。以這個價格,可負擔的使用規模會比 3.6 Flash 大得多。
  • 改用 3.6 Flash:任務真的需要推理時,例如 Agent 程式開發、電腦操作、多步驟工作流,或答錯代價很高的場景。完整的 Gemini 3.6 Flash 指南涵蓋了這一層模型的基準測試與定價。

常見做法是兩者並用:將大量便宜、簡單的請求送到 Flash-Lite,只有困難個案才升級至 3.6 Flash。兩者都有 100 萬 Token 上下文,也使用相同 API,因此只要改一行模型 ID 就能切換。

如何取得 Gemini 3.5 Flash-Lite

這個模型已在 Gemini API 與 Google AI Studio 上線,模型 ID 為 gemini-3.5-flash-lite。AI Studio 提供免費層供測試使用。若透過聚合平台串接,OpenRouter 與 AIReiter 都以 Google 的牌價提供此模型;若你想透過同一把 API Key 混用 Gemini 與 Claude 模型,這會相當方便。

常見問題

Gemini 3.5 Flash-Lite 要多少錢?

每 100 萬輸入 Token 為 $0.30,每 100 萬輸出 Token 為 $2.50,是 Gemini 系列中最便宜的價格帶。

Gemini 3.5 Flash-Lite 可以免費用嗎?

Google AI Studio 有免費層可供原型開發。正式環境使用則依照上述隨用隨付定價計費。

Gemini 3.5 Flash-Lite 的速度有多快?

Google 標示其輸出速度約為每秒 350 Token;我的串流測試超過每秒 400 Token,首 Token 約在 1.2 秒出現。

Flash-Lite 夠用嗎?還是該選 3.6 Flash?

對簡單且高量的任務,Flash-Lite 的答案正確,而且成本低得多。若是重度推理或 Agent 類工作,3.6 Flash 較高的智慧能力(Index 50 對 36)值得額外成本。

延伸閱讀