Google 最便宜的 3.5 世代模型,能不能取代每個輸入 token 貴上 6.7 倍的 Pro?我在 2026 年 7 月 23 日,透過相同的四組提示詞測試 gemini-3.5-flash-lite 與 gemini-3.1-pro-preview。結果是兩者正確性打平,實際帳單卻相差 25 倍;而 Flash-Lite 唯一犯的錯,剛好就是足以讓正式環境管線出問題的那一種。(如果你正在考慮中階的 Flash,請參考這篇 Gemini 3.5 Flash vs Gemini 3.1 Pro 比較。)
四組相同提示詞實戰對決:結果如何?
所有測試都使用完全相同的提示詞與 OpenAI 相容 API 路由,並以程式自動評分:程式任務有 8 個本地測試案例,資料擷取則採用嚴格的 schema 驗證。
| 任務 | Flash-Lite | 3.1 Pro | 勝者 |
|---|---|---|---|
| Python ISO-8601 duration parser(8 個測試案例) | 8/8,3.7 秒 | 8/8,38.2 秒 | 正確性平手 |
| 從雜亂 email 擷取嚴格 JSON | 欄位正確,但包在 markdown code fence 中,1.0 秒 | 正確,回傳純 JSON,9.8 秒 | Pro |
| 百分比邏輯陷阱(答案:50) | 正確,1.8 秒 | 正確,10.6 秒 | 平手 |
| 含 3 個預埋缺陷的程式碼審查 | 找出 3 個中的 2 個,另找到 1 個未預埋問題,3.7 秒 | 找出 3 個中的 2 個,另找到 1 個未預埋問題,30.2 秒 | 平手 |
兩款模型都寫出了完全正確的 duration parser。在程式碼審查中,兩者也都抓到 SQL injection、mutable default argument cache,以及低效率篩選問題;同時也都漏掉了我刻意埋入的 naive-datetime 時區 bug。就這四項日常任務而言,正確性沒有差異。
不過有兩點要先說明。這只是一次抽樣測試,加上後面的 30 次呼叫試驗,並非完整 benchmark suite。另外,有一次 Pro 對無害的程式碼審查提示詞出現了莫名拒答,重試後才成功;原因可能是 relay 雜訊,而非模型本身,但無論如何,實務上都應把重試成本納入預算。
Flash-Lite 真正容易失手的地方
格式遵循偶爾會鬆掉
資料擷取提示詞明確要求「只回傳 JSON object」。Pro 回傳的是純 JSON;Flash-Lite 則把正確資料包進 ``json fences,導致下游的 json.loads()` 呼叫必須先加上移除包裝的處理,否則就會直接失敗。
單次失誤可能只是雜訊,所以我再做了量測:每個模型各跑 30 次擷取呼叫,涵蓋 10 封不同的客服 email,並用程式檢查是否符合純 JSON 格式與 schema。Flash-Lite 在 30 次中通過 29 次,通過率 96.7%,唯一一次失敗就是被 code fence 包住;3.1 Pro 則是 30 次全數通過。那次失敗的問題不在內容,欄位都對,錯的是輸出包裝方式。
格式遵循其實正是 Google 對這款模型的主打賣點:Flash-Lite 官方頁面將它定位為「最適合低延遲、高吞吐量 agentic 任務」的模型。3.3% 的失誤率看起來不高,但放進多步驟流程就不一樣了:一個 agent 每次工作要呼叫模型 20 次,約有一半執行結果至少會碰到一次異常回應(1 − 0.967²⁰ ≈ 0.49)。若要把結構化輸出任務路由給 Flash-Lite,務必加上驗證器與一次重試:以 3.3% 失敗率計算,重試一次可將每次呼叫的殘餘失敗率降至約 0.1%;而我測到的每次失敗都是包裝問題,從來不是內容錯誤。
Pro 仍然有不可取代的區域
前面四項任務都在 Flash-Lite 的舒適圈:上下文短、規格清楚、一次完成。從上市後一週的社群回報來看,界線也相當一致。r/GeminiAI 上處理長篇文件的使用者指出 Pro 在角色與劇情一致性上的表現更穩定,較小的 Gemini 模型則容易逐漸跑偏。獨立指標也反映相同趨勢:Artificial Analysis 的 Intelligence Index 給 3.1 Pro 46 分、Flash-Lite 36 分,差距主要集中於多步驟推理評測,而非程式設計或資料擷取。該追蹤平台在追蹤的 152 款模型中,將 Flash-Lite 的輸出速度排在第 2 名,智慧表現則排第 13 名;這個定位說明它是專業型工具,而不是全面替代方案。
我自己較難的任務也隱約看出上限:兩款模型都沒有發現時區 bug。Flash-Lite 能和 Pro 打平,不代表它就是 Pro;這代表兩者都有盲點,而 Pro 較深一層的能力是否值得 25 倍成本,仍要看你的風險承受度。
實務上的分界很清楚:需要模型在任務中途重新規劃、維持 50k+ 字內容的一致性,或面對高代價判斷的工作,仍值得選 Pro;所有具高度模板化特徵的任務則不需要。
實際帳單差距是 25 倍,不是 4.8 倍
定價頁面顯示,Pro 的輸出 token 單價是 Flash-Lite 的 4.8 倍(每百萬 token $12 對 $2.50)。但我在四項任務中的實測支出,Flash-Lite 約為 $0.005,Pro 約為 $0.13,差距達 25 倍(Lite 合計計費約 570 個輸入 / 2,020 個輸出 token;Pro 為 1,700 / 10,386,皆按牌價計算)。
差距來自思考 token。Gemini 3.1 Pro 會先進行推理再回答,而 Google 將這些推理一併以輸出 token 計費。以 parser 任務為例,Pro 輸出了 5,125 個 token,其中 4,811 個、也就是 94%,屬於思考內容;Flash-Lite 對同一提示詞只用了 819 個 token 直接作答。四項任務合計,思考內容佔 Pro 計費總量的 84%。
30 次資料擷取試驗讓差距更大,而非縮小,因為短輸出最會放大思考成本占比。Flash-Lite 完成全部 30 次呼叫只用了 1,899 個輸出 token,總成本約 $0.006;Pro 則計費 29,468 個輸出 token,其中 27,636 個、也就是 94%,是思考 token,成本約 $0.38,這類工作負載的差距達 65 倍。若擴大到每月 100 萬次擷取呼叫,帳單會從 $190 變成 $12,500。
這不是小樣本才會出現的偶然現象。Tessl coding benchmark 背後的團隊測了約 3,300 項 coding-agent 任務,發現 Gemini 3.1 Pro 雖然牌價更高,最後卻比重推理取向的 Gemini 3.5 Flash 更便宜:機制相同,只是結果反向。Artificial Analysis 的 cost-to-run-index 數據也呈現同樣的倒掛。這裡的原則是:比較模型時,應看完成單一任務的實測成本,而不是 token 價目表。
規格與價格:截至 2026 年 7 月 23 日確認
以下資料來自 Google 的官方 Gemini API 定價頁面:
| Gemini 3.5 Flash-Lite | Gemini 3.1 Pro(≤200k ctx) | |
|---|---|---|
| 輸入 / 1M tokens | $0.30 | $2.00(超過 200k 為 $4.00) |
| 輸出 / 1M tokens(含思考) | $2.50 | $12.00(超過 200k 為 $18.00) |
| Batch tier | $0.15 / $1.25 | $1.00 / $6.00 |
| Context caching | $0.03 | $0.20 |
| Context window | 1M 輸入 / 64k 輸出 | 1M 輸入 / 32k 輸出 |
| 輸出速度(Artificial Analysis) | 426.8 tok/s | 112.2 tok/s |
| 狀態 | GA,gemini-3.5-flash-lite | Preview,gemini-3.1-pro-preview |
有兩個細節值得注意。Flash-Lite 相較前代其實是漲價:3.1 Flash-Lite 的價格為 $0.25/$1.50,因此輸出價格上漲 67%。Google 的理由是能力提升:其 DeepMind 模型頁面公布的數字顯示,3.5 Flash-Lite 相較 3.1 Flash-Lite,在 SWE-Bench Pro 從 38.3% 提升至 54.2%,Terminal-bench 2.1 則從 31% 升至 54%。另外,兩者的輸出上限並不對稱:Flash-Lite 可輸出 64k token,是 Pro 的 32k 的兩倍。因此很反直覺地,超長的單次生成反而是便宜模型的主場。
早期使用者怎麼看?
驗證當下模型才推出兩天,討論量仍不多;不過 X 上最早的實務回報大致分成三派:
- 質疑定價:7 月 23 日,@samarthg1911 發文表示:「為什麼 3.5 flash lite 貴了 50%。這太偷偷摸摸了。」漲價是目前最常見的抱怨。
- 管線效益:ML 工程師 @mrdbourke 表示,它「非常快,而且在 vision 上表現優秀」,並稱它已在部分 pipeline 取代 Gemini 3.5 Flash;後者的輸出價格是它的 3.6 倍。另一個內容工具團隊則發現,它解析網路俚語的能力比 3.1 Flash-Lite 有「顯著提升」。
- 降級評價:一位工程師的內部評測得出相反結論:「3.5 flash lite 是一次真正的降級」,他們的團隊因此繼續使用 3.1 Flash-Lite。
早期評價彼此矛盾,通常表示模型的強項高度取決於工作負載。這也與我的數據相符:在它擅長的範圍內相當出色,但到了邊界處可能會悄悄失準。
各類任務該路由給哪一款模型?
Gemini 3.5 Flash-Lite 與 Gemini 3.1 Pro 並不是非此即彼的選擇。根據實測結果與社群回報的失敗案例,以下是我會部署的分工方式:
路由至 Flash-Lite($0.30/$2.50):
- 結構化資料擷取、分類、標記工作,搭配 JSON 驗證器與一次重試
- 模板化程式碼生成,例如 parser、converter、CRUD scaffolding
- 高頻率 agent 步驟:tool-call 格式化、摘要後傳遞、路由決策
- 以 vision 為主且量大的處理流程,這也是早期使用者最一致稱讚的場景
- 所有原本會使用 3.1 Flash-Lite 的工作:同級產品現在在 SWE-Bench Pro 高出 16 分
保留給 3.1 Pro($2/$12):
- 交付重點是維持數萬字內容一致性的長篇文件任務(社群回報,本文未測試)
- 工具呼叫回傳非預期結果時,必須重新規劃的 agent 任務
- 一次錯誤的成本高於一個月模型價差的判斷型工作
- 超過 200k context 的工作,需把該區間翻倍後的 $4/$18 費率納入預算
比起只選一款模型,更好的模式是預設路由至 Flash-Lite,並在明確觸發條件下升級至 Pro:schema 驗證在一次重試後仍失敗、工具呼叫回傳錯誤或非預期格式、輸入超過你的 context 舒適範圍,或上游標記為高風險的任務。以 25 倍實測成本差距計算,若將升級比例控制在約 15%,相較於全部使用 Pro,支出約可減少 80%(0.85 + 0.15 × 25 = Lite 成本的 4.6 倍,而全用 Pro 是 25 倍)。
如何呼叫兩款模型
Flash-Lite 已以 gemini-3.5-flash-lite 的名稱在 Gemini API、Google AI Studio 與 Gemini app 正式推出;3.1 Pro 則仍以 gemini-3.1-pro-preview 處於 preview。兩者也都能透過 OpenAI 相容 relay 平台使用;AIReiter 的 Google 模型目錄將 Gemini 系列與其他供應商模型列在一起,這正是我能在不用切換兩套 SDK 的情況下完成上述對測的方法。若你要重做這項測試,請記錄端點每次呼叫回報的 thinking-token 數量(OpenAI 相容路由使用 usage.completion_tokens_details.reasoning_tokens,原生 Gemini API 則使用 thoughtsTokenCount):25 倍的差距,就藏在這個欄位裡。
FAQ
Gemini 3.5 Flash-Lite 比 Gemini 3.1 Pro 更好嗎?
不是。它在我的四項抽樣測試中與 Pro 打平,涵蓋程式生成、資料擷取、邏輯與程式碼審查;但回應速度快 8 倍、計費低 25 倍。不過 Pro 在長上下文一致性、動態重新規劃與推理深度上仍有優勢,Artificial Analysis 指數為 46 對 36。
Gemini Flash 和 Flash-Lite 哪個比較好?
Flash($1.50/$9.00)是推理模型,在 agentic benchmark 的得分更高;Flash-Lite($0.30/$2.50)支援可調整思考層級,但我測試的全部 34 次呼叫都使用零思考 token,這也是它能在約一秒內回答的原因。對於高量資料擷取、分類與 vision pipeline,Flash-Lite 5–6 倍的價格優勢通常更有利;若是多步驟 agent 推理,則應付費使用 Flash。
為什麼 Gemini 3.5 Flash-Lite 變貴了?
Google 提高了此級距相較 3.1 Flash-Lite 的價格($0.25/$1.50 → $0.30/$2.50,輸出上漲 67%),同時公布大幅的能力提升:SWE-Bench Pro 從 38.3% → 54.2%,Terminal-bench 從 31% → 54%。你為每個 token 多付了錢,但模型需要的嘗試次數也更少。
有 Gemini 3.5 Pro 嗎?
截至 2026 年 7 月 23 日,沒有。3.5 世代推出 Flash-Lite、Flash 與 Live Translate 級距,以及更新的 3.6 Flash。Pro 系列最新版本仍是處於 preview 的 3.1 Pro。
