AIREITER

Gemini 3.8 Flash API 定價:每個成功 Agent 任務的成本怎麼算

最近更新: 2026-09-15 19:35:01

Gemini 3.8 Flash 的輸入 Token 單價看起來很低:每 100 萬 Token 只要 $0.75。但這只是優惠期間的價格。Google 目前列出的標準費率將從 2027 年 1 月 1 日起調為兩倍;再加上推理 Token 與重試,真正通過驗收的任務成本往往高於表面數字。做預算時,該看的不是今天的 Token 單價,而是 1 月的新費率與實際成功率。

Agent 開發者該看的是哪個價格

重點不在單次 API 呼叫成本,而是每個成功任務的成本:把所有模型與工具支出加總,再除以通過驗收測試的執行次數。

當額外推理能減少重試、提高可接受結果的比例時,Gemini 3.8 Flash 很適合處理困難的多步驟任務。但若只是固定格式擷取或簡單分類,就不該預設一律使用它。

「如果你要把 Flash 用在 agent loop,請按 1 月的帳單估,不要看今天的 API 頁面。」— Vraj (@vraj_ai), 2026 年 9 月 3 日

2027 年 1 月 1 日後的 Gemini 3.8 Flash API 費率

Google 的 Gemini API 定價文件模型文件均列出優惠費率適用至 2026 年 12 月 31 日,標準費率則自 2027 年 1 月 1 日起生效。

計費模式截至 2026 年 12 月 31 日的輸入費率截至 2026 年 12 月 31 日的輸出費率自 2027 年 1 月 1 日起的輸入費率自 2027 年 1 月 1 日起的輸出費率
Standard$0.75 / 1M$3.75 / 1M$1.50 / 1M$7.50 / 1M
Batch$0.375 / 1M$1.875 / 1M$0.75 / 1M$3.75 / 1M
Flex$0.375 / 1M$1.875 / 1M$0.75 / 1M$3.75 / 1M
Priority$1.35 / 1M$6.75 / 1M$2.70 / 1M$13.50 / 1M
快取輸入$0.075 / 1M$0.15 / 1M

這些是 Token 單價,不是完整的 Agent 帳單。文件中列出的 grounding、快取儲存、外部工具、主機服務與供應商費用,都可能另外計費。輸出計費也包含 thinking tokens,不只是使用者看得到的回答內容。

對於可容忍延遲的工作,Batch 是最實用的成本槓桿。調價後,只要工作負載符合資格,且 API 介面確實套用 Batch 費率,新的 Batch 價格會等於目前的 Standard 價格。

用「成功任務成本」取代單純的 Token 乘法

不要只做一次 Token 乘法,應分成以下四層計算:

  1. 單次嘗試的模型成本 = (input tokens × input rate) + (output tokens × output rate)
  2. 單次嘗試成本 = 模型成本,加上工具、grounding、儲存與基礎設施費用。
  3. 預期成功任務成本 = 單次嘗試成本 ÷ 成功機率。
  4. 實際成功任務成本 = 總支出 ÷ 通過驗收的任務數。

計算 Agent loop 時,每一次模型呼叫和重試都要納入。如果一次執行要呼叫三次模型才能給出答案,輸入與輸出 Token 就應加總三次呼叫的用量。thinking tokens 也要算進輸出用量;Google 在 Gemini 回應中提供了 promptTokenCountthoughtsTokenCountcandidatesTokenCount 等用量欄位。

試算:20,000 個輸入 Token、5,000 個輸出 Token

假設一次完整嘗試使用 20,000 個輸入 Token 與 5,000 個輸出 Token。本例先不計工具費用。

期間計算式每次嘗試成本成功率 70% 時,每個成功任務成本
截至 2026 年 12 月 31 日0.02 × $0.75 + 0.005 × $3.75$0.03375$0.0482
自 2027 年 1 月 1 日起0.02 × $1.50 + 0.005 × $7.50$0.06750$0.0964

若 Token 用量與成功機率不變,這次調價會讓成本直接翻倍。若 Agent 在部分失敗案例中還會重試一次,實際平均成本會高於這個簡化估算,因為失敗嘗試同樣會消耗 Token。

分母非常關鍵。一個每次呼叫成本 $0.05、但只有一半成功率的 Agent,在未計工具費用前,每個通過驗收的任務成本就是 $0.10;若單次呼叫成本為 $0.08、成功率達 90%,每個成功任務的成本約為 $0.0889。

三種會改變預算結論的情境

固定結構的資料擷取

將 PDF 轉成 JSON,且 schema 穩定的流程,通常有明確的驗收條件:必要欄位存在、型別驗證通過,而且沒有多餘敘述文字。先用 low thinking 執行並觀察是否通過。若驗證本來就能通過,為 high effort 付費只會增加成本,卻不會提高分母。

Google 的模型文件指出,Gemini 3.8 Flash 提供 lowmediumhigh 三種 thinking level,不支援 minimal。把 thinking level 視為路由層級的成本設定,而不是全應用程式共用的一個預設值。

長上下文的 Agent 工作

寫程式或研究型 Agent 可能在多個回合中反覆帶入大量上下文,接著又產生更多推理內容與工具呼叫。此時,快取輸入、降低重試率與提高成功率的重要性,可能遠高於名目輸出單價。

對長時間執行的任務,應將上下文重送與新的輸入分開記錄。1 百萬 Token 的上下文視窗不代表這些 Token 免費。若路由需要互動式回應,Standard 或 Priority 可能較合適;若可留到隔夜處理,則應依時效需求比較 Batch 或 Flex。

重試頻繁的自動化流程

假設某個路由在 1 月 1 日後每次嘗試成本為 $0.0675,成功率為 70%。若假設每次重試彼此獨立且沒有重試上限,每成功一次的預期嘗試次數約為 1 ÷ 0.70 = 1.43,換算後每個通過驗收任務的模型成本約為 $0.0964。

若失敗會觸發昂貴的瀏覽器操作、搜尋呼叫或人工審查,這些成本都必須加進分子。Agent 的 Token 成本可以很低,整體營運成本卻可能很高。

Gemini 3.8 Flash 何時仍值得付更高成本

當額外推理能確實改善結果時,就值得使用 Gemini 3.8 Flash:例如減少被退回的程式修補、降低工具流程失敗、強化多步驟驗證,或提高困難任務的驗收率。至於重複性的轉換、路由、擷取,以及低 effort 已能通過驗收的工作,則應保留成本較低的路由。

Artificial Analysis 報告的獨立數據,以及 Apidog 的整理指出,在 high-thinking 設定下,Gemini 3.8 Flash 每個 benchmark task 的成本約為 $0.58,Gemini 3.7 Flash 則約為 $0.40;Intelligence Index 分數則是 59 對 56。這些是特定 benchmark 的數字,不是通用帳單預測;它們的價值在於說明 Token 消耗會改變經濟性,而不是為你的工作負載報價。

社群觀察也指向相同結論。Jan (@jan_volad) 表示,一次 Gemini 3.8 Flash 的比較約使用了 1.2 億個輸出 Token,競品則為 2,900 萬至 3,500 萬個,並提到混合任務成本為 $0.58。這是使用者觀察,並非經獨立稽核的生產帳單。該貼文的價值在於,它說明了為何每百萬 Token 的低單價可能會高估實際節省幅度。

實務上的路由原則可以很簡單:

  • 困難的 Agent 任務:mediumhigh 測試 Gemini 3.8 Flash,並衡量通過驗收任務的成本。
  • 例行任務:先測試 low;只有在品質關卡通過時才保留這個路由。
  • 可延後的大量工作:1 月 1 日後比較 Batch 與 Standard。
  • 品質尚未確定的任何路由:在量到成功機率前,不要急著最佳化 Token 單價。

Gemini 3.8 Flash 定價常見問題

Batch 一定比較便宜嗎?

依照列出的價目表,Batch 確實較便宜;但它是為可接受延後處理的工作負載而設計,不能直接取代必須即時回應的互動式 Agent。

怎麼計算每個成功 Agent 任務的成本?

先加總一段執行期間內的模型、工具、grounding 與基礎設施費用,再除以通過驗收測試的執行次數。若要做預測,則以預期單次嘗試成本除以估計成功機率,並納入預期重試次數。

實際做法:為路由編列預算,不是只看模型

依路由記錄輸入、thinking、可見輸出、工具回合、重試、延遲、支出與驗收狀態。測試相關的 thinking level,接著同時以 12 月與 1 月的價目表進行預估。

決策其實很直接:額外推理確實能換來成功結果的地方,就使用 Gemini 3.8 Flash;原本就能通過的工作,採用較低 effort;符合資格的大量工作則移至 Batch。目前公布的表格顯示,2027 年 1 月將進行費率調整;至於這個模型是否划算,仍取決於每個成功結果背後消耗的 Token 與失敗次數。