Gemini 3.8 Flash 的輸入 Token 單價看起來很低:每 100 萬 Token 只要 $0.75。但這只是優惠期間的價格。Google 目前列出的標準費率將從 2027 年 1 月 1 日起調為兩倍;再加上推理 Token 與重試,真正通過驗收的任務成本往往高於表面數字。做預算時,該看的不是今天的 Token 單價,而是 1 月的新費率與實際成功率。
Agent 開發者該看的是哪個價格
重點不在單次 API 呼叫成本,而是每個成功任務的成本:把所有模型與工具支出加總,再除以通過驗收測試的執行次數。
當額外推理能減少重試、提高可接受結果的比例時,Gemini 3.8 Flash 很適合處理困難的多步驟任務。但若只是固定格式擷取或簡單分類,就不該預設一律使用它。
「如果你要把 Flash 用在 agent loop,請按 1 月的帳單估,不要看今天的 API 頁面。」— Vraj (@vraj_ai), 2026 年 9 月 3 日
2027 年 1 月 1 日後的 Gemini 3.8 Flash API 費率
Google 的 Gemini API 定價文件與模型文件均列出優惠費率適用至 2026 年 12 月 31 日,標準費率則自 2027 年 1 月 1 日起生效。
| 計費模式 | 截至 2026 年 12 月 31 日的輸入費率 | 截至 2026 年 12 月 31 日的輸出費率 | 自 2027 年 1 月 1 日起的輸入費率 | 自 2027 年 1 月 1 日起的輸出費率 |
|---|---|---|---|---|
| Standard | $0.75 / 1M | $3.75 / 1M | $1.50 / 1M | $7.50 / 1M |
| Batch | $0.375 / 1M | $1.875 / 1M | $0.75 / 1M | $3.75 / 1M |
| Flex | $0.375 / 1M | $1.875 / 1M | $0.75 / 1M | $3.75 / 1M |
| Priority | $1.35 / 1M | $6.75 / 1M | $2.70 / 1M | $13.50 / 1M |
| 快取輸入 | $0.075 / 1M | — | $0.15 / 1M | — |
這些是 Token 單價,不是完整的 Agent 帳單。文件中列出的 grounding、快取儲存、外部工具、主機服務與供應商費用,都可能另外計費。輸出計費也包含 thinking tokens,不只是使用者看得到的回答內容。
對於可容忍延遲的工作,Batch 是最實用的成本槓桿。調價後,只要工作負載符合資格,且 API 介面確實套用 Batch 費率,新的 Batch 價格會等於目前的 Standard 價格。
用「成功任務成本」取代單純的 Token 乘法
不要只做一次 Token 乘法,應分成以下四層計算:
- 單次嘗試的模型成本 =
(input tokens × input rate) + (output tokens × output rate)。 - 單次嘗試成本 = 模型成本,加上工具、grounding、儲存與基礎設施費用。
- 預期成功任務成本 = 單次嘗試成本 ÷ 成功機率。
- 實際成功任務成本 = 總支出 ÷ 通過驗收的任務數。
計算 Agent loop 時,每一次模型呼叫和重試都要納入。如果一次執行要呼叫三次模型才能給出答案,輸入與輸出 Token 就應加總三次呼叫的用量。thinking tokens 也要算進輸出用量;Google 在 Gemini 回應中提供了 promptTokenCount、thoughtsTokenCount 與 candidatesTokenCount 等用量欄位。
試算:20,000 個輸入 Token、5,000 個輸出 Token
假設一次完整嘗試使用 20,000 個輸入 Token 與 5,000 個輸出 Token。本例先不計工具費用。
| 期間 | 計算式 | 每次嘗試成本 | 成功率 70% 時,每個成功任務成本 |
|---|---|---|---|
| 截至 2026 年 12 月 31 日 | 0.02 × $0.75 + 0.005 × $3.75 | $0.03375 | $0.0482 |
| 自 2027 年 1 月 1 日起 | 0.02 × $1.50 + 0.005 × $7.50 | $0.06750 | $0.0964 |
若 Token 用量與成功機率不變,這次調價會讓成本直接翻倍。若 Agent 在部分失敗案例中還會重試一次,實際平均成本會高於這個簡化估算,因為失敗嘗試同樣會消耗 Token。
分母非常關鍵。一個每次呼叫成本 $0.05、但只有一半成功率的 Agent,在未計工具費用前,每個通過驗收的任務成本就是 $0.10;若單次呼叫成本為 $0.08、成功率達 90%,每個成功任務的成本約為 $0.0889。
三種會改變預算結論的情境
固定結構的資料擷取
將 PDF 轉成 JSON,且 schema 穩定的流程,通常有明確的驗收條件:必要欄位存在、型別驗證通過,而且沒有多餘敘述文字。先用 low thinking 執行並觀察是否通過。若驗證本來就能通過,為 high effort 付費只會增加成本,卻不會提高分母。
Google 的模型文件指出,Gemini 3.8 Flash 提供 low、medium 與 high 三種 thinking level,不支援 minimal。把 thinking level 視為路由層級的成本設定,而不是全應用程式共用的一個預設值。
長上下文的 Agent 工作
寫程式或研究型 Agent 可能在多個回合中反覆帶入大量上下文,接著又產生更多推理內容與工具呼叫。此時,快取輸入、降低重試率與提高成功率的重要性,可能遠高於名目輸出單價。
對長時間執行的任務,應將上下文重送與新的輸入分開記錄。1 百萬 Token 的上下文視窗不代表這些 Token 免費。若路由需要互動式回應,Standard 或 Priority 可能較合適;若可留到隔夜處理,則應依時效需求比較 Batch 或 Flex。
重試頻繁的自動化流程
假設某個路由在 1 月 1 日後每次嘗試成本為 $0.0675,成功率為 70%。若假設每次重試彼此獨立且沒有重試上限,每成功一次的預期嘗試次數約為 1 ÷ 0.70 = 1.43,換算後每個通過驗收任務的模型成本約為 $0.0964。
若失敗會觸發昂貴的瀏覽器操作、搜尋呼叫或人工審查,這些成本都必須加進分子。Agent 的 Token 成本可以很低,整體營運成本卻可能很高。
Gemini 3.8 Flash 何時仍值得付更高成本
當額外推理能確實改善結果時,就值得使用 Gemini 3.8 Flash:例如減少被退回的程式修補、降低工具流程失敗、強化多步驟驗證,或提高困難任務的驗收率。至於重複性的轉換、路由、擷取,以及低 effort 已能通過驗收的工作,則應保留成本較低的路由。
Artificial Analysis 報告的獨立數據,以及 Apidog 的整理指出,在 high-thinking 設定下,Gemini 3.8 Flash 每個 benchmark task 的成本約為 $0.58,Gemini 3.7 Flash 則約為 $0.40;Intelligence Index 分數則是 59 對 56。這些是特定 benchmark 的數字,不是通用帳單預測;它們的價值在於說明 Token 消耗會改變經濟性,而不是為你的工作負載報價。
社群觀察也指向相同結論。Jan (@jan_volad) 表示,一次 Gemini 3.8 Flash 的比較約使用了 1.2 億個輸出 Token,競品則為 2,900 萬至 3,500 萬個,並提到混合任務成本為 $0.58。這是使用者觀察,並非經獨立稽核的生產帳單。該貼文的價值在於,它說明了為何每百萬 Token 的低單價可能會高估實際節省幅度。
實務上的路由原則可以很簡單:
- 困難的 Agent 任務:以
medium或high測試 Gemini 3.8 Flash,並衡量通過驗收任務的成本。 - 例行任務:先測試
low;只有在品質關卡通過時才保留這個路由。 - 可延後的大量工作:1 月 1 日後比較 Batch 與 Standard。
- 品質尚未確定的任何路由:在量到成功機率前,不要急著最佳化 Token 單價。
Gemini 3.8 Flash 定價常見問題
Batch 一定比較便宜嗎?
依照列出的價目表,Batch 確實較便宜;但它是為可接受延後處理的工作負載而設計,不能直接取代必須即時回應的互動式 Agent。
怎麼計算每個成功 Agent 任務的成本?
先加總一段執行期間內的模型、工具、grounding 與基礎設施費用,再除以通過驗收測試的執行次數。若要做預測,則以預期單次嘗試成本除以估計成功機率,並納入預期重試次數。
實際做法:為路由編列預算,不是只看模型
依路由記錄輸入、thinking、可見輸出、工具回合、重試、延遲、支出與驗收狀態。測試相關的 thinking level,接著同時以 12 月與 1 月的價目表進行預估。
決策其實很直接:額外推理確實能換來成功結果的地方,就使用 Gemini 3.8 Flash;原本就能通過的工作,採用較低 effort;符合資格的大量工作則移至 Batch。目前公布的表格顯示,2027 年 1 月將進行費率調整;至於這個模型是否划算,仍取決於每個成功結果背後消耗的 Token 與失敗次數。