對大規模運行 AI Agent 的團隊來說,Gemini 3.6 Flash 在 2026 年 7 月 21 日推出時,有兩個數字最值得注意:輸出 Token 單價從每 100 萬 Token $9.00 降至 $7.50,而且完成同一項工作時,平均可少用約 17% 的輸出 Token。若是輸出量高的工作負載,兩項因素相加,單次任務成本大致可降低三分之一。它在程式開發與 Agent 類跑分上也普遍勝過舊款 3.5 Flash,甚至在多數測試中領先更大的 3.1 Pro。對既有 3.5 Flash 使用者而言,這幾乎是一次免費升級;但若只看標價,它並不是同級模型中最便宜的選擇。
Google 在 7 月 21 日一次推出了什麼
這次同步登場的共有三款模型,各自鎖定不同使用情境:
- Gemini 3.6 Flash (
gemini-3.6-flash):主力的「兼顧速度與智慧」模型。具備 1M Token 上下文、64k 最大輸出,知識截止日也從 2025 年 1 月推進至 2026 年 3 月。 - Gemini 3.5 Flash-Lite:面向高吞吐量需求的模型,輸出速度約為每秒 350 Token,適合價格敏感、規模龐大但任務相對簡單的工作。
- Gemini 3.5 Flash Cyber:針對資安調校的版本,可發現、驗證並修補漏洞。它運行於 CodeMender 內,目前是提供政府與受信任合作夥伴的有限存取試點,並非全面公開發布。
官方模型頁面將 3.6 Flash 定位為「專為速度打造、最具智慧的模型」,其價格已列於 Google 的 Gemini API 定價頁面。
這次更新並不是毫無背景。Google 的旗艦 Gemini 3.5 Pro 延後了原定時程,而 DeepMind 也表示已開始 Gemini 4 的預訓練。因此,在更大型的新模型陸續到位前,這次 Flash 更新正好補上了產品空缺。
Gemini 3.6 Flash 定價:降價幅度其實沒表面上那麼大
Gemini 3.6 Flash 的標準 API 價格為每 100 萬輸入 Token $1.50、每 100 萬輸出 Token $7.50,輸出 Token 包含 thinking tokens。上下文快取費用為每 100 萬 Token $0.15,儲存費則為每 100 萬 Token 每小時 $1.00。
許多上市報導忽略了一點:這次降價只發生在輸出端。前一代 Gemini 3.5 Flash 的輸入價格同樣是 $1.50,輸出則是 $9.00。換言之,輸入成本沒有改變,輸出從 $9.00 降為 $7.50,降幅是 16.7%,並非全項目折扣。如果你的工作負載以輸入為主,例如丟進長文件、只要求簡短回答,帳面上的節省有限;真正的效益來自其他地方。
別只看 Token 單價,該看每次任務成本
用每 Token 標價比較模型世代,往往不是正確的衡量方式。實際支出取決於單價 × 使用 Token 數量。這裡有兩個變數:輸出價格低了 16.7%,而 Google 透過 Artificial Analysis Index 表示,完成相同工作所需的輸出 Token 約少 17%。兩者疊加後,最佳情況為 0.833 × 0.83 ≈ 0.69,也就是輸出成本約可降低 31%。
實際能省多少仍取決於工作類型,因此我在 2026 年 7 月 22 日透過 OpenRouter,以 temperature 0 對兩款模型執行同樣三組提示:一項程式任務、一題推理問題,以及一項 JSON 擷取工作:
| 指標(3 項任務,temp 0) | Gemini 3.6 Flash | Gemini 3.5 Flash |
|---|---|---|
| 輸入 Token | 146 | 145 |
| 輸出 Token | 2,736 | 2,593 |
| 總成本 | $0.0207 | $0.0236 |
| 總延遲 | 5.20s | 5.19s |
兩款模型都產出了正確且可比的答案。在這個小樣本中,3.6 Flash 的速度幾乎相同,但成本低了約 12%;不過它實際輸出的 Token 反而多了幾個百分點,因為模型花了更多篇幅進行推理。結論是:最穩定的節省來自輸出單價下調,也就是從 $9.00 降至 $7.50;Token 效率提升在整體數據中確實存在,但會隨任務而變動,未必每次都能看到。實務上可先以輸出成本降低 12–17% 估算,31% 則屬最佳情況。
(小樣本測試:三項任務、temperature 0,並非正式基準測試。)
Gemini 3.6 Flash 與其他快速模型的價格比較
每 Token 最便宜,不代表整體價值最高。以下將快速模型級距並列比較,所有數字皆為各供應商官方定價頁面上的標準非 Batch 價格,單位為每 100 萬 Token。
| 模型 | 輸入 /1M | 輸出 /1M | 上下文 |
|---|---|---|---|
| Gemini 3.6 Flash | $1.50 | $7.50 | 1M |
| Gemini 3.5 Flash(前代) | $1.50 | $9.00 | 1M |
| Gemini 3.5 Flash-Lite | $0.30 | $2.50 | 1M |
| Claude Haiku 4.5 | $1.00 | $5.00 | 200k |
| GPT-5.6 Luna | $1.00 | $6.00 | — |
| DeepSeek V4 Flash | $0.14 | $0.28 | 1M |
若只比標價,3.6 Flash 並不占優勢。Claude Haiku 4.5 與 GPT-5.6 Luna 的輸出價格都更低,DeepSeek V4 Flash 的成本更是完全不同的級距。3.6 Flash 主打的是每一美元可換得的智慧能力:它在 Artificial Analysis 的 Intelligence Index 獲得 50 分,明顯高於快速模型級距的中位數;輸出速度約為每秒 304 Token,並提供完整 1M Token 上下文視窗。若你需要接近前沿模型的 Agent 與程式能力,卻不想支付旗艦模型價格,這正是它的價值所在。若只是要以最低成本處理簡單任務,表中更便宜的選項會更合適。
相較 Gemini 3.5 Flash,進步有多少?
這一代的提升確實明顯,尤其集中在 Flash 系列原本相對弱勢的長流程程式開發與 Agent 工作。
| Benchmark | Gemini 3.5 Flash | Gemini 3.6 Flash |
|---|---|---|
| DeepSWE v1.1 | 37% | 49% |
| MLE-Bench | 49.7% | 63.9% |
| OSWorld-Verified(電腦操作) | 78.4% | 83.0% |
| SWE-Bench Pro | 55.1% | 58.7% |
| Terminal-Bench 2.1 | 76.2% | 78.0% |
分數來自 Google DeepMind Flash 模型頁面與 Artificial Analysis。其中 DeepSWE 與 MLE-Bench 的進步尤其突出,分別增加 12 個百分點與 14 個百分點。Google 也公布 GDPval-AA 知識工作分數為 1421,高於此前的 1349。在數個測試中,3.6 Flash 甚至略勝更大、更昂貴的 3.1 Pro,這對 Flash 系列模型來說並不尋常。
Gemini 3.6 Flash 對上 3.1 Pro:快型模型反而勝出
真正令人意外的是,這款快速級距模型在 Agent 與程式任務上擊敗了 Google 更大、價格更高的 3.1 Pro。Gemini 3.1 Pro Preview 依提示長度分級,每 100 萬 Token 的輸入價格為 $2.00–$4.00、輸出為 $12.00–$18.00;相比之下,3.6 Flash 採固定 $1.50/$7.50 定價。
| Gemini 3.6 Flash | Gemini 3.1 Pro | |
|---|---|---|
| 輸入 /1M | $1.50 | $2.00–$4.00 |
| 輸出 /1M | $7.50 | $12.00–$18.00 |
| DeepSWE v1.1 | 49% | 12% |
| SWE-Bench Pro | 58.7% | 54.2% |
| Terminal-Bench 2.1 | 78.0% | 73.8% |
3.1 Pro 仍是規模更大、定價更高的模型,定位在最困難的推理與長上下文任務。不過,對多數程式與 Agent 工作負載而言,3.6 Flash 在上述基準測試中不但更便宜,分數也更高。因此,在預設選擇 Pro 級距前,很值得先實測比較。完整 Gemini 3.6 Flash vs 3.1 Pro 比較整理了正面跑分、分級定價與第一手速度測試。
正在用 Gemini 3.5 Flash,該遷移嗎?
對大多數已使用 3.5 Flash 的團隊來說,答案是肯定的。整體來看,升級幾乎是單向利多:
- 輸入價格相同($1.50/1M),但輸出價格更低($7.50 vs $9.00)。
- 相同任務使用更少輸出 Token,約少 17%。
- 知識截止日更新,從 2025 年 1 月推進至 2026 年 3 月。
- 所有上述 Agent 與程式跑分更高。
不過,在正式替換生產環境模型前,還有兩件事需要確認。第一,工作負載是否符合 64k 最大輸出限制;若你原本仰賴更長的單次回應,應先測試這個邊界。第二,請跑自己的評測集。Token 效率與推理方式的變化,可能影響已經調校完成的提示詞表現,因此切換預設模型前,應先以真實流量驗證延遲與輸出品質。
Flash、Flash-Lite、Cyber 該怎麼選?
三款模型各有清楚分工:
- Gemini 3.6 Flash是預設選擇。需要前沿等級的 Agent、程式開發與多模態品質,同時希望維持快速模型價格時,就選它。
- Gemini 3.5 Flash-Lite($0.30/$2.50、約 350 Token/秒)適合高流量、重視延遲、複雜度較低的工作,例如分類、擷取、路由與簡單聊天。它是大規模運行 Gemini 最低成本的方式。
- Gemini 3.5 Flash Cyber只與政府或通過審核的資安合作夥伴有關。它是 CodeMender 內的試點功能,無法透過標準 API 直接呼叫。
如何取得 Gemini 3.6 Flash
這款模型已在 Gemini API 與 Google AI Studio 上線。AI Studio 提供免費級距供原型開發使用,之後可用 gemini-3.6-flash 模型 ID 轉為隨用隨付,流程與 Gemini 其他模型相同,可參考這篇先免費、後付費的 Google AI Studio 使用方式。Antigravity、Android Studio 與 Gemini Enterprise Agent Platform 等企業服務介面也已列出支援。若特別需要在 Vertex AI 使用,請先於 Vertex 主控台確認模型是否已上架,因為截至 2026 年 7 月 22 日,該平台的供應狀態仍在逐步推出。
最精簡的 Gemini API REST 呼叫如下:
curl "https://generativelanguage.googleapis.com/v1beta/models/gemini-3.6-flash:generateContent" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H "Content-Type: application/json" \
-d '{"contents":[{"parts":[{"text":"Summarize agentic AI in one sentence."}]}]}'
同時使用多家模型供應商的團隊,有時會透過聚合平台路由模型,避免分別管理多組金鑰。OpenRouter 與 AIReiter 都以 Google 的牌價提供 gemini-3.6-flash;差異在於同一組金鑰背後還能使用哪些服務。OpenRouter 可跨多家供應商路由,AIReiter 則相容 Anthropic API,並可將 Gemini 與 Claude 一起路由;若你想在同一張帳單上比較 3.6 Flash 與 Claude 的 API 定價,會相當方便。若只部署單一模型,直接使用 Google 會更簡單。
常見問題
Gemini 3.6 Flash 免費嗎?
Google AI Studio 提供有使用額度限制的免費級距,可用於原型開發。生產環境則採隨用隨付,價格為每 100 萬輸入 Token $1.50、每 100 萬輸出 Token $7.50。
Gemini 3.6 Flash 比 3.5 Flash 好嗎?
是。在已公布的跑分中,它在 DeepSWE、MLE-Bench、OSWorld-Verified、SWE-Bench Pro 與 Terminal-Bench 都超越 3.5 Flash,同時每個輸出 Token 的成本更低,且每項任務使用的 Token 更少。
Gemini 3.6 Flash 比 Gemini 3.1 Pro 好嗎?
在 DeepSWE、SWE-Bench Pro、Terminal-Bench 等 Agent 與程式跑分上,是的,而且價格更低($1.50/$7.50 對比 $2.00–$4.00/$12.00–$18.00)。Gemini 3.1 Pro 是更大的模型,在最困難的長上下文推理與多模態任務上仍具優勢,因此最適合的選擇仍取決於你的工作負載。
Gemini 3.6 Flash 的價格是多少?
標準級距的價格為每 100 萬輸入 Token $1.50,以及每 100 萬輸出 Token $7.50。上下文快取為每 100 萬 Token $0.15。
Gemini 3.6 Flash 的知識截止日是什麼時候?
2026 年 3 月,相較前一代 Gemini 3.5 Flash 的 2025 年 1 月更新。
Gemini 3.6 Flash 可在 Vertex AI 使用嗎?
目前已確認可在 Gemini API 與 Google AI Studio 使用,另有數個企業服務介面支援。Vertex AI 在發布時並未明確確認供應狀態,因此若打算在該平台建置服務,請先查看 Vertex 模型目錄。
Gemini 3.5 Flash Cyber 是什麼?
這是一款針對軟體漏洞偵測、驗證與修補調校的資安模型。它運行於 Google DeepMind 的 CodeMender Agent 中,屬於提供政府與受信任合作夥伴的有限存取試點,而非公開模型。
