Pro 型號通常才是贏家,但這次不是。Gemini 3.6 Flash不只比 Gemini 3.1 Pro 便宜,生成速度更超過兩倍,幾乎所有程式設計與代理型基準測試也都領先。較早推出的 3.1 Pro 只在一個領域守住優勢:難度最高的純推理測試。我以完全相同的任務實測兩款模型,並在 2026 年 7 月 23 日依 Google 文件與 Artificial Analysis 再次核對以下所有價格與規格。
30 秒看懂該選哪一款
Gemini 3.6 Flash | Gemini 3.1 Pro | 勝出者 | |
|---|---|---|---|
API 價格(每 100 萬 token,≤200k;輸入/輸出) | $1.50 / $7.50 | $2.00 / $12.00 | Flash |
長提示詞(>200k tokens) | 價格維持不變 | $4.00 / $18.00 | Flash |
輸出速度 | 261 tokens/s | 112 tokens/s | Flash |
程式設計與代理型基準 | 4 項正面比較全勝 | — | Flash |
最高難度推理(GPQA、HLE) | — | 領先 1.3–6.4 分 | 3.1 Pro |
知識截止日期 | 2026 年 3 月 | 2025 年 1 月 | Flash |
發布狀態 | 正式推出 | 自 2026 年 2 月起為預覽版 | Flash |
如果只想知道結論:預設就選 Gemini 3.6 Flash;只有任務需要最高推理上限時,才考慮 3.1 Pro。你也可以直接在瀏覽器聊天介面,用自己的提示詞讓Gemini 3.6 Flash和Gemini 3.1 Pro正面較量,不需要 API key。以下則是完整證據,包括一套可自行重現的三項任務測試。
價格差距有多大?
Gemini 3.6 Flash 不論提示詞長度都採單一費率;Gemini 3.1 Pro 不只較貴,超長提示詞還會進入另一個計價級距。以下是每 100 萬 tokens 的標準 API 定價,於 2026 年 7 月 23 日核實:
Gemini 3.6 Flash | Gemini 3.1 Pro | |
|---|---|---|
輸入(≤200k) | $1.50 | $2.00 |
輸出(≤200k) | $7.50 | $12.00 |
輸入(>200k) | $1.50 | $4.00 |
輸出(>200k) | $7.50 | $18.00 |
Context cache 讀取(≤200k) | $0.15 | $0.20 |
Batch(輸入/輸出,≤200k) | $0.75 / $3.75 | $1.00 / $6.00 |
真正有感的是輸出費用:短提示詞下,3.1 Pro 每個輸出 token 的成本高出 60%;提示詞跨過 200k tokens 後,最高更會貴 140%。
折扣方案也沒有改變這個差距。Batch mode 對兩款模型都是半價,因此 Pro 在這裡依然貴 60%。除了依 token 計價的讀取費,cache 儲存還按小時計費:Pro 每 100 萬 tokens 每小時為 $4.50,Flash 則是 $1.00。以 Google 公開牌價來看,無論標準、Batch、Priority 或快取模式,Pro 都不會成為較便宜的選項。
相同三道題目,兩款模型實測
價格表是假設兩者使用相同 token 數量,因此我在 2026 年 7 月 22 日透過 OpenRouter,以 temperature 0 對兩款模型各跑一次完全相同的三組提示詞。使用的 model ID 分別是 google/gemini-3.6-flash 與 google/gemini-3.1-pro-preview:
1. 程式設計:撰寫 Python merge_intervals 函式,附上 docstring 與使用範例 2. 推理:一道需要時間與速度代數計算的雙列車追及文字題 3. 擷取:從雜亂的團隊訊息中找出待辦事項,輸出為 JSON 陣列
任務 | Flash 延遲 | Pro 延遲 | Flash 成本 | Pro 成本 |
|---|---|---|---|---|
程式設計 | 2.4s | 4.5s | $0.0085 | $0.0102 |
推理 | 1.9s | 2.4s | $0.0082 | $0.0118 |
擷取 | 1.3s | 2.6s | $0.0049 | $0.0057 |
合計 | 5.65s | 9.48s | $0.0215 | $0.0277 |
*合計數字根據原始毫秒與 token 紀錄計算;各任務列已四捨五入,因此自行加總某欄時可能會差 0.01。*
兩款模型三題全對:區間合併正確、追及時間算對,JSON 也很乾淨。差別只在於完成這些答案所付出的成本。
Flash 產生的 token 反而比 Pro 更多(OpenRouter usage metadata 顯示為 2,843 對 2,285,兩者多數都是內部推理 token),但端到端仍便宜 22%,快 40%。Pro 較高的輸出單價與較慢的生成速度,抵銷了它回答較精簡的優勢。若用在代理型迴圈,每一步都要承擔一次延遲,這個差距會持續累積。

三組簡短提示詞只是抽查,不能當成基準測試,這些精確百分比應視為示意。不過整體方向和大規模測量結果一致,接下來就來看這些數據。
程式設計與代理型基準:Flash 全面勝出
從公開的正面比較數據來看(Artificial Analysis),3.6 Flash 在程式設計、ML engineering 與終端機使用上全面超越較早的 3.1 Pro:
基準測試 | Gemini 3.1 Pro | Gemini 3.6 Flash |
|---|---|---|
DeepSWE v1.1 | 12% | 49% |
MLE-Bench | 42.6% | 63.9% |
SWE-Bench Pro | 54.2% | 58.7% |
Terminal-Bench 2.1 | 73.8% | 78.0% |

其中 DeepSWE 的差距最大,為 49% 對 12%。Flash 在多模態推理同樣小幅勝過 Pro(MMMU-Pro 為 83.2% 對 82.4%),綜合指標 Artificial Analysis Intelligence Index 也以 50 對 46 取勝。
速度表現也是同樣趨勢。截至 2026 年 7 月 23 日,Artificial Analysis 測得 Flash 為每秒 261 tokens,3.1 Pro 則是 112 tokens,前者快 2.3 倍;標準工作負載下,首 token 時間分別為 12.8s 與 31.2s。這項首 token 指標包含模型在開始回答前的思考時間,因此我上面的短任務會更快結束。若放到完整排行榜來看,Flash 同時在三個維度都接近頂尖水準:

長上下文有一個值得釐清的細節。兩款模型都支援 100 萬 token 輸入,但在極長內容中,Flash 尋找資訊的能力明顯更好(100 萬 tokens 下的 MRCR retrieval:54% 對低於 27%);Pro 則在長輸入內容上的推理略勝一籌,下一節會說明。
Gemini 3.1 Pro 仍有優勢的地方
公平來看這款旗艦模型,3.1 Pro 在三項基準中領先,而且全都是高難度的知識與推理測試。
基準測試 | Gemini 3.1 Pro | Gemini 3.6 Flash |
|---|---|---|
GPQA Diamond(博士級科學) | 94.1% | 92.8% |
Humanity's Last Exam(無工具) | 44.7% | 38.3% |
AA-LCR(長上下文推理) | 72.7% | 69.7% |
GPQA 和長上下文推理的差距不大,Humanity's Last Exam 的差距則較明顯。Google 在其對 3.1 Pro 的定位正是:「需要廣泛世界知識,以及跨多模態進行進階推理的複雜任務。」若你的工作正處在這個前沿場景,例如研究等級的科學問題、針對長文件的多步推理,它確實有更高上限,也值得多付這筆錢。
但實務上還有兩點不利因素:
知識較舊。Pro 的知識截止於 2025 年 1 月,比 Flash 的 2026 年 3 月早了十四個月;這款旗艦反而比平價模型更不了解當前世界。
仍屬預覽版。自 2026 年 2 月推出至今五個月,3.1 Pro 在 Google 定價頁面仍標示為 Preview,model ID 也正是
gemini-3.1-pro-preview;Flash 則已作為目前的穩定預設版本推出。
不同工作負載該怎麼選
選 Gemini 3.6 Flash:適合 coding agent、終端機與電腦操作自動化、ML engineering 任務、高量擷取或分類、對延遲敏感的應用,以及長文件檢索。從已公開數據來看,它在這些項目都更便宜、更快、知識更新,分數也更高。
選 Gemini 3.1 Pro:任務屬於前沿推理,例如博士級科學問題或長輸入上的多步分析,而且幾個基準分數的差異比成本、速度或知識新鮮度都重要時,才值得選它。也要預留 Preview 階段的變動空間:預覽模型的 ID 在穩定版推出時可能更名或停用。
這份比較仍無法替你判定兩件事:模型在你特定 tool-calling 模式下的可靠性,以及你的領域邊緣案例中,哪一款輸出品質更好。
兩者都透過同一個 Gemini API 提供服務,因此最省錢的判斷方式,就是拿你最常用的十組提示詞,各自跑過一次。我上面的三項任務腳本,大約一分鐘就能完成。
如何使用兩款模型
兩款模型都可在 Gemini API 和 Google AI Studio 使用,model ID 分別為 gemini-3.6-flash 與 gemini-3.1-pro-preview。AI Studio 的免費級距已足以讓你在正式投入前並排測試兩者。
如果你本來就透過聚合平台串接,OpenRouter 與 AIReiter 都以 Google 的牌價,透過單一 key 提供這兩款模型;我上面的 A/B 測試就是這樣跑的。
常見問題
Gemini 3.6 Flash 比 3.1 Pro 更好嗎?
對多數正式環境的工作來說,是的。它在程式設計、代理型任務、ML、電腦操作與多模態基準都勝出,成本更低、速度也快 2.3 倍。3.1 Pro 只在 GPQA Diamond、Humanity's Last Exam 與長上下文推理保持領先,差距為 1.3 到 6.4 分。
Gemini 3.6 Flash 比 3.1 Pro 便宜嗎?
是的,所有模式都是如此。標準 API 的輸出價格為每 100 萬 tokens $7.50 對 $12.00;提示詞超過 200k tokens 後,差距擴大為 $7.50 對 $18.00。Batch mode 下,Pro 也維持高出 60% 的溢價。Pro 的快取儲存費更是 4.5 倍。
Gemini 3.6 Flash 和 3.1 Pro,哪個比較快?
Flash 輸出速度約為每秒 261 tokens,3.1 Pro 為 112 tokens(Artificial Analysis,2026 年 7 月 23 日),而且開始回答也更快:推理密集工作負載的首 token 時間為 12.8s 對 31.2s。我三項任務的實測結果,則是 Flash 端到端快 40%。
Gemini 3.1 Pro 現在還值得用嗎?
只有在你確實需要它的推理上限,並能接受知識截止於 2025 年 1 月、仍處於 Preview 階段的模型時才值得。若任務難度未達這個層級,公開數據沒有顯示多花的費用能換來比 Flash 更好的輸出。
