Gemini 3.6 Flash vs 3.1 Pro:價格、速度與結論

最近更新: 2026-07-23 09:49:50

Pro 型號通常才是贏家,但這次不是。Gemini 3.6 Flash不只比 Gemini 3.1 Pro 便宜,生成速度更超過兩倍,幾乎所有程式設計與代理型基準測試也都領先。較早推出的 3.1 Pro 只在一個領域守住優勢:難度最高的純推理測試。我以完全相同的任務實測兩款模型,並在 2026 年 7 月 23 日依 Google 文件與 Artificial Analysis 再次核對以下所有價格與規格。

30 秒看懂該選哪一款

Gemini 3.6 Flash

Gemini 3.1 Pro

勝出者

API 價格(每 100 萬 token,≤200k;輸入/輸出)

$1.50 / $7.50

$2.00 / $12.00

Flash

長提示詞(>200k tokens)

價格維持不變

$4.00 / $18.00

Flash

輸出速度

261 tokens/s

112 tokens/s

Flash

程式設計與代理型基準

4 項正面比較全勝

Flash

最高難度推理(GPQA、HLE)

領先 1.3–6.4 分

3.1 Pro

知識截止日期

2026 年 3 月

2025 年 1 月

Flash

發布狀態

正式推出

自 2026 年 2 月起為預覽版

Flash

如果只想知道結論:預設就選 Gemini 3.6 Flash;只有任務需要最高推理上限時,才考慮 3.1 Pro。你也可以直接在瀏覽器聊天介面,用自己的提示詞讓Gemini 3.6 FlashGemini 3.1 Pro正面較量,不需要 API key。以下則是完整證據,包括一套可自行重現的三項任務測試。

價格差距有多大?

Gemini 3.6 Flash 不論提示詞長度都採單一費率;Gemini 3.1 Pro 不只較貴,超長提示詞還會進入另一個計價級距。以下是每 100 萬 tokens 的標準 API 定價,於 2026 年 7 月 23 日核實:

Gemini 3.6 Flash

Gemini 3.1 Pro

輸入(≤200k)

$1.50

$2.00

輸出(≤200k)

$7.50

$12.00

輸入(>200k)

$1.50

$4.00

輸出(>200k)

$7.50

$18.00

Context cache 讀取(≤200k)

$0.15

$0.20

Batch(輸入/輸出,≤200k)

$0.75 / $3.75

$1.00 / $6.00

真正有感的是輸出費用:短提示詞下,3.1 Pro 每個輸出 token 的成本高出 60%;提示詞跨過 200k tokens 後,最高更會貴 140%。

折扣方案也沒有改變這個差距。Batch mode 對兩款模型都是半價,因此 Pro 在這裡依然貴 60%。除了依 token 計價的讀取費,cache 儲存還按小時計費:Pro 每 100 萬 tokens 每小時為 $4.50,Flash 則是 $1.00。以 Google 公開牌價來看,無論標準、Batch、Priority 或快取模式,Pro 都不會成為較便宜的選項。

相同三道題目,兩款模型實測

價格表是假設兩者使用相同 token 數量,因此我在 2026 年 7 月 22 日透過 OpenRouter,以 temperature 0 對兩款模型各跑一次完全相同的三組提示詞。使用的 model ID 分別是 google/gemini-3.6-flashgoogle/gemini-3.1-pro-preview

1. 程式設計:撰寫 Python merge_intervals 函式,附上 docstring 與使用範例 2. 推理:一道需要時間與速度代數計算的雙列車追及文字題 3. 擷取:從雜亂的團隊訊息中找出待辦事項,輸出為 JSON 陣列

任務

Flash 延遲

Pro 延遲

Flash 成本

Pro 成本

程式設計

2.4s

4.5s

$0.0085

$0.0102

推理

1.9s

2.4s

$0.0082

$0.0118

擷取

1.3s

2.6s

$0.0049

$0.0057

合計

5.65s

9.48s

$0.0215

$0.0277

*合計數字根據原始毫秒與 token 紀錄計算;各任務列已四捨五入,因此自行加總某欄時可能會差 0.01。*

兩款模型三題全對:區間合併正確、追及時間算對,JSON 也很乾淨。差別只在於完成這些答案所付出的成本。

Flash 產生的 token 反而比 Pro 更多(OpenRouter usage metadata 顯示為 2,843 對 2,285,兩者多數都是內部推理 token),但端到端仍便宜 22%,快 40%。Pro 較高的輸出單價與較慢的生成速度,抵銷了它回答較精簡的優勢。若用在代理型迴圈,每一步都要承擔一次延遲,這個差距會持續累積。

比較 Gemini 3.6 Flash 與 3.1 Pro 每項任務成本和延遲的長條圖,以 3.1 Pro 為 100;Flash 的成本為 78、延遲為 60

三組簡短提示詞只是抽查,不能當成基準測試,這些精確百分比應視為示意。不過整體方向和大規模測量結果一致,接下來就來看這些數據。

程式設計與代理型基準:Flash 全面勝出

從公開的正面比較數據來看(Artificial Analysis),3.6 Flash 在程式設計、ML engineering 與終端機使用上全面超越較早的 3.1 Pro:

基準測試

Gemini 3.1 Pro

Gemini 3.6 Flash

DeepSWE v1.1

12%

49%

MLE-Bench

42.6%

63.9%

SWE-Bench Pro

54.2%

58.7%

Terminal-Bench 2.1

73.8%

78.0%

程式設計與代理型基準的分組長條圖,Gemini 3.6 Flash 在 DeepSWE、MLE-Bench、SWE-Bench Pro 與 Terminal-Bench 2.1 均領先 3.1 Pro

其中 DeepSWE 的差距最大,為 49% 對 12%。Flash 在多模態推理同樣小幅勝過 Pro(MMMU-Pro 為 83.2% 對 82.4%),綜合指標 Artificial Analysis Intelligence Index 也以 50 對 46 取勝。

速度表現也是同樣趨勢。截至 2026 年 7 月 23 日,Artificial Analysis 測得 Flash 為每秒 261 tokens,3.1 Pro 則是 112 tokens,前者快 2.3 倍;標準工作負載下,首 token 時間分別為 12.8s 與 31.2s。這項首 token 指標包含模型在開始回答前的思考時間,因此我上面的短任務會更快結束。若放到完整排行榜來看,Flash 同時在三個維度都接近頂尖水準:

Artificial Analysis 排行榜圖表,標示 Gemini 3.6 Flash:Intelligence Index 50、輸出速度每秒 261 tokens,以及每項任務加權成本 $0.50

長上下文有一個值得釐清的細節。兩款模型都支援 100 萬 token 輸入,但在極長內容中,Flash 尋找資訊的能力明顯更好(100 萬 tokens 下的 MRCR retrieval:54% 對低於 27%);Pro 則在長輸入內容上的推理略勝一籌,下一節會說明。

Gemini 3.1 Pro 仍有優勢的地方

公平來看這款旗艦模型,3.1 Pro 在三項基準中領先,而且全都是高難度的知識與推理測試。

基準測試

Gemini 3.1 Pro

Gemini 3.6 Flash

GPQA Diamond(博士級科學)

94.1%

92.8%

Humanity's Last Exam(無工具)

44.7%

38.3%

AA-LCR(長上下文推理)

72.7%

69.7%

GPQA 和長上下文推理的差距不大,Humanity's Last Exam 的差距則較明顯。Google 在其對 3.1 Pro 的定位正是:「需要廣泛世界知識,以及跨多模態進行進階推理的複雜任務。」若你的工作正處在這個前沿場景,例如研究等級的科學問題、針對長文件的多步推理,它確實有更高上限,也值得多付這筆錢。

但實務上還有兩點不利因素:

  • 知識較舊。Pro 的知識截止於 2025 年 1 月,比 Flash 的 2026 年 3 月早了十四個月;這款旗艦反而比平價模型更不了解當前世界。

  • 仍屬預覽版。自 2026 年 2 月推出至今五個月,3.1 Pro 在 Google 定價頁面仍標示為 Preview,model ID 也正是 gemini-3.1-pro-preview;Flash 則已作為目前的穩定預設版本推出。

不同工作負載該怎麼選

  • 選 Gemini 3.6 Flash:適合 coding agent、終端機與電腦操作自動化、ML engineering 任務、高量擷取或分類、對延遲敏感的應用,以及長文件檢索。從已公開數據來看,它在這些項目都更便宜、更快、知識更新,分數也更高。

  • 選 Gemini 3.1 Pro:任務屬於前沿推理,例如博士級科學問題或長輸入上的多步分析,而且幾個基準分數的差異比成本、速度或知識新鮮度都重要時,才值得選它。也要預留 Preview 階段的變動空間:預覽模型的 ID 在穩定版推出時可能更名或停用。

這份比較仍無法替你判定兩件事:模型在你特定 tool-calling 模式下的可靠性,以及你的領域邊緣案例中,哪一款輸出品質更好。

兩者都透過同一個 Gemini API 提供服務,因此最省錢的判斷方式,就是拿你最常用的十組提示詞,各自跑過一次。我上面的三項任務腳本,大約一分鐘就能完成。

如何使用兩款模型

兩款模型都可在 Gemini API 和 Google AI Studio 使用,model ID 分別為 gemini-3.6-flashgemini-3.1-pro-preview。AI Studio 的免費級距已足以讓你在正式投入前並排測試兩者。

如果你本來就透過聚合平台串接,OpenRouterAIReiter 都以 Google 的牌價,透過單一 key 提供這兩款模型;我上面的 A/B 測試就是這樣跑的。

常見問題

Gemini 3.6 Flash 比 3.1 Pro 更好嗎?

對多數正式環境的工作來說,是的。它在程式設計、代理型任務、ML、電腦操作與多模態基準都勝出,成本更低、速度也快 2.3 倍。3.1 Pro 只在 GPQA Diamond、Humanity's Last Exam 與長上下文推理保持領先,差距為 1.3 到 6.4 分。

Gemini 3.6 Flash 比 3.1 Pro 便宜嗎?

是的,所有模式都是如此。標準 API 的輸出價格為每 100 萬 tokens $7.50 對 $12.00;提示詞超過 200k tokens 後,差距擴大為 $7.50 對 $18.00。Batch mode 下,Pro 也維持高出 60% 的溢價。Pro 的快取儲存費更是 4.5 倍。

Gemini 3.6 Flash 和 3.1 Pro,哪個比較快?

Flash 輸出速度約為每秒 261 tokens,3.1 Pro 為 112 tokens(Artificial Analysis,2026 年 7 月 23 日),而且開始回答也更快:推理密集工作負載的首 token 時間為 12.8s 對 31.2s。我三項任務的實測結果,則是 Flash 端到端快 40%。

Gemini 3.1 Pro 現在還值得用嗎?

只有在你確實需要它的推理上限,並能接受知識截止於 2025 年 1 月、仍處於 Preview 階段的模型時才值得。若任務難度未達這個層級,公開數據沒有顯示多花的費用能換來比 Flash 更好的輸出。

延伸閱讀