Gemini 3.5 Flash 的每秒輸出 tokens 數量是 Gemini 3.1 Pro 的 2.6 倍,每個 token 的成本低 25%,而且在 Artificial Analysis 的 Intelligence Index 上也略勝 Pro(50 對 46)。Gemini 3.1 Pro 在 ARC-AGI-2 仍以 5 分領先(77.1% 對 72.1%),而當你超過 128k tokens 後,Flash 在長上下文檢索上的分數會從 84.9% 降到 77.3%。要使用哪個模型取決於任務:Flash 針對吞吐量與工具呼叫延遲做最佳化,Pro 針對多步推理深度做最佳化,而整體基準測試則把這兩個優先事項平均成單一分數,掩蓋了你的工作負載實際需要的是哪一個。
基準測試記分卡:各模型實際領先之處
| 指標 | Gemini 3.5 Flash | Gemini 3.1 Pro | 勝出者 |
|---|---|---|---|
| Intelligence Index (Artificial Analysis) | 50 | 46 | Flash |
| ARC-AGI-2, abstract reasoning (BenchLM) | 72.1% | 77.1% | Pro |
| MRCR v2 at 128k context (nxcode) | 77.3%(在較短上下文時為 84.9%) | 未以相同長度公開報告 | 資料不足 |
| Multimodal average score (BenchLM) | 83.8 | 82.6 | Flash |
| Output speed (BenchLM) | 284.2 tok/s | 109 tok/s | Flash (2.6x) |
| GDPval-AA Elo, real-world agent tasks (apiyi) | 1656 | 1314 | Flash |
Flash 在衡量吞吐量與通用任務處理的指標上勝出。Pro 在 ARC-AGI-2 的推理深度方面有明確且有文件記載的領先;在長上下文檢索方面,Flash 在超過 128k tokens 後有文件記載的退化,但 Pro 的對應分數未公開,因此這一項應判定為無定論,而不是 Pro 勝出。這種分野直接對應到你正在執行的任務類型,這比單一的整體 Intelligence Index 數字更有用。
來自 BenchLM 自身比較的一項方法論注意事項:在約 34 個兩種模型都有公開結果的基準中,只有 3 個類別可直接比較——Pro 在 14 個基準上有獨占結果,Flash 在 17 個基準上有獨占結果,而且兩者的 thinking-budget 設定也不一定完全一致。請將上方表格視為方向上可靠;ARC-AGI-2 和 MRCR v2 的差距大到足以信賴,但在共享指標上 1-2 分的差異,不應被解讀為 निर्ण定性結論。
Flash 的領先優勢在哪裡出現破綻
ARC-AGI-2 的差距(5 分)是 BenchLM 的比較在兩個模型之間發現的最大單一類別差異。ARC-AGI-2 是專門設計來抵抗模式比對捷徑的,因此那裡的 5 分差距,比起在更傳統的基準測試上出現類似差距,更能反映推理深度。nxcode 的 MRCR v2 結果又提供了第二個同方向的數據點:當上下文長度增加到接近 128k tokens 時,Flash 自身的檢索準確率從 84.9% 降到 77.3%。Pro 在相同長度下的分數沒有公開報告,因此這不是一項已記錄的 Pro 直接對比失利——但這確實是 Flash 的一項已記錄回退,而 Pro 的基準表格並未顯示這一點。
軼聞筆記,非基準測試證據:一則 Reddit r/GeminiAI 討論串詢問使用者在困難任務中更偏好哪個模型,留言者形容 Flash 在「除了長上下文、抽象 [推理] 之外的所有方面」都勝過 Pro。這只是少數人的意見,並非資料——但它剛好描述了基準測試所顯示的那兩個例外,這只能算是稍微有用的合理性檢查,而不是任何事情的證明。
定價與快取:真實成本圖景
基礎定價讓價格優勢比乍看之下更為縮小:
- Gemini 3.5 Flash:$1.50 / million input tokens,$9 / million output tokens
- Gemini 3.1 Pro:$2 / million input tokens,$12 / million output tokens
那在紙面上是 25% 的折扣,而不是 Flash 先前相對於較舊 Pro 模型所擁有的 4-8 倍差距。更大的槓桿是快取:
- Flash cache 寫入是免費的;已快取輸入成本為 $0.15/百萬 tokens
- Pro cache 寫入成本為$0.38/百萬 tokens;已快取輸入成本為 $0.50/百萬 tokens — 超過 Flash 的已快取輸入費率 3 倍以上
對於任何會在多個回合中重複傳送相同系統提示或文件上下文的工作流程——聊天代理、具備持久程式碼庫上下文的程式設計助理、多輪支援機器人——這種快取落差會迅速累積。單次請求幾乎看不出差異;但一個千回合的代理工作階段就能看出來。
這個差距也不是固定的。apiyi 的定價分析指出,當上下文超過大約 20 萬個 token 後,兩個模型之間的價格差距會收斂到 25-50%,因為在這個規模下,兩者每個 token 的經濟性趨於一致。如果你的工作負載主要是非常長的單次文件,而不是多次重複的短請求,那麼支持 Flash 的定價理由就會變弱。
具體範例:一個支援機器人工作流程,每天傳送 1M 快取輸入 tokens 並產生 500K 輸出 tokens。在 Flash 上,快取寫入費用為 $0,加上 $0.15 x 1(快取輸入)+ $9 x 0.5(輸出)= $4.65/天。在 Pro 上,相同工作負載的費用為 $0.38(快取寫入,一次性)+ $0.50 x 1(快取輸入)+ $12 x 0.5(輸出)= 第一天約 $6.88/天,在第一次寫入後則降為 $6.50/天。以一個月來看,這大約是 $140 與 $195 之間的差異——尚未計入 Pro 在任何真正需要時所提供的更深層推理。
Agent 迴圈:為什麼 Flash 在速度上勝出,但不一定在可靠性上
nxcode 的 agent-loop 基準測試執行了一個 8 步的 agent loop,結果顯示 Flash 完成整個序列大約只需 25 秒,而 Pro 則需要 100 秒——這是 4 倍的差距,且每增加一步都會進一步擴大。在 GDPval-AA 上,這是一個以真實世界知識工作 agent 任務為核心建立的基準測試,Flash 的 Elo 分數(1656)比 Pro(1314)高出 342 分,這是整個基準表中單一最大的差距。
但有一個注意事項:這種速度與分數優勢,是建立在 agent loop 能順利運作的前提上。ARC-AGI-2 和 MRCR v2 中在推理與長上下文任務裡出現的相同差距,可以合理推論出:當某個 tool call 在 loop 中途回傳了意料之外的結果,而 agent 必須重新規劃時,Flash 也會比較不寬容——這是根據上面的推理深度資料所做的推論,而不是另外經過基準測試的主張。如果你的 agent 是在監督下執行、每一步之間都有人工檢查輸出,那麼 Flash 的速度幾乎就是白拿的優勢。如果它在沒有人工介入的情況下,連續執行許多步,那在有人公布兩者的失敗率資料之前,Pro 的推理餘裕會是更安全的選擇。
您應該使用哪一種:基於任務的決策矩陣
| 任務類型 | 建議模型 | 原因 |
|---|---|---|
| 日常程式設計(測試、PR 審查、跨語言翻譯) | Flash | 速度與成本更有優勢,推理深度不是瓶頸 |
| 深度重構、全新演算法設計 | Pro | ARC-AGI-2 的差距會直接體現在多步驟邏輯推理上 |
| 長文件檢索(合約、超過 128k tokens 的研究語料) | Pro | Flash 在這個長度上有已記錄的 MRCR v2 退化;Pro 的尚未公開,但較安全的預設是選擇沒有已知弱點的模型 |
| 高量批次生成 | Flash | 免費快取寫入與 2.6x 吞吐量在大規模下最重要 |
| 有人類檢查輸出的監督式 agent 工作流程 | Flash | 有速度優勢,且沒有非監督式可靠性風險 |
| 非監督式、高風險的 agent 鏈 | Pro | 在沒有人工於迴圈中途捕捉錯誤時,推理深度優勢是更安全的選擇 |
| 頻繁的多輪呼叫,重複使用相同上下文 | Flash | 快取輸入定價大約只有 Pro 的三分之一 |
一條簡單的預設規則就足以涵蓋上方大多數情況:將請求送到 Flash,除非以下三種條件之一成立——上下文超過 128k tokens 且檢索準確度很重要、任務屬於抽象/多步推理(新穎演算法、法律或研究整合),或代理在無監督情況下運行超過少數幾個步驟。只要這三種情況中的任何一種出現,就傾向選擇 Pro;若都不存在,Flash 的速度與快取定價使它成為較便宜的預設選擇。
常見問題
Gemini 3.5 Flash 比 3.1 Pro 更好嗎?
在速度、成本與通用基準測試上,是的。在抽象推理(ARC-AGI-2)方面,Gemini 3.1 Pro 仍然領先 5 分。在超過 128k tokens 的長上下文檢索方面,Flash 有已記錄的退化,而 Pro 的對應分數尚未公布,因此請將該比較視為尚未定論,而不是已確認的 Pro 勝出。哪一個「更好」取決於你的任務屬於上述哪一類。
Gemini 3.5 Flash 比 3.1 Pro 便宜多少?
在基礎輸入/輸出定價上便宜約 25%(每百萬 tokens $1.50/$9,相較於 $2/$12)。更大的節省體現在快取上:Flash 的快取寫入免費,而且快取輸入的費用大約只有 Pro 的三分之一,這對多輪或高流量工作負載最為重要。
Gemini 3.5 Flash 適合寫程式嗎?
是的,適合日常工作——測試生成、PR 審查、在不同語言之間轉譯程式碼。對於深度重構或新穎的演算法設計,Pro 在抽象推理基準上的優勢通常會反映在輸出品質上。
Gemini 3.5 Flash 是否能很好地處理長上下文?
在較短的上下文長度下,可以——MRCR v2 的檢索準確率維持在 84.9%。超過 128k tokens 後會降至 77.3%,對於多文件合約審閱這類任務來說,這是一個明顯的差距。Gemini 3.1 Pro 在相同長度下的分數尚未公布,因此應將這視為已知的 Flash 限制,而非已確認的 Pro 優勢。
結論
Gemini 3.5 Flash 是大多數日常與高流量工作更好的預設選擇——它更快、在 cache 上更便宜,而且在一般基準測試中的表現已經足夠接近,以至於這種取捨很少真正重要。Gemini 3.1 Pro 則在抽象推理與無監督 agent chains 上證明了它較高的成本是值得的;對於超過 128k tokens 的長文件,Flash 自己的數據顯示出一個弱點,而 Pro 的數據既沒有證實也沒有排除這一點,所以在正式採用任何一方之前,最好先自行測試這一項。
這份比較是根據公開基準資料(Artificial Analysis、BenchLM、nxcode 和 apiyi)建立的,而非第一手 API 測試。Gemini 3.1 Pro 上線時採用的是以推理為重點、不同於 Flash 速度導向的定位。撰寫本文時,Gemini 3.5 Pro 尚未推出——報導指出其將於 2026 年 7 月發布——因此請將此視為一個快照;待 Pro 的下一個版本推出後,這兩個模型以及這份比較都需要再重新檢視。
