这次,Pro 并不是默认更优的选择。 Gemini 3.6 Flash 不仅比 Gemini 3.1 Pro 便宜,生成速度还超过后者两倍,并且在几乎所有编程与智能体基准测试中取胜。较早推出的 3.1 Pro 只守住了一项优势:在最难的纯推理测试中略胜一筹。我用完全相同的任务测试了两款模型,并在 2026 年 7 月 23 日依据 Google 文档和 Artificial Analysis 再次核对了下文全部价格与规格。
30 秒看完结论
Gemini 3.6 Flash | Gemini 3.1 Pro | 胜出者 | |
|---|---|---|---|
API 价格(每 100 万 token 输入/输出,≤200k) | $1.50 / $7.50 | $2.00 / $12.00 | Flash |
长提示词(>200k tokens) | 价格保持不变 | $4.00 / $18.00 | Flash |
输出速度 | 261 tokens/s | 112 tokens/s | Flash |
编程与智能体基准 | 4 项正面对比全部胜出 | — | Flash |
最高难度推理(GPQA、HLE) | — | 领先 1.3–6.4 分 | 3.1 Pro |
知识截止日期 | 2026 年 3 月 | 2025 年 1 月 | Flash |
发布状态 | 正式可用 | 自 2026 年 2 月起处于预览阶段 | Flash |
如果只看结论:默认选 Gemini 3.6 Flash;只有任务确实需要最高推理上限时,再考虑 3.1 Pro。不想继续读,也可以直接在浏览器聊天中让 Gemini 3.6 Flash 和 Gemini 3.1 Pro 用你自己的提示词正面对比,无需 API Key。下文给出判断依据,也包含一套可复现的三任务测试。
价格差距有多大
Gemini 3.6 Flash 无论提示词长度如何都采用固定价格;Gemini 3.1 Pro 不仅更贵,还额外设置了长提示词价格档位。以下为每 100 万 tokens 的标准 API 定价,核对日期为 2026 年 7 月 23 日:
Gemini 3.6 Flash | Gemini 3.1 Pro | |
|---|---|---|
输入(≤200k) | $1.50 | $2.00 |
输出(≤200k) | $7.50 | $12.00 |
输入(>200k) | $1.50 | $4.00 |
输出(>200k) | $7.50 | $18.00 |
上下文缓存读取(≤200k) | $0.15 | $0.20 |
Batch(输入/输出,≤200k) | $0.75 / $3.75 | $1.00 / $6.00 |
真正容易感知到差异的是输出成本:短提示词下,3.1 Pro 的每 token 输出价格高出 60%;提示词超过 200k tokens 后,溢价最高达到 140%。
即便使用折扣模式,差距也还在。Batch 模式会将两款模型的费率都减半,因此 Pro 依然贵 60%。此外,缓存*存储*按小时收费,在按 token 的读取费用之外另计:Pro 为每 100 万 tokens 每小时 $4.50,Flash 则是 $1.00。按 Google 公布的标价计算,无论是标准、Batch、Priority 还是缓存模式,Pro 都不会成为更便宜的选项。
相同三道任务的实测
价格表默认两款模型消耗相同的 token。为了排除这一假设,我在 2026 年 7 月 22 日通过 OpenRouter,分别使用模型 ID google/gemini-3.6-flash 和 google/gemini-3.1-pro-preview,以 temperature 0 向两者发送了完全相同的三组提示词,每组各运行一次:
1. 代码:编写一个 Python merge_intervals 函数,包含文档字符串和使用示例。2. 推理:解决一道需要使用时间与速度代数的双列车追及应用题。3. 提取:从一段杂乱的团队消息中提取待办事项,并输出 JSON 数组。
任务 | Flash 延迟 | Pro 延迟 | Flash 成本 | Pro 成本 |
|---|---|---|---|---|
代码 | 2.4s | 4.5s | $0.0085 | $0.0102 |
推理 | 1.9s | 2.4s | $0.0082 | $0.0118 |
提取 | 1.3s | 2.6s | $0.0049 | $0.0057 |
合计 | 5.65s | 9.48s | $0.0215 | $0.0277 |
*总计由原始毫秒级和 token 日志计算得出;各任务行进行了四舍五入,因此按列相加可能相差 0.01。*
两款模型都正确完成了三项任务:区间合并无误、追及时间正确、JSON 输出干净规范。区别只在于,得到这些答案的成本不同。
Flash 生成的 token *反而更多*:OpenRouter 的用量元数据显示为 2,843 对 2,285,两边大部分都是内部推理 token;但它最终仍然便宜 22%,端到端速度快 40%。Pro 更高的输出单价和更慢的生成速度,抵消了它回答更简短的优势。对于智能体循环这类每一步都要重新承担延迟的场景,差距还会进一步累积。

三条小提示词只能算抽样检查,不是基准测试,具体百分比应仅作示意参考。但结果方向与更大规模测量一致,接下来就看这些数据。
编程与智能体基准:Flash 全胜
从公开的正面对比数据来看(Artificial Analysis),3.6 Flash 在编程、机器学习工程和终端操作任务上全面超过较早的 3.1 Pro:
基准测试 | Gemini 3.1 Pro | Gemini 3.6 Flash |
|---|---|---|
DeepSWE v1.1 | 12% | 49% |
MLE-Bench | 42.6% | 63.9% |
SWE-Bench Pro | 54.2% | 58.7% |
Terminal-Bench 2.1 | 73.8% | 78.0% |

差距最大的是 DeepSWE,Flash 为 49%,Pro 仅为 12%。Flash 在多模态推理上也略高于 Pro,MMMU-Pro 得分为 83.2% 对 82.4%;在 Artificial Analysis Intelligence Index 综合指数中同样领先,得分为 50 对 46。
速度表现也呈现相同趋势。截至 2026 年 7 月 23 日,Artificial Analysis 测得 Flash 的输出速度为 261 tokens/second,3.1 Pro 为 112,也就是 2.3 倍;在其标准工作负载下,首 token 时间分别为 12.8s 和 31.2s。首 token 数据包含了两款模型正式开始回答前的思考时间,因此我上面的短任务能更快结束。放到完整排行榜中看,Flash 同时跻身三项指标的前列:

长上下文方面有一点需要区分清楚。两款模型都支持 100 万 token 输入,但在极限长度下,Flash 的*检索定位*能力明显更强:100 万 tokens 的 MRCR 检索得分为 54%,而 Pro 不足 27%;不过 Pro 在*基于长输入进行推理*时略胜一筹,下一节会具体说明。
Gemini 3.1 Pro 仍有优势的场景
客观来说,作为旗舰模型的 3.1 Pro 仍在三项基准上领先,而且都是高难度知识与推理测试。
基准测试 | Gemini 3.1 Pro | Gemini 3.6 Flash |
|---|---|---|
GPQA Diamond(博士级科学题) | 94.1% | 92.8% |
Humanity's Last Exam(无工具) | 44.7% | 38.3% |
AA-LCR(长上下文推理) | 72.7% | 69.7% |
在 GPQA 和长上下文推理上,差距不大;Humanity's Last Exam 上的领先幅度则更明显。Google 对 3.1 Pro 的定位正是如此:“需要广泛世界知识,以及跨模态高级推理能力的复杂任务。”如果你的工作负载正处于这一前沿区间,例如研究级科学问题,或围绕长文档展开的多步骤推理,那么这部分能力余量确实存在,也值得为之付费。
不过,实际使用中还有两点不利因素:
知识更新较旧。Pro 的知识截止日期是 2025 年 1 月,比 Flash 的 2026 年 3 月早了十四个月。换句话说,这款旗舰模型对当下世界的了解反而少于预算型模型。
仍处预览阶段。自 2026 年 2 月发布至今五个月后,3.1 Pro 在 Google 定价页上仍标注为 Preview,模型 ID 本身也是
gemini-3.1-pro-preview;Flash 则作为当前稳定默认模型提供。
不同任务该怎么选
优先选 Gemini 3.6 Flash:适合编程智能体、终端和计算机操作自动化、机器学习工程任务、大规模信息提取或分类、对延迟敏感的应用,以及长文档检索。按公开数据,它在这些方面都更便宜、更快、知识更新,也有更高得分。
在特定情况下选 Gemini 3.1 Pro:当任务属于前沿推理,例如博士级科学问题、针对长输入的多步骤分析,并且几个基准分的差异比成本、速度和知识新鲜度更重要时。也要预留应对 Preview 阶段变化的空间:预览版模型 ID 可能在稳定版上线时被改名或下线。
这项对比无法替你确定两件事:模型在你特定工具调用模式下的可靠性,以及它在你所在领域边缘案例上的输出质量。
两款模型均通过同一套 Gemini API 提供服务,因此最省钱的判定方式,就是将你最常用的十条提示词分别跑一遍。我上面的三任务脚本运行大约只需一分钟。
如何使用两款模型
两款模型都可通过 Gemini API 和 Google AI Studio 使用,对应模型 ID 为 gemini-3.6-flash 与 gemini-3.1-pro-preview。在正式投入前,AI Studio 的免费层级已经足够让你并排测试两者。
如果你已经在使用模型聚合平台,OpenRouter 和 AIReiter 都能通过一个 Key 按 Google 标价提供这两款模型——我上面的 A/B 测试就是这样完成的。
常见问题
Gemini 3.6 Flash 比 3.1 Pro 更好吗?
对大多数生产环境任务来说,是的。它在编程、智能体、机器学习、计算机操作和多模态基准上取胜,成本更低,运行速度也快 2.3 倍。3.1 Pro 仅在 GPQA Diamond、Humanity's Last Exam 和长上下文推理上保持领先,领先幅度为 1.3 到 6.4 分。
Gemini 3.6 Flash 比 3.1 Pro 便宜吗?
是的,所有模式下都是如此。标准 API 的输出价格为每 100 万 tokens $7.50 对 $12.00;提示词超过 200k tokens 后,差距扩大为 $7.50 对 $18.00;Batch 模式下 Pro 仍保有同样的 60% 溢价。Pro 的缓存存储成本则高出 4.5 倍。
Gemini 3.6 Flash 和 3.1 Pro 哪个更快?
Flash 的生成速度约为 261 tokens/second,3.1 Pro 为 112 tokens/second(Artificial Analysis,2026 年 7 月 23 日),而且它更早开始输出:在推理密集型工作负载中,首 token 时间为 12.8s 对 31.2s。我的三任务测试中,这最终体现为端到端速度快 40%。
Gemini 3.1 Pro 还值得用吗?
只有在你确实需要它的推理上限,并能够接受一款知识截止于 2025 年 1 月、仍处 Preview 阶段的模型时才值得考虑。对于难度低于这一档位的任务,公开数据没有显示额外成本能换来比 Flash 更好的输出。
