Gemini 3.6 Flash vs 3.1 Pro:价格、速度与选型结论

最后更新: 2026-07-23 09:47:53

这次,Pro 并不是默认更优的选择。 Gemini 3.6 Flash 不仅比 Gemini 3.1 Pro 便宜,生成速度还超过后者两倍,并且在几乎所有编程与智能体基准测试中取胜。较早推出的 3.1 Pro 只守住了一项优势:在最难的纯推理测试中略胜一筹。我用完全相同的任务测试了两款模型,并在 2026 年 7 月 23 日依据 Google 文档和 Artificial Analysis 再次核对了下文全部价格与规格。

30 秒看完结论

Gemini 3.6 Flash

Gemini 3.1 Pro

胜出者

API 价格(每 100 万 token 输入/输出,≤200k)

$1.50 / $7.50

$2.00 / $12.00

Flash

长提示词(>200k tokens)

价格保持不变

$4.00 / $18.00

Flash

输出速度

261 tokens/s

112 tokens/s

Flash

编程与智能体基准

4 项正面对比全部胜出

Flash

最高难度推理(GPQA、HLE)

领先 1.3–6.4 分

3.1 Pro

知识截止日期

2026 年 3 月

2025 年 1 月

Flash

发布状态

正式可用

自 2026 年 2 月起处于预览阶段

Flash

如果只看结论:默认选 Gemini 3.6 Flash;只有任务确实需要最高推理上限时,再考虑 3.1 Pro。不想继续读,也可以直接在浏览器聊天中让 Gemini 3.6 Flash 和 Gemini 3.1 Pro 用你自己的提示词正面对比,无需 API Key。下文给出判断依据,也包含一套可复现的三任务测试。

价格差距有多大

Gemini 3.6 Flash 无论提示词长度如何都采用固定价格;Gemini 3.1 Pro 不仅更贵,还额外设置了长提示词价格档位。以下为每 100 万 tokens 的标准 API 定价,核对日期为 2026 年 7 月 23 日:

Gemini 3.6 Flash

Gemini 3.1 Pro

输入(≤200k)

$1.50

$2.00

输出(≤200k)

$7.50

$12.00

输入(>200k)

$1.50

$4.00

输出(>200k)

$7.50

$18.00

上下文缓存读取(≤200k)

$0.15

$0.20

Batch(输入/输出,≤200k)

$0.75 / $3.75

$1.00 / $6.00

真正容易感知到差异的是输出成本:短提示词下,3.1 Pro 的每 token 输出价格高出 60%;提示词超过 200k tokens 后,溢价最高达到 140%。

即便使用折扣模式,差距也还在。Batch 模式会将两款模型的费率都减半,因此 Pro 依然贵 60%。此外,缓存*存储*按小时收费,在按 token 的读取费用之外另计:Pro 为每 100 万 tokens 每小时 $4.50,Flash 则是 $1.00。按 Google 公布的标价计算,无论是标准、Batch、Priority 还是缓存模式,Pro 都不会成为更便宜的选项。

相同三道任务的实测

价格表默认两款模型消耗相同的 token。为了排除这一假设,我在 2026 年 7 月 22 日通过 OpenRouter,分别使用模型 ID google/gemini-3.6-flashgoogle/gemini-3.1-pro-preview,以 temperature 0 向两者发送了完全相同的三组提示词,每组各运行一次:

1. 代码:编写一个 Python merge_intervals 函数,包含文档字符串和使用示例。2. 推理:解决一道需要使用时间与速度代数的双列车追及应用题。3. 提取:从一段杂乱的团队消息中提取待办事项,并输出 JSON 数组。

任务

Flash 延迟

Pro 延迟

Flash 成本

Pro 成本

代码

2.4s

4.5s

$0.0085

$0.0102

推理

1.9s

2.4s

$0.0082

$0.0118

提取

1.3s

2.6s

$0.0049

$0.0057

合计

5.65s

9.48s

$0.0215

$0.0277

*总计由原始毫秒级和 token 日志计算得出;各任务行进行了四舍五入,因此按列相加可能相差 0.01。*

两款模型都正确完成了三项任务:区间合并无误、追及时间正确、JSON 输出干净规范。区别只在于,得到这些答案的成本不同。

Flash 生成的 token *反而更多*:OpenRouter 的用量元数据显示为 2,843 对 2,285,两边大部分都是内部推理 token;但它最终仍然便宜 22%,端到端速度快 40%。Pro 更高的输出单价和更慢的生成速度,抵消了它回答更简短的优势。对于智能体循环这类每一步都要重新承担延迟的场景,差距还会进一步累积。

对比 Gemini 3.6 Flash 与 3.1 Pro 单任务成本和延迟的柱状图,以 3.1 Pro 为 100;Flash 的成本为 78,延迟为 60

三条小提示词只能算抽样检查,不是基准测试,具体百分比应仅作示意参考。但结果方向与更大规模测量一致,接下来就看这些数据。

编程与智能体基准:Flash 全胜

从公开的正面对比数据来看(Artificial Analysis),3.6 Flash 在编程、机器学习工程和终端操作任务上全面超过较早的 3.1 Pro:

基准测试

Gemini 3.1 Pro

Gemini 3.6 Flash

DeepSWE v1.1

12%

49%

MLE-Bench

42.6%

63.9%

SWE-Bench Pro

54.2%

58.7%

Terminal-Bench 2.1

73.8%

78.0%

编程和智能体基准分组柱状图,Gemini 3.6 Flash 在 DeepSWE、MLE-Bench、SWE-Bench Pro 和 Terminal-Bench 2.1 中均领先 3.1 Pro

差距最大的是 DeepSWE,Flash 为 49%,Pro 仅为 12%。Flash 在多模态推理上也略高于 Pro,MMMU-Pro 得分为 83.2% 对 82.4%;在 Artificial Analysis Intelligence Index 综合指数中同样领先,得分为 50 对 46。

速度表现也呈现相同趋势。截至 2026 年 7 月 23 日,Artificial Analysis 测得 Flash 的输出速度为 261 tokens/second,3.1 Pro 为 112,也就是 2.3 倍;在其标准工作负载下,首 token 时间分别为 12.8s 和 31.2s。首 token 数据包含了两款模型正式开始回答前的思考时间,因此我上面的短任务能更快结束。放到完整排行榜中看,Flash 同时跻身三项指标的前列:

Artificial Analysis 排行榜图表,突出显示 Gemini 3.6 Flash:Intelligence Index 为 50,输出速度为每秒 261 tokens,每任务加权成本为 $0.50

长上下文方面有一点需要区分清楚。两款模型都支持 100 万 token 输入,但在极限长度下,Flash 的*检索定位*能力明显更强:100 万 tokens 的 MRCR 检索得分为 54%,而 Pro 不足 27%;不过 Pro 在*基于长输入进行推理*时略胜一筹,下一节会具体说明。

Gemini 3.1 Pro 仍有优势的场景

客观来说,作为旗舰模型的 3.1 Pro 仍在三项基准上领先,而且都是高难度知识与推理测试。

基准测试

Gemini 3.1 Pro

Gemini 3.6 Flash

GPQA Diamond(博士级科学题)

94.1%

92.8%

Humanity's Last Exam(无工具)

44.7%

38.3%

AA-LCR(长上下文推理)

72.7%

69.7%

在 GPQA 和长上下文推理上,差距不大;Humanity's Last Exam 上的领先幅度则更明显。Google 对 3.1 Pro 的定位正是如此:“需要广泛世界知识,以及跨模态高级推理能力的复杂任务。”如果你的工作负载正处于这一前沿区间,例如研究级科学问题,或围绕长文档展开的多步骤推理,那么这部分能力余量确实存在,也值得为之付费。

不过,实际使用中还有两点不利因素:

  • 知识更新较旧。Pro 的知识截止日期是 2025 年 1 月,比 Flash 的 2026 年 3 月早了十四个月。换句话说,这款旗舰模型对当下世界的了解反而少于预算型模型。

  • 仍处预览阶段。自 2026 年 2 月发布至今五个月后,3.1 Pro 在 Google 定价页上仍标注为 Preview,模型 ID 本身也是 gemini-3.1-pro-preview;Flash 则作为当前稳定默认模型提供。

不同任务该怎么选

  • 优先选 Gemini 3.6 Flash:适合编程智能体、终端和计算机操作自动化、机器学习工程任务、大规模信息提取或分类、对延迟敏感的应用,以及长文档检索。按公开数据,它在这些方面都更便宜、更快、知识更新,也有更高得分。

  • 在特定情况下选 Gemini 3.1 Pro:当任务属于前沿推理,例如博士级科学问题、针对长输入的多步骤分析,并且几个基准分的差异比成本、速度和知识新鲜度更重要时。也要预留应对 Preview 阶段变化的空间:预览版模型 ID 可能在稳定版上线时被改名或下线。

这项对比无法替你确定两件事:模型在你特定工具调用模式下的可靠性,以及它在你所在领域边缘案例上的输出质量。

两款模型均通过同一套 Gemini API 提供服务,因此最省钱的判定方式,就是将你最常用的十条提示词分别跑一遍。我上面的三任务脚本运行大约只需一分钟。

如何使用两款模型

两款模型都可通过 Gemini API 和 Google AI Studio 使用,对应模型 ID 为 gemini-3.6-flashgemini-3.1-pro-preview。在正式投入前,AI Studio 的免费层级已经足够让你并排测试两者。

如果你已经在使用模型聚合平台,OpenRouterAIReiter 都能通过一个 Key 按 Google 标价提供这两款模型——我上面的 A/B 测试就是这样完成的。

常见问题

Gemini 3.6 Flash 比 3.1 Pro 更好吗?

对大多数生产环境任务来说,是的。它在编程、智能体、机器学习、计算机操作和多模态基准上取胜,成本更低,运行速度也快 2.3 倍。3.1 Pro 仅在 GPQA Diamond、Humanity's Last Exam 和长上下文推理上保持领先,领先幅度为 1.3 到 6.4 分。

Gemini 3.6 Flash 比 3.1 Pro 便宜吗?

是的,所有模式下都是如此。标准 API 的输出价格为每 100 万 tokens $7.50 对 $12.00;提示词超过 200k tokens 后,差距扩大为 $7.50 对 $18.00;Batch 模式下 Pro 仍保有同样的 60% 溢价。Pro 的缓存存储成本则高出 4.5 倍。

Gemini 3.6 Flash 和 3.1 Pro 哪个更快?

Flash 的生成速度约为 261 tokens/second,3.1 Pro 为 112 tokens/second(Artificial Analysis,2026 年 7 月 23 日),而且它更早开始输出:在推理密集型工作负载中,首 token 时间为 12.8s 对 31.2s。我的三任务测试中,这最终体现为端到端速度快 40%。

Gemini 3.1 Pro 还值得用吗?

只有在你确实需要它的推理上限,并能够接受一款知识截止于 2025 年 1 月、仍处 Preview 阶段的模型时才值得考虑。对于难度低于这一档位的任务,公开数据没有显示额外成本能换来比 Flash 更好的输出。

延伸阅读