Gemini 3.5 Flash 的每秒输出 token 数是 Gemini 3.1 Pro 的 2.6 倍,每个 token 的成本低 25%,并且在 Artificial Analysis 的 Intelligence Index 上略胜 Pro(50 对 46)。Gemini 3.1 Pro 在 ARC-AGI-2 上仍领先 5 分(77.1% 对 72.1%),而 Flash 在长上下文检索上的分数一旦超过 128k tokens,就会从 84.9% 下降到 77.3%。该用哪个模型取决于任务:Flash 针对吞吐量和工具调用延迟进行优化,Pro 针对多步推理深度进行优化,而综合基准会将这两种优先级平均成一个单一分数,从而掩盖你的工作负载实际上需要的是哪一种。
基准测试记分卡:每个模型实际领先之处
| 指标 | Gemini 3.5 Flash | Gemini 3.1 Pro | 获胜者 |
|---|---|---|---|
| 智能指数 (Artificial Analysis) | 50 | 46 | Flash |
| ARC-AGI-2,抽象推理 (BenchLM) | 72.1% | 77.1% | Pro |
| 128k 上下文下的 MRCR v2 (nxcode) | 77.3%(较更短上下文时的 84.9% 下降) | 未以相同长度公开报告 | 数据不足 |
| 多模态平均分 (BenchLM) | 83.8 | 82.6 | Flash |
| 输出速度 (BenchLM) | 284.2 tok/s | 109 tok/s | Flash (2.6x) |
| GDPval-AA Elo,现实世界代理任务 (apiyi) | 1656 | 1314 | Flash |
Flash 在衡量吞吐量和通用任务处理的指标上表现更好。Pro 在 ARC-AGI-2 推理深度方面有明确且有文档记录的领先;在长上下文检索方面,Flash 在超过 128k tokens 后有已记录的回归问题,但 Pro 的对应分数未公开,因此这一项应判定为结论不明,而不是 Pro 胜出。这种分化直接对应你正在运行的任务类型,这比单一的综合 Intelligence Index 数值更有用。
来自 BenchLM 自身比较的一个方法论注意事项:在大约 34 个两款模型都公开了结果的基准中,只有 3 个类别可以直接比较——Pro 在 14 个基准上有独家结果,Flash 在 17 个基准上有独家结果,而且两者的 thinking-budget 设置并不总是匹配。请将上表视为方向上可靠;ARC-AGI-2 和 MRCR v2 的差距大到足以令人信服,但在共享指标上 1-2 分的差异不应被解读为决定性的。
Flash 的领先优势何时失效
ARC-AGI-2 差距(5 分)是 BenchLM 的比较中发现的两种模型之间单一类别差异最大的部分。ARC-AGI-2 专门设计用来抵御模式匹配捷径,因此在那里出现 5 分差距,比在更常规的基准上出现类似差距,更能说明推理深度。nxcode 的 MRCR v2 结果提供了同方向的第二个数据点:随着上下文增长接近 128k tokens,Flash 自身的检索准确率从 84.9% 下降到 77.3%。Pro 在相同长度下的分数未公开报告,因此这并不是 Pro 直接对比失利的已记录证据——但它确实是 Flash 的一次已记录回退,而 Pro 的基准表并未显示这一点。
轶事性说明,不是基准证据:一篇Reddit r/GeminiAI 讨论串询问用户他们在处理困难任务时更喜欢哪个模型,评论者称 Flash 在“除了长上下文、抽象[推理]之外的所有方面”都优于 Pro。这只是少数人的看法,不是数据——但它恰好描述了基准测试所显示的那两个相同例外,这算是一个稍微有用的合理性检查,而不是任何东西的独立证明。
定价与缓存:真实成本概况
基础定价比乍看之下更能缩小价格优势:
- Gemini 3.5 Flash:$1.50 / million input tokens,$9 / million output tokens
- Gemini 3.1 Pro:$2 / million input tokens,$12 / million output tokens
纸面上看,这是 25% 的折扣,而不是 Flash 先前相较于旧版 Pro 模型所保持的 4-8 倍差距。更大的杠杆在于缓存:
- Flash 缓存写入是免费的;缓存输入费用为 $0.15/百万 tokens
- Pro 缓存写入费用为 $0.38/百万 tokens;缓存输入费用为 $0.50/百万 tokens——是 Flash 缓存输入费率的 3 倍以上
对于任何会在多轮对话中反复发送相同 system prompt 或文档上下文的工作流——聊天代理、带有持久代码库上下文的编码助手、多轮支持机器人——这种缓存差距都会迅速累积。单次请求几乎看不出差异;但在一千轮的代理会话中就很明显了。
这种差距也并非恒定不变。apiyi 的定价拆解指出,在大约 20 万个上下文 token 之后,这两个模型之间的价格差距会缩小到 25-50%,因为在这个规模下,两者按 token 计算的经济性会趋于一致。如果你的工作负载主要是非常长的单次文档,而不是短小的重复调用,那么支持 Flash 的价格论据就会变弱。
一个具体示例:一个支持机器人工作流,每天发送 100 万个缓存输入 tokens 并生成 50 万个输出 tokens。在 Flash 上,缓存写入费用为 $0,再加上 $0.15 x 1(缓存输入)+ $9 x 0.5(输出)= $4.65/天。在 Pro 上,相同工作负载的费用为 $0.38(缓存写入,一次性)+ $0.50 x 1(缓存输入)+ $12 x 0.5(输出)= 第一天约 $6.88/天,在首次写入后稳定为 $6.50/天。按月计算,这意味着大约 $140 和 $195 之间的差异——还没算上 Pro 在任何真正需要它的请求上的更深入推理。
Agent 循环:为何 Flash 在速度上胜出,但并不总是在可靠性上占优
nxcode 的 agent-loop 基准测试运行了一个 8 步的 agent loop,并记录到 Flash 完整完成该序列大约用了 25 秒,而 Pro 用了 100 秒——这一 4 倍的差距会随着每增加一步而进一步放大。在 GDPval-AA 上,这是一项围绕真实世界知识工作 agent 任务构建的基准测试,Flash 的 Elo 分数(1656)比 Pro 的(1314)高出 342 分,这是整个基准表中最大的单项差距。
需要注意的是:这种速度和得分优势假设 agent 循环能顺利运行。ARC-AGI-2 和 MRCR v2 中在推理和长上下文任务里出现的差距,足以合理地推断 Flash 在循环中途遇到工具调用返回意外结果、且 agent 必须重新规划时,也会更不宽容——这只是基于上面的推理深度数据得出的推断,而不是单独经过基准测试的结论。如果你的 agent 是在有监督的情况下运行、并且有人在步骤之间检查输出,那么 Flash 的速度几乎就是白捡的优势。如果它在无人监督的情况下连续运行很多步、且没有人介入循环,那么在有人发布两者的失败率数据之前,Pro 的推理优势会是更稳妥的选择。
你应该使用哪一个:基于任务的决策矩阵
| 任务类型 | 推荐模型 | 原因 |
|---|---|---|
| 日常编码(测试、PR 审查、语言之间的翻译) | Flash | 速度和成本更占优,推理深度不是瓶颈 |
| 深度重构、新颖算法设计 | Pro | ARC-AGI-2 的差距会在多步逻辑推理中直接体现出来 |
| 长文档检索(合同、研究语料,超过 128k tokens) | Pro | Flash 在这个长度上有公开记录的 MRCR v2 回归;Pro 的未公开,但更稳妥的默认选择是没有已知弱点的模型 |
| 高吞吐量批量生成 | Flash | 免费缓存写入和 2.6x 吞吐量在规模化场景下最重要 |
| 由人类检查输出的受监督 agent 工作流 | Flash | 有速度优势,同时没有无监督可靠性风险 |
| 无监督、高风险的 agent 链 | Pro | 在没有人类在循环中捕捉中途错误时,推理深度余量更安全 |
| 频繁多轮调用并复用相同上下文 | Flash | 缓存输入定价大约只有 Pro 的三分之一 |
一条简单的默认规则就足以覆盖上表中的大多数情况:除非以下三种情况之一成立,否则将请求发送到 Flash——上下文超过 128k tokens 且检索准确性很重要;任务属于抽象/多步推理(新算法、法律或研究综合);或者 agent 在无人监督的情况下运行超过少数几个步骤。只要这三种情况中的任意一种出现,调用就会更倾向于 Pro;如果都不存在,Flash 的速度和缓存定价使其成为更便宜的默认选择。
常见问题
Gemini 3.5 Flash 比 3.1 Pro 更好吗?
在速度、成本和通用基准测试方面,是的。在抽象推理(ARC-AGI-2)方面,Gemini 3.1 Pro 仍然领先 5 分。在超过 128k tokens 的长上下文检索方面,Flash 有已记录的回退,而 Pro 的对应分数尚未公布,所以应将该比较视为尚未定论,而不是已确认 Pro 获胜。哪个更“好”取决于你的任务属于上述哪一类。
Gemini 3.5 Flash 比 3.1 Pro 便宜多少?
基础输入/输出定价便宜约 25%(每百万 tokens 为 $1.50/$9,而不是 $2/$12)。更大的节省体现在缓存方面:Flash 的缓存写入是免费的,而且缓存输入的费用大约只有 Pro 的三分之一,这对多轮或高负载工作负载最为重要。
Gemini 3.5 Flash 适合编程吗?
是的,适用于日常工作——测试生成、PR 审查、在不同语言之间翻译代码。对于深度重构或新颖算法设计,Pro 在抽象推理基准上的优势往往会体现在输出质量上。
Gemini 3.5 Flash 能很好地处理长上下文吗?
在较短的上下文长度下,是的——MRCR v2 的检索准确率保持在 84.9%。超过 128k tokens 后会降至 77.3%,这对于多文档合同审查之类的任务来说是一个显著差距。Gemini 3.1 Pro 在相同长度下的分数尚未公布,因此应将其视为已知的 Flash 局限,而不是已确认的 Pro 优势。
结论
Gemini 3.5 Flash 是大多数日常和高频任务的更优默认选择——它更快,缓存成本更低,而且在通用基准测试上的表现足够接近,以至于这种取舍通常并不重要。Gemini 3.1 Pro 在抽象推理和无监督 agent 链方面证明了其更高成本的价值;对于超过 128k tokens 的长文档,Flash 自己的数据表明存在一个弱点,而 Pro 的数据既没有证实也没有否定这一点,因此在最终确定任何一种方案之前,最好把这一项当作值得你自行测试的内容。
此比较基于公开基准数据(Artificial Analysis、BenchLM、nxcode 和 apiyi),而非一手 API 测试。Gemini 3.1 Pro 以偏重推理的定位推出,与 Flash 的速度导向不同。撰写本文时,Gemini 3.5 Pro 仍未发布——报道指向 2026 年 7 月发布——因此请将其视为一个快照;待 Pro 的下一个版本发布后,这两个模型以及这份比较都需要重新审视。
