Google 最便宜的 3.5 代模型,能否替代输入 token 单价高出 6.7 倍的 Pro?我在 2026 年 7 月 23 日通过同一条 OpenAI 兼容 API 路由,分别测试了 gemini-3.5-flash-lite 和 gemini-3.1-pro-preview,使用完全相同的四道提示词。结果是:正确性打平,账单相差 25 倍;而 Flash-Lite 唯一一次出错,恰好就是足以让生产流水线中断的那种问题。(如果你在考虑中档 Flash,可参考我们的 Gemini 3.5 Flash vs Gemini 3.1 Pro 对比。)
四项同题实测:结果到底怎样
所有测试使用相同提示词和同一条 OpenAI 兼容 API 路由,回答全部通过程序评分:代码题运行 8 个本地测试用例,信息提取题则采用严格的 schema 校验。
| 任务 | Flash-Lite | 3.1 Pro | 胜者 |
|---|---|---|---|
| Python ISO-8601 时长解析器(8 个测试用例) | 8/8,3.7 秒 | 8/8,38.2 秒 | 正确性平手 |
| 从混乱邮件中严格提取 JSON | 字段正确,但包在 markdown 代码围栏中,1.0 秒 | 正确,直接输出 JSON,9.8 秒 | Pro |
| 百分比逻辑陷阱题(答案:50) | 正确,1.8 秒 | 正确,10.6 秒 | 平手 |
| 含 3 个预埋缺陷的代码审查 | 找出 3 个中的 2 个,另发现 1 个未预埋问题,3.7 秒 | 找出 3 个中的 2 个,另发现 1 个未预埋问题,30.2 秒 | 平手 |
时长解析器上,两款模型都交出了完全正确的实现。代码审查中,两者也都发现了 SQL 注入、可变默认参数造成的缓存问题,以及低效筛选逻辑;同时又都漏掉了我预埋的朴素 datetime 时区 bug。这四项日常任务里,正确性没有差异。
不过要说明两点:这只是一次抽样测试,加上后文的 30 次调用试验,并非完整基准测试套件。另外,Pro 有一次对无害的代码审查提示词给出了莫名拒答,需要重试才成功。这可能是中转链路的噪声而非模型本身的问题,但无论如何,生产环境都应为重试留出预算。
Flash-Lite 会在哪儿翻车
格式遵循偶尔失手
信息提取提示词明确写着“仅返回 JSON 对象”。Pro 返回的是裸 JSON;Flash-Lite 的数据完全正确,却用 json 代码围栏包了起来,导致下游的 json.loads()` 调用在加入去围栏处理前会直接崩溃。
一次失误可能只是偶发,于是我继续量化测试:针对 10 封不同的客服邮件,每个模型各执行 30 次提取调用,并以程序检查裸 JSON 合规性和 schema 有效性。Flash-Lite 30 次中通过 29 次,成功率为 96.7%,唯一失败正是被代码围栏包裹;3.1 Pro 则 30 次全部通过。那一次失败并不是内容提取错误,字段完全正确,错的是输出包装方式。
而格式遵循能力,正是 Google 为这款模型主打的卖点:Flash-Lite 官方页面将其定位为“最适合低延迟、高吞吐智能体任务”。3.3% 的失误率听起来可以接受,但连续调用会放大风险:一个智能体任务若要调用模型 20 次,大约一半的运行会遇到至少一次异常响应(1 − 0.967²⁰ ≈ 0.49)。如果要把结构化输出交给 Flash-Lite,建议外层加校验器并允许一次重试:在 3.3% 的失败率下,一次重试可将每次调用的剩余失败率降至约 0.1%;而我测试中所有失败都是包装问题,从未出现内容错误。
Pro 仍然不可替代的场景
上面四项任务都在 Flash-Lite 的舒适区内:上下文短、要求明确、一次生成即可完成。结合发布后一周的社区反馈,边界也相当一致。r/GeminiAI 上处理长文档的用户反馈称,在小型 Gemini 模型开始丢失人物和情节一致性的地方,Pro 能维持住连贯性。独立指标也指向同样结论:Artificial Analysis 的 Intelligence Index 中,3.1 Pro 得分 46,Flash-Lite 为 36,差距主要集中在多步推理评测,而不是代码或信息提取。该追踪平台在其跟踪的 152 个模型中,将 Flash-Lite 的输出速度排在第 2 位,智能水平只排第 13 位:它更像一个专长明确的工具,而不是通用替代品。
我自己的较难任务也隐约展示了上限:两款模型都没发现时区 bug。Flash-Lite 能追平 Pro,不代表 Flash-Lite 就是 Pro;这只说明两者都有盲区,而 Pro 更深一层的能力是否值得你为之多付 25 倍成本,需要自行权衡。
实际的分界线很简单:需要模型在任务中途重新规划、让 5 万字以上内容保持一致,或面对高代价失误作判断的工作,依然值得用 Pro。任何模板化任务则未必如此。
实际成本差距是 25 倍,不是 4.8 倍
价格页显示,Pro 的输出价格是 Flash-Lite 的 4.8 倍(每百万 token 为 12 美元 vs 2.50 美元)。但我在四项任务中的实际支出约为:Flash-Lite 0.005 美元,Pro 0.13 美元,相差 25 倍(Lite 合计计费约 570 个输入 / 2,020 个输出 token;Pro 为 1,700 / 10,386,均按标价计算)。
差距来自思考 token。Gemini 3.1 Pro 会在作答前进行推理,Google 将这些推理也按输出 token 计费。以解析器任务为例,Pro 共生成 5,125 个输出 token,其中 4,811 个,也就是 94%,属于思考过程;Flash-Lite 则用 819 个 token 直接完成回答。四项任务合计,思考 token 占 Pro 向我计费总量的 84%。
30 次信息提取试验没有缩小差距,反而进一步拉开了:短输出会让思考开销的占比更高。Flash-Lite 完成全部 30 次调用只生成 1,899 个输出 token,总成本约为0.006 美元;Pro 则计费 29,468 个输出 token,其中 27,636 个(94%)是思考 token,总成本约0.38 美元,在这一工作负载下相差 65 倍。若放大到每月 100 万次提取调用,账单就是 190 美元与 12,500 美元的区别。
这并非小样本偶然现象。Tessl 代码基准测试团队运行了约 3,300 个代码智能体任务,发现尽管 Gemini 3.1 Pro 标价更高,但最终反而比推理负担更重的 Gemini 3.5 Flash 更便宜:机制相同,只是结果方向相反。Artificial Analysis 的 cost-to-run-index 数据也呈现相同反转。这里得到的规则是:不要只看每 token 价目表,要比较完成一个任务的实测成本。
规格与价格:截至 2026 年 7 月 23 日核实
以下信息来自 Google 的官方 Gemini API 定价页面:
| Gemini 3.5 Flash-Lite | Gemini 3.1 Pro(≤200k ctx) | |
|---|---|---|
| 输入 / 100 万 token | 0.30 美元 | 2.00 美元(超过 200k 后为 4.00 美元) |
| 输出 / 100 万 token(含思考) | 2.50 美元 | 12.00 美元(超过 200k 后为 18.00 美元) |
| Batch 档位 | 0.15 美元 / 1.25 美元 | 1.00 美元 / 6.00 美元 |
| 上下文缓存 | 0.03 美元 | 0.20 美元 |
| 上下文窗口 | 输入 1M / 输出 64k | 输入 1M / 输出 32k |
| 输出速度(Artificial Analysis) | 426.8 tok/s | 112.2 tok/s |
| 状态 | GA,gemini-3.5-flash-lite | Preview,gemini-3.1-pro-preview |
有两个细节值得注意。Flash-Lite 相比前代实际上是涨价了:3.1 Flash-Lite 的输入/输出价格为 0.25/1.50 美元,输出价格上涨了 67%。Google 给出的理由是能力提升:其 DeepMind 模型页面公布的数据显示,相比 3.1 Flash-Lite,3.5 Flash-Lite 在 SWE-Bench Pro 上从 38.3% 提升至 54.2%,在 Terminal-bench 2.1 上从 31% 提升至 54%。另一个不对称点是输出上限:Flash-Lite 支持 64k 输出 token,是 Pro 的 32k 两倍。因此,极长的单次生成任务反直觉地反而属于廉价模型的主场。
早期用户怎么评价
验证时模型仅发布两天,讨论量仍然不大,但 X 上最早的一批生产反馈大致分为三类:
- 质疑定价:“Why is 3.5 flash lite 50% more expensive. It is so sneaky,”@samarthg1911 于 7 月 23 日发文称。涨价是目前最普遍的抱怨。
- 流水线收益:机器学习工程师 @mrdbourke 表示,它“速度非常快,视觉能力也很出色”,并已在其部分流水线中替换 Gemini 3.5 Flash,后者的输出单价是它的 3.6 倍。另一支运营内容工具的团队发现,它在解析网络俚语时相比 3.1 Flash-Lite 是“一次显著升级”。
- 性能倒退反馈:一位工程师的内部评测得出了完全相反的结论:“3.5 flash lite is a real downgrade”,其团队继续使用 3.1 Flash-Lite。
早期评价相互矛盾,通常意味着模型的优势高度取决于工作负载。这和我的数据吻合:在它的赛道内表现出色,到了边缘场景则会悄悄变得不够严谨。
不同任务该路由到哪个模型
Gemini 3.5 Flash-Lite 与 Gemini 3.1 Pro 并不是非此即彼的选择。综合实测结果和社区报告的失败案例,我会这样部署:
交给 Flash-Lite(0.30 美元/2.50 美元):
- 结构化提取、分类、打标签(配合 JSON 校验器和一次重试)
- 模板化代码生成,例如解析器、转换器、CRUD 脚手架
- 高频智能体步骤:工具调用格式化、摘要后传递、路由决策
- 视觉占比高、处理量大的任务,这是早期用户最集中的好评场景
- 此前会使用 3.1 Flash-Lite 的一切工作:同一档位现在的 SWE-Bench Pro 得分高出 16 分
继续使用 3.1 Pro(2 美元/12 美元):
- 交付物要求在数万字范围内保持一致性的长文档工作(社区反馈,本文未实测)
- 工具调用返回意外结果后,智能体必须重新规划的任务
- 一次错误的代价高于一个月价差的判断任务
- 超过 200k 上下文的工作,需按翻倍后的 4 美元/18 美元价格预算
比固定只选一款模型更有效的模式是:默认路由到 Flash-Lite,遇到明确触发条件再升级 Pro——一次重试后 schema 校验仍失败、工具调用返回错误或意外结构、输入超过你的上下文舒适区,或者上游将任务标为高风险。按实测 25 倍成本差计算,若将升级率控制在约 15%,相比所有任务都跑 Pro,支出大约可降低 80%(0.85 + 0.15 × 25 = Lite 成本的 4.6 倍,而全量 Pro 是 25 倍)。
如何调用这两款模型
Flash-Lite 已作为 gemini-3.5-flash-lite 在 Gemini API、Google AI Studio 和 Gemini 应用中正式可用;3.1 Pro 仍以 gemini-3.1-pro-preview 的形式处于预览阶段。两者也都可通过 OpenAI 兼容中转平台调用——AIReiter 的 Google 模型目录列出了 Gemini 系列及其他供应商模型,我正是用它完成了上文的正面对比,无需在两个 SDK 之间切换。如果要复现测试,请记录每次调用端点返回的思考 token 数量(OpenAI 兼容路由使用 usage.completion_tokens_details.reasoning_tokens,原生 Gemini API 使用 thoughtsTokenCount):25 倍成本差就藏在这个字段里。
常见问题
Gemini 3.5 Flash-Lite 比 Gemini 3.1 Pro 更好吗?
不是。它在我的四项抽样测试中与 Pro 打平,包括代码生成、信息提取、逻辑题和代码审查,同时响应速度快 8 倍、计费低 25 倍;但 Pro 在长上下文一致性、动态重新规划和推理深度上仍有优势(Artificial Analysis 指数为 46 vs 36)。
Gemini Flash 和 Flash-Lite 哪个更好?
Flash(1.50 美元/9.00 美元)是推理模型,在智能体基准测试上的得分更高;Flash-Lite(0.30 美元/2.50 美元)支持可调节的思考等级,但我进行的 34 次调用全部使用了零思考 token,这也是它能在约一秒内作答的原因。对于高吞吐的信息提取、分类和视觉流水线,Flash-Lite 5-6 倍的价格优势通常更有价值;多步智能体推理则值得为 Flash 付费。
为什么 Gemini 3.5 Flash-Lite 变贵了?
Google 提高了该档位相对 3.1 Flash-Lite 的价格(0.25 美元/1.50 美元 → 0.30 美元/2.50 美元,输出价格上涨 67%),同时公布了大幅能力提升:SWE-Bench Pro 从 38.3% → 54.2%,Terminal-bench 从 31% → 54%。你为每个 token 支付更多,但模型需要的尝试次数可能更少。
有 Gemini 3.5 Pro 吗?
截至 2026 年 7 月 23 日,还没有。3.5 代已推出 Flash-Lite、Flash 和 Live Translate 档位,以及更新的 3.6 Flash。Pro 产品线最新发布的仍是处于预览阶段的 3.1 Pro。
