如果你的 AI Agent 成本主要花在输出上,Gemini 3.6 Flash 值得优先关注。Google 于 2026 年 7 月 21 日发布该模型:输出价格从 Gemini 3.5 Flash 的每 100 万 token $9.00 降至 $7.50,同时官方称它完成同类工作所需的输出 token 约少 17%。两项因素叠加,输出密集型任务的单次成本理论上最多可下降约三成。它在编程和 Agent 跑分上也普遍超过旧款 3.5 Flash,甚至在多数测试中胜过更大的 3.1 Pro。对于现有 3.5 Flash 用户,这几乎是一项不需要额外代价的升级;不过,单看标价,它并不是同级模型中最便宜的选择。
Google 这次一口气发布了什么
此次同步推出 3 个模型,面向的场景并不相同:
- Gemini 3.6 Flash(
gemini-3.6-flash):主力的“快且聪明”模型,支持 100 万 token 上下文、最高 64k 输出,知识截止时间从 2025 年 1 月推进至 2026 年 3 月。 - Gemini 3.5 Flash-Lite:面向高吞吐任务,输出速度约为每秒 350 token;对于简单且高频的工作,价格低得多。
- Gemini 3.5 Flash Cyber:针对安全场景调优,可发现、验证并修复漏洞。该模型运行在 CodeMender 中,目前仅面向政府和受信任合作伙伴进行有限访问试点,并非公开发布。
官方模型页面将 3.6 Flash 定位为“为速度打造的最智能模型”,具体价格已公布在 Google 的 Gemini API 定价页面。
这次更新并不是凭空出现的。Google 的旗舰 Gemini 3.5 Pro 延后了发布时间,而 DeepMind 已表示 Gemini 4 已进入预训练阶段。因此,在更大型的新模型到来前,这次 Flash 更新正好填补了产品节奏上的空档。
Gemini 3.6 Flash 怎么收费:降价没有看起来那么全面
Gemini 3.6 Flash 的标准 API 定价为:每 100 万输入 token $1.50、每 100 万输出 token $7.50,输出 token 中包含思考 token。上下文缓存价格为每 100 万 token $0.15,存储费用为每 100 万 token 每小时 $1.00。
不少发布日报道忽略了一点:这次降价只针对输出。此前 Gemini 3.5 Flash 的价格是输入每 100 万 token $1.50、输出 $9.00。输入价格没有变化,输出从 $9.00 降至 $7.50,降幅为 16.7%,并非全面降价。如果你的任务属于输入密集型,例如长文档输入、短答案输出,那么标价上的节省并不明显。真正的收益在别处。
该看单任务成本,而不是 token 标价
用每 token 标价比较模型代际并不够准确,实际账单取决于“价格 × 用量”。这里同时发生了两件事:输出单价降低 16.7%,并且 Google 通过 Artificial Analysis Index 表示,完成同样工作时输出 token 约减少 17%。在理想情况下,两者相乘为 0.833 × 0.83 ≈ 0.69,也就是输出成本约低 31%。
实际能省多少仍取决于任务类型。为此,我在 2026 年 7 月 22 日通过 OpenRouter,以 temperature 0 对两个模型分别运行了同样的 3 个提示词:一个编程任务、一个推理题和一个 JSON 提取任务。
| 指标(3 个任务,temp 0) | Gemini 3.6 Flash | Gemini 3.5 Flash |
|---|---|---|
| 输入 token | 146 | 145 |
| 输出 token | 2,736 | 2,593 |
| 总成本 | $0.0207 | $0.0236 |
| 总延迟 | 5.20s | 5.19s |
两个模型都给出了正确且可比的答案。在这个小样本中,3.6 Flash 的速度基本相同,但成本低约 12%;不过它反而多输出了几个百分点的 token,因为在推理上投入更多。结论很直接:最稳定的节省来自输出单价下调,即 $9.00 降至 $7.50;token 效率的提升在总体层面确实存在,但会随任务而波动,并非每次都能出现。实际规划时,可按输出成本降低 12%–17% 估算,31% 则属于最佳情况。
(样本较小:仅 3 个任务、temperature 0,并非正式基准测试。)
与其他高速模型相比,3.6 Flash 值不值
单价最低不等于整体最划算。下面将同属高速档的模型并列比较,所有数字均来自各厂商官方定价页,采用标准非 Batch 的每 100 万 token 定价。
| 模型 | 输入 /100 万 | 输出 /100 万 | 上下文 |
|---|---|---|---|
| Gemini 3.6 Flash | $1.50 | $7.50 | 1M |
| Gemini 3.5 Flash(上一代) | $1.50 | $9.00 | 1M |
| Gemini 3.5 Flash-Lite | $0.30 | $2.50 | 1M |
| Claude Haiku 4.5 | $1.00 | $5.00 | 200k |
| GPT-5.6 Luna | $1.00 | $6.00 | — |
| DeepSeek V4 Flash | $0.14 | $0.28 | 1M |
若只比较标价,3.6 Flash 并不占优。Claude Haiku 4.5 和 GPT-5.6 Luna 的输出价格更低,DeepSeek V4 Flash 则完全是另一个成本级别。3.6 Flash 主打的是每美元可获得的智能水平:它在 Artificial Analysis 的 Intelligence Index 中取得 50 分,显著高于高速档中位数;输出速度约为每秒 304 token,并提供完整的 100 万 token 上下文窗口。如果你需要接近前沿水平的 Agent 和编程能力,又不想支付旗舰模型价格,这就是选择它的理由。若只是低复杂度任务并追求绝对最低成本,表中更便宜的模型会更合适。
相较 Gemini 3.5 Flash 提升有多大
这次代际升级并非小修小补,提升最明显的恰好是 Flash 系列过去相对薄弱的领域:长周期编程任务和 Agent 工作流。
| 基准测试 | Gemini 3.5 Flash | Gemini 3.6 Flash |
|---|---|---|
| DeepSWE v1.1 | 37% | 49% |
| MLE-Bench | 49.7% | 63.9% |
| OSWorld-Verified(计算机操作) | 78.4% | 83.0% |
| SWE-Bench Pro | 55.1% | 58.7% |
| Terminal-Bench 2.1 | 76.2% | 78.0% |
分数来自 Google DeepMind Flash 模型页面 和 Artificial Analysis。其中 DeepSWE 和 MLE-Bench 的提升尤其突出,分别提高 12 分和 14 分。Google 还公布了 GDPval-AA 知识工作分数:1421,较此前的 1349 有所提升。在其中若干测试里,3.6 Flash 甚至略胜更大、更贵的 3.1 Pro,这对于 Flash 模型而言并不常见。
Gemini 3.6 Flash 对比 3.1 Pro:快档模型反超 Pro
最令人意外的是,在 Agent 和编程任务中,这款高速档模型击败了 Google 更大、更贵的 3.1 Pro。Gemini 3.1 Pro Preview 的价格会随提示词长度分档:输入每 100 万 token 为 $2.00–$4.00,输出为 $12.00–$18.00;而 3.6 Flash 采用固定的 $1.50/$7.50 定价。
| Gemini 3.6 Flash | Gemini 3.1 Pro | |
|---|---|---|
| 输入 /100 万 | $1.50 | $2.00–$4.00 |
| 输出 /100 万 | $7.50 | $12.00–$18.00 |
| DeepSWE v1.1 | 49% | 12% |
| SWE-Bench Pro | 58.7% | 54.2% |
| Terminal-Bench 2.1 | 78.0% | 73.8% |
3.1 Pro 依然是体量更大、价格更高的模型,目标场景是最困难的推理和长上下文任务。但对于多数编程与 Agent 工作负载,3.6 Flash 在上述基准中既更便宜,分数也更高。因此,在默认选用 Pro 档之前,值得先做一次与 3.1 Pro 的对比测试。完整的 Gemini 3.6 Flash vs 3.1 Pro 对比 包含正面对比跑分、分档定价和一手速度测试。
Gemini 3.5 Flash 用户该迁移吗
对于大多数已经在使用 3.5 Flash 的团队,答案是肯定的。从成本和能力看,这几乎是严格意义上的全面升级:
- 输入价格不变($1.50/100 万),输出价格更低($7.50 对 $9.00)。
- 同一任务的输出 token 更少,约减少 17%。
- 知识截止时间更新:从 2025 年 1 月推进到 2026 年 3 月。
- 全部 Agent 与编程基准分数更高。
不过,接入生产环境前仍有两点需要确认。第一,检查你的工作负载是否适配 64k 的最大输出限制;如果此前依赖更长的单次回复,应先测试这一边界。第二,务必运行自己的评测集。token 效率和推理方式的变化,可能改变你已调优提示词的表现,因此在切换默认模型前,应先基于真实流量测试延迟和输出质量。
Flash、Flash-Lite 与 Cyber 怎么选
3 个模型,对应 3 类工作:
- Gemini 3.6 Flash 是默认选择。需要前沿级 Agent、编程和多模态能力,同时希望保持高速档价格时,优先用它。
- Gemini 3.5 Flash-Lite($0.30/$2.50,约每秒 350 token)适合高频、低延迟、低复杂度任务,例如分类、提取、路由和简单聊天。它是大规模运行 Gemini 的最低成本方案。
- Gemini 3.5 Flash Cyber 只与政府或经过审核的安全合作伙伴有关。它是 CodeMender 内的试点能力,不是可通过标准 API 调用的模型。
如何接入 Gemini 3.6 Flash
该模型现已在 Gemini API 和 Google AI Studio 上线。AI Studio 提供免费层供原型开发使用,之后可使用 gemini-3.6-flash 模型 ID 转入按量付费;这与 Gemini 全系列通用的先免费、后付费的 Google AI Studio 路径一致。企业端入口也已列出,包括 Antigravity、Android Studio 和 Gemini Enterprise Agent Platform。如果你需要在 Vertex AI 中使用它,请在 Vertex 控制台确认模型是否已上架,因为截至 2026 年 7 月 22 日,该平台的可用性仍在逐步开放。
下面是调用 Gemini API 的最简 REST 示例:
curl "https://generativelanguage.googleapis.com/v1beta/models/gemini-3.6-flash:generateContent" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H "Content-Type: application/json" \
-d '{"contents":[{"parts":[{"text":"Summarize agentic AI in one sentence."}]}]}'
同时使用多个供应商的团队,有时会通过聚合平台路由模型,而不是分别维护多套密钥。OpenRouter 和 AIReiter 都以 Google 的标价提供 gemini-3.6-flash;区别在于同一把密钥背后还能接入什么。OpenRouter 覆盖众多供应商,AIReiter 则兼容 Anthropic API,可将 Gemini 与 Claude 一起路由。如果你希望在同一张账单上比较 3.6 Flash 与 Claude API 定价,后者会更方便。若只部署单一模型,直接使用 Google 会更简单。
常见问题
Gemini 3.6 Flash 免费吗?
Google AI Studio 提供有限额度的免费层,可用于原型开发。生产使用则采用按量付费,价格为每 100 万输入 token $1.50、每 100 万输出 token $7.50。
Gemini 3.6 Flash 比 3.5 Flash 更好吗?
是的。已公布的基准显示,它在 DeepSWE、MLE-Bench、OSWorld-Verified、SWE-Bench Pro 和 Terminal-Bench 上均优于 3.5 Flash;同时每个输出 token 的成本更低,单任务所需 token 也更少。
Gemini 3.6 Flash 比 Gemini 3.1 Pro 更好吗?
在 DeepSWE、SWE-Bench Pro、Terminal-Bench 等 Agent 和编程基准上,是的,而且价格更低:$1.50/$7.50,对比 $2.00–$4.00/$12.00–$18.00。Gemini 3.1 Pro 是更大的模型,在最困难的长上下文推理和多模态任务上仍然领先,因此最终选择仍取决于具体工作负载。
Gemini 3.6 Flash 的价格是多少?
标准档价格为每 100 万输入 token $1.50、每 100 万输出 token $7.50。上下文缓存为每 100 万 token $0.15。
Gemini 3.6 Flash 的知识截止时间是什么时候?
2026 年 3 月;相比上一代 Gemini 3.5 Flash 的 2025 年 1 月有所更新。
Gemini 3.6 Flash 可以在 Vertex AI 上使用吗?
Gemini API、Google AI Studio 以及数个企业端入口已确认支持。Vertex AI 在发布时尚未明确确认可用性,因此在该平台上构建应用前,请先查看 Vertex 模型目录。
Gemini 3.5 Flash Cyber 是什么?
这是一款专注安全的模型变体,针对软件漏洞的检测、验证和修复进行了调优。它运行在 Google DeepMind 的 CodeMender Agent 中,面向政府及受信任合作伙伴进行有限访问试点,并非公开模型。
