Gemini 3.6 Flash:定价、跑分与 API 接入指南

最后更新: 2026-07-22 07:23:13

如果你的 AI Agent 成本主要花在输出上,Gemini 3.6 Flash 值得优先关注。Google 于 2026 年 7 月 21 日发布该模型:输出价格从 Gemini 3.5 Flash 的每 100 万 token $9.00 降至 $7.50,同时官方称它完成同类工作所需的输出 token 约少 17%。两项因素叠加,输出密集型任务的单次成本理论上最多可下降约三成。它在编程和 Agent 跑分上也普遍超过旧款 3.5 Flash,甚至在多数测试中胜过更大的 3.1 Pro。对于现有 3.5 Flash 用户,这几乎是一项不需要额外代价的升级;不过,单看标价,它并不是同级模型中最便宜的选择。

Google 这次一口气发布了什么

此次同步推出 3 个模型,面向的场景并不相同:

  • Gemini 3.6 Flashgemini-3.6-flash):主力的“快且聪明”模型,支持 100 万 token 上下文、最高 64k 输出,知识截止时间从 2025 年 1 月推进至 2026 年 3 月。
  • Gemini 3.5 Flash-Lite:面向高吞吐任务,输出速度约为每秒 350 token;对于简单且高频的工作,价格低得多。
  • Gemini 3.5 Flash Cyber:针对安全场景调优,可发现、验证并修复漏洞。该模型运行在 CodeMender 中,目前仅面向政府和受信任合作伙伴进行有限访问试点,并非公开发布。
Gemini API 官方定价页面,显示 Gemini 3.6 Flash 每 100 万 token 输入 $1.50、输出 $7.50

官方模型页面将 3.6 Flash 定位为“为速度打造的最智能模型”,具体价格已公布在 Google 的 Gemini API 定价页面

这次更新并不是凭空出现的。Google 的旗舰 Gemini 3.5 Pro 延后了发布时间,而 DeepMind 已表示 Gemini 4 已进入预训练阶段。因此,在更大型的新模型到来前,这次 Flash 更新正好填补了产品节奏上的空档。

Gemini 3.6 Flash 怎么收费:降价没有看起来那么全面

Gemini 3.6 Flash 的标准 API 定价为:每 100 万输入 token $1.50、每 100 万输出 token $7.50,输出 token 中包含思考 token。上下文缓存价格为每 100 万 token $0.15,存储费用为每 100 万 token 每小时 $1.00。

不少发布日报道忽略了一点:这次降价只针对输出。此前 Gemini 3.5 Flash 的价格是输入每 100 万 token $1.50、输出 $9.00。输入价格没有变化,输出从 $9.00 降至 $7.50,降幅为 16.7%,并非全面降价。如果你的任务属于输入密集型,例如长文档输入、短答案输出,那么标价上的节省并不明显。真正的收益在别处。

该看单任务成本,而不是 token 标价

用每 token 标价比较模型代际并不够准确,实际账单取决于“价格 × 用量”。这里同时发生了两件事:输出单价降低 16.7%,并且 Google 通过 Artificial Analysis Index 表示,完成同样工作时输出 token 约减少 17%。在理想情况下,两者相乘为 0.833 × 0.83 ≈ 0.69,也就是输出成本约低 31%。

实际能省多少仍取决于任务类型。为此,我在 2026 年 7 月 22 日通过 OpenRouter,以 temperature 0 对两个模型分别运行了同样的 3 个提示词:一个编程任务、一个推理题和一个 JSON 提取任务。

指标(3 个任务,temp 0)Gemini 3.6 FlashGemini 3.5 Flash
输入 token146145
输出 token2,7362,593
总成本$0.0207$0.0236
总延迟5.20s5.19s

两个模型都给出了正确且可比的答案。在这个小样本中,3.6 Flash 的速度基本相同,但成本低约 12%;不过它反而多输出了几个百分点的 token,因为在推理上投入更多。结论很直接:最稳定的节省来自输出单价下调,即 $9.00 降至 $7.50;token 效率的提升在总体层面确实存在,但会随任务而波动,并非每次都能出现。实际规划时,可按输出成本降低 12%–17% 估算,31% 则属于最佳情况。

单任务输出成本柱状图:Gemini 3.5 Flash 为 100,Gemini 3.6 Flash 在三个任务实测中为 88,在 token 减少 17% 的最佳情况下为 69

(样本较小:仅 3 个任务、temperature 0,并非正式基准测试。)

与其他高速模型相比,3.6 Flash 值不值

单价最低不等于整体最划算。下面将同属高速档的模型并列比较,所有数字均来自各厂商官方定价页,采用标准非 Batch 的每 100 万 token 定价。

模型输入 /100 万输出 /100 万上下文
Gemini 3.6 Flash$1.50$7.501M
Gemini 3.5 Flash(上一代)$1.50$9.001M
Gemini 3.5 Flash-Lite$0.30$2.501M
Claude Haiku 4.5$1.00$5.00200k
GPT-5.6 Luna$1.00$6.00
DeepSeek V4 Flash$0.14$0.281M

若只比较标价,3.6 Flash 并不占优。Claude Haiku 4.5 和 GPT-5.6 Luna 的输出价格更低,DeepSeek V4 Flash 则完全是另一个成本级别。3.6 Flash 主打的是每美元可获得的智能水平:它在 Artificial Analysis 的 Intelligence Index 中取得 50 分,显著高于高速档中位数;输出速度约为每秒 304 token,并提供完整的 100 万 token 上下文窗口。如果你需要接近前沿水平的 Agent 和编程能力,又不想支付旗舰模型价格,这就是选择它的理由。若只是低复杂度任务并追求绝对最低成本,表中更便宜的模型会更合适。

相较 Gemini 3.5 Flash 提升有多大

这次代际升级并非小修小补,提升最明显的恰好是 Flash 系列过去相对薄弱的领域:长周期编程任务和 Agent 工作流。

基准测试Gemini 3.5 FlashGemini 3.6 Flash
DeepSWE v1.137%49%
MLE-Bench49.7%63.9%
OSWorld-Verified(计算机操作)78.4%83.0%
SWE-Bench Pro55.1%58.7%
Terminal-Bench 2.176.2%78.0%
分组柱状图,对比 Gemini 3.6 Flash 与 3.5 Flash 在 DeepSWE、MLE-Bench、OSWorld-Verified、SWE-Bench Pro 和 Terminal-Bench 2.1 上的表现,3.6 Flash 在五项测试中均领先

分数来自 Google DeepMind Flash 模型页面Artificial Analysis。其中 DeepSWE 和 MLE-Bench 的提升尤其突出,分别提高 12 分和 14 分。Google 还公布了 GDPval-AA 知识工作分数:1421,较此前的 1349 有所提升。在其中若干测试里,3.6 Flash 甚至略胜更大、更贵的 3.1 Pro,这对于 Flash 模型而言并不常见。

Gemini 3.6 Flash 对比 3.1 Pro:快档模型反超 Pro

最令人意外的是,在 Agent 和编程任务中,这款高速档模型击败了 Google 更大、更贵的 3.1 Pro。Gemini 3.1 Pro Preview 的价格会随提示词长度分档:输入每 100 万 token 为 $2.00–$4.00,输出为 $12.00–$18.00;而 3.6 Flash 采用固定的 $1.50/$7.50 定价。

Gemini 3.6 FlashGemini 3.1 Pro
输入 /100 万$1.50$2.00–$4.00
输出 /100 万$7.50$12.00–$18.00
DeepSWE v1.149%12%
SWE-Bench Pro58.7%54.2%
Terminal-Bench 2.178.0%73.8%

3.1 Pro 依然是体量更大、价格更高的模型,目标场景是最困难的推理和长上下文任务。但对于多数编程与 Agent 工作负载,3.6 Flash 在上述基准中既更便宜,分数也更高。因此,在默认选用 Pro 档之前,值得先做一次与 3.1 Pro 的对比测试。完整的 Gemini 3.6 Flash vs 3.1 Pro 对比 包含正面对比跑分、分档定价和一手速度测试。

Gemini 3.5 Flash 用户该迁移吗

对于大多数已经在使用 3.5 Flash 的团队,答案是肯定的。从成本和能力看,这几乎是严格意义上的全面升级:

  • 输入价格不变($1.50/100 万),输出价格更低($7.50 对 $9.00)。
  • 同一任务的输出 token 更少,约减少 17%。
  • 知识截止时间更新:从 2025 年 1 月推进到 2026 年 3 月。
  • 全部 Agent 与编程基准分数更高

不过,接入生产环境前仍有两点需要确认。第一,检查你的工作负载是否适配 64k 的最大输出限制;如果此前依赖更长的单次回复,应先测试这一边界。第二,务必运行自己的评测集。token 效率和推理方式的变化,可能改变你已调优提示词的表现,因此在切换默认模型前,应先基于真实流量测试延迟和输出质量。

Flash、Flash-Lite 与 Cyber 怎么选

3 个模型,对应 3 类工作:

  • Gemini 3.6 Flash 是默认选择。需要前沿级 Agent、编程和多模态能力,同时希望保持高速档价格时,优先用它。
  • Gemini 3.5 Flash-Lite($0.30/$2.50,约每秒 350 token)适合高频、低延迟、低复杂度任务,例如分类、提取、路由和简单聊天。它是大规模运行 Gemini 的最低成本方案。
  • Gemini 3.5 Flash Cyber 只与政府或经过审核的安全合作伙伴有关。它是 CodeMender 内的试点能力,不是可通过标准 API 调用的模型。

如何接入 Gemini 3.6 Flash

该模型现已在 Gemini API 和 Google AI Studio 上线。AI Studio 提供免费层供原型开发使用,之后可使用 gemini-3.6-flash 模型 ID 转入按量付费;这与 Gemini 全系列通用的先免费、后付费的 Google AI Studio 路径一致。企业端入口也已列出,包括 Antigravity、Android Studio 和 Gemini Enterprise Agent Platform。如果你需要在 Vertex AI 中使用它,请在 Vertex 控制台确认模型是否已上架,因为截至 2026 年 7 月 22 日,该平台的可用性仍在逐步开放。

下面是调用 Gemini API 的最简 REST 示例:

curl "https://generativelanguage.googleapis.com/v1beta/models/gemini-3.6-flash:generateContent" \
  -H "x-goog-api-key: $GEMINI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"contents":[{"parts":[{"text":"Summarize agentic AI in one sentence."}]}]}'

同时使用多个供应商的团队,有时会通过聚合平台路由模型,而不是分别维护多套密钥。OpenRouterAIReiter 都以 Google 的标价提供 gemini-3.6-flash;区别在于同一把密钥背后还能接入什么。OpenRouter 覆盖众多供应商,AIReiter 则兼容 Anthropic API,可将 Gemini 与 Claude 一起路由。如果你希望在同一张账单上比较 3.6 Flash 与 Claude API 定价,后者会更方便。若只部署单一模型,直接使用 Google 会更简单。

常见问题

Gemini 3.6 Flash 免费吗?

Google AI Studio 提供有限额度的免费层,可用于原型开发。生产使用则采用按量付费,价格为每 100 万输入 token $1.50、每 100 万输出 token $7.50。

Gemini 3.6 Flash 比 3.5 Flash 更好吗?

是的。已公布的基准显示,它在 DeepSWE、MLE-Bench、OSWorld-Verified、SWE-Bench Pro 和 Terminal-Bench 上均优于 3.5 Flash;同时每个输出 token 的成本更低,单任务所需 token 也更少。

Gemini 3.6 Flash 比 Gemini 3.1 Pro 更好吗?

在 DeepSWE、SWE-Bench Pro、Terminal-Bench 等 Agent 和编程基准上,是的,而且价格更低:$1.50/$7.50,对比 $2.00–$4.00/$12.00–$18.00。Gemini 3.1 Pro 是更大的模型,在最困难的长上下文推理和多模态任务上仍然领先,因此最终选择仍取决于具体工作负载。

Gemini 3.6 Flash 的价格是多少?

标准档价格为每 100 万输入 token $1.50、每 100 万输出 token $7.50。上下文缓存为每 100 万 token $0.15。

Gemini 3.6 Flash 的知识截止时间是什么时候?

2026 年 3 月;相比上一代 Gemini 3.5 Flash 的 2025 年 1 月有所更新。

Gemini 3.6 Flash 可以在 Vertex AI 上使用吗?

Gemini API、Google AI Studio 以及数个企业端入口已确认支持。Vertex AI 在发布时尚未明确确认可用性,因此在该平台上构建应用前,请先查看 Vertex 模型目录。

Gemini 3.5 Flash Cyber 是什么?

这是一款专注安全的模型变体,针对软件漏洞的检测、验证和修复进行了调优。它运行在 Google DeepMind 的 CodeMender Agent 中,面向政府及受信任合作伙伴进行有限访问试点,并非公开模型。

延伸阅读