AIREITER

Gemini 4 Argon API 定价与访问权限:目前有哪些信息已经落地

最后更新: 2026-10-01 07:30:40

Google 已经宣布 Gemini 4 Argon,但“宣布”并不等于你现在就能调用 API。截至 2026 年 10 月 1 日,Google 表示 Argon 将首先向受信任的网络安全防御人员开放,付费 API 客户和 Google AI Ultra 订阅者随后加入,但目前没有公布面向公众普遍开放的日期。现阶段更实际的做法,是先按它的价格做预算、准备评测,而不是把一个猜出来的模型名称直接写死在代码里。

Gemini 4 Argon 已发布,但 API 还不能面向所有人调用

Gemini 4 Argon 确实存在,并已于 2026 年 9 月 30 日由 Google DeepMind 正式宣布。目前它仍处于受限访问阶段,而不是全面开放。Google 在发布公告中表示,第一批外部用户是 Fairwind 计划中的受信任网络安全防御人员,之后将尽快向开发者、企业和消费者开放。

Google 公布价格,并不代表 Argon 已经在你的 API 账号中启用。因此,不要对着一个假定的端点或模型 ID 直接部署。

Google 在 9 月 30 日实际开放了什么

从实际使用角度看,Google 的发布节奏有四个边界:

访问群体2026 年 10 月 1 日的状态这意味着什么
Fairwind 受信任网络安全防御人员正在逐步开放面向外部用户的早期访问,版本针对防御性网络安全工作设计
Google 内部团队已在内部使用只能证明 Google 内部在使用,并不代表公众拥有 API 使用权限
付费 Gemini API 客户和 AI Ultra 订阅者下一批用户,时间未定Google 表示会“尽快”开放,但没有给出具体日期
普通开发者、企业和消费者尚未确定日期目前没有依据围绕 Argon 规划生产环境上线

这些信息都没有给出稳定的公开模型 ID、速率限制安排,也没有保证 Google AI Studio 或 Vertex AI 的具体上线日期。

Gemini 4 Argon 官方公告是了解开放节奏的权威来源。至于能否实际调用以及公开价目表,应以 Google 实时更新的 Gemini API 定价文档为准;在检查时,Argon 尚未列在其中。

Gemini 4 Argon 在开放前公布的 API 价格

Google 公布的是每 100 万 Token 的首发价格。首发期结束后价格将翻倍,但 Google 尚未公布首发期的结束日期。

计费项目首发价格后续价格
输入 Token$2.00 / 1M$4.00 / 1M
缓存输入$0.10 / 1M,说明为优惠 95%未说明
输出 Token$10.00 / 1M$20.00 / 1M

以一次简单的 Agent 调用为例:输入 Token 共 200,000 个,其中 150,000 个来自缓存,50,000 个未缓存,输出 40,000 个 Token,那么按首发价格估算,总成本为 $0.515:

  1. 50,000 个未缓存输入 Token,费用为 $0.10。
  2. 150,000 个缓存输入 Token,费用为 $0.015。
  3. 40,000 个输出 Token,费用为 $0.40。
  4. 合计:$0.515,未计入其他服务商或平台费用。

按照已公布的后续输入和输出价格,未缓存输入与输出两部分合计为 $1.00;由于 Google 尚未说明后续缓存输入价格,完整总价仍无法确定。输出是成本中的主要部分,因此“每百万 Token 输出”应视为预算上限,而不是合理的默认用量:按首发输出价格计算需要 $10,后续则为 $20,且还未加上输入费用。

不要只按首发价格做预算。一个在 $2/$10 价格下可行、但到了 $4/$20 就无法承受的功能,还不能算生产就绪。速率限制、地区可用性、批处理条款、最终的缓存规则,以及首发期结束日期,目前都还是未知数。

目前关于 Argon 的证据,能证明什么,又不能证明什么

Google 将 Argon 定位为面向长周期软件工程、企业知识工作、长视频理解和防御性网络安全的模型。其发布材料给出了以下结果:

评测公布结果证据范围
DeepSWE v1.177.9%Google 公布的软件工程成绩
AutomationBench51.3%Google 公布的端到端业务功能成绩
LVBench91.7%Google 公布的长视频成绩
CWE-bench v168%Google 公布的漏洞修复成绩

Artificial Analysis 的报告显示,其高推理快照的早期 Intelligence Index 得分为 53,并将速度数据标记为不可用。这些信息只能作为参考,不能视为延迟保证。Google 的基准测试结果足以支持针对具体工作负载进行测试,但不能据此假设 Argon 在所有任务上都更强。

百万 Token 输出上限,会直接影响系统架构

Google 表示,Argon 最多可生成 1 million 个输出 Token,而此前的 Gemini 模型上限为 64,000 个。这意味着在处理大型迁移项目或长篇报告时,可能不必再把任务拆成大量响应后手动拼接。但与此同时,它也带来三个运营风险。

第一,超长响应可能在接近完成时失败。应采用流式输出,并为中间结果设置检查点,避免连接中断后,几乎完成的任务变成一笔无法使用的账单。第二,输出越长,审核成本越高。大型代码迁移仍然需要测试、差异审查和明确的回滚边界。第三,输出长度会推高延迟,因此超长生成并不适合交互式界面。

每次调用都应设置明确的输出上限:信息提取和聊天使用较小限制,有边界的代码修改使用更大限制,报告或迁移任务则按具体作业设定预算。只有在任务确实需要时,才使用 1M 上限;不要因为上限很高,就让每个 Agent 都不受限制地运行。

开发者如何安全地提前准备

你完全可以提前准备,而不必假装 Argon 现在已经可用。

  1. 把模型名称放在 GEMINI_MODEL 中,不要写死在应用逻辑里。
  2. 将 GEMINI_API_KEY 放在源码控制之外。
  3. 从自己的代码仓库、文档或 Agent 运行记录中,整理 20–50 个有代表性的任务。
  4. 记录 Token 用量、延迟、重试次数、工具错误、结果采纳率、人工修复时间和计费成本。
  5. 开放访问后,参考 Google 的 Models API 文档检查账号可用的模型列表;不要猜测 gemini-4-argon。
  6. 切换流量前,先用当前生产模型跑完同一套测试集。

按照 Google 的 Gemini API Python SDK 文档,可以先使用下面这个与具体模型无关的 Python 调用:

import os
from google import genai
from google.genai import types

client = genai.Client()
model = os.environ["GEMINI_MODEL"]

response = client.models.generate_content(
    model=model,
    contents="Review this bounded code change and list concrete risks.",
    config=types.GenerateContentConfig(max_output_tokens=32000),
)
print(response.text)

这个示例并不是说 GEMINI_MODEL=gemini-4-argon 今天就能正常工作。Google 发布正式模型 ID 后,应先确认模型列表响应与 API 文档一致,再修改部署配置。

哪些团队应该等待,哪些团队现在就该准备

工作负载当前建议原因
大型重构和长时间运行的编程 Agent准备评测输出上限和 DeepSWE 结果都直接对应这类工作负载
多文档法律或金融分析准备评测企业知识工作和持续推理属于发布时强调的定位
简短客服、信息提取或分类继续使用经过验证的低价模型Argon 的前沿模型成本和延迟可能无法带来足够回报
防御性漏洞研究符合条件的话,通过已公布的 Fairwind 渠道申请最早期访问受到限制,并且专门面向网络安全场景
本月必须依赖某个模型上线的产品不要依赖 Argon目前没有公开模型 ID,也没有普遍可用日期

更务实的建议是做路由,而不是自动替换:日常请求继续交给速度更快的基础模型,Argon 则只用于长耗时、高难度任务,并且要等它通过你的验收测试后再投入使用。

Gemini 4 Argon 常见问题

Gemini 4 Argon 已经对所有人开放了吗?

没有。Google 会先通过 Fairwind 向受信任的网络安全防御人员开放。付费 API 客户和 Google AI Ultra 订阅者被列为下一批用户,但 Google 尚未公布面向公众普遍开放的日期。

Gemini 4 Argon 的 API 模型 ID 是什么?

截至 2026 年 10 月 1 日,在检查到的发布材料中,Google 尚未公布稳定的公开模型 ID。应查询当前凭据实际可用的模型,而不是想当然地认为 gemini-4-argon 有效。

Gemini 4 Argon 的价格是多少?

首发价格为每百万输入 Token $2、每百万输出 Token $10。Google 表示后续价格将分别为 $4 和 $20;缓存输入则按首发输入价格优惠 95%。

“百万 Token”指的是上下文窗口吗?

Google 明确描述的是输出 Token 上限。在 Google 的 API 文档明确说明输入上限之前,不要假设它拥有 1-million-token 的上下文窗口。

我现在应该替换 Gemini 3.8 Flash 吗?

不应该。继续保留已经验证过的基础模型,固定一套有代表性的测试集;只有在 Argon 对你的账号开放、官方模型 ID 已有文档说明,并且同一批任务在成本和人工修复率都可接受的情况下,才考虑切换。