Google 已经宣布 Gemini 4 Argon,但“宣布”并不等于你现在就能调用 API。截至 2026 年 10 月 1 日,Google 表示 Argon 将首先向受信任的网络安全防御人员开放,付费 API 客户和 Google AI Ultra 订阅者随后加入,但目前没有公布面向公众普遍开放的日期。现阶段更实际的做法,是先按它的价格做预算、准备评测,而不是把一个猜出来的模型名称直接写死在代码里。
Gemini 4 Argon 已发布,但 API 还不能面向所有人调用
Gemini 4 Argon 确实存在,并已于 2026 年 9 月 30 日由 Google DeepMind 正式宣布。目前它仍处于受限访问阶段,而不是全面开放。Google 在发布公告中表示,第一批外部用户是 Fairwind 计划中的受信任网络安全防御人员,之后将尽快向开发者、企业和消费者开放。
Google 公布价格,并不代表 Argon 已经在你的 API 账号中启用。因此,不要对着一个假定的端点或模型 ID 直接部署。
Google 在 9 月 30 日实际开放了什么
从实际使用角度看,Google 的发布节奏有四个边界:
| 访问群体 | 2026 年 10 月 1 日的状态 | 这意味着什么 |
|---|---|---|
| Fairwind 受信任网络安全防御人员 | 正在逐步开放 | 面向外部用户的早期访问,版本针对防御性网络安全工作设计 |
| Google 内部团队 | 已在内部使用 | 只能证明 Google 内部在使用,并不代表公众拥有 API 使用权限 |
| 付费 Gemini API 客户和 AI Ultra 订阅者 | 下一批用户,时间未定 | Google 表示会“尽快”开放,但没有给出具体日期 |
| 普通开发者、企业和消费者 | 尚未确定日期 | 目前没有依据围绕 Argon 规划生产环境上线 |
这些信息都没有给出稳定的公开模型 ID、速率限制安排,也没有保证 Google AI Studio 或 Vertex AI 的具体上线日期。
Gemini 4 Argon 官方公告是了解开放节奏的权威来源。至于能否实际调用以及公开价目表,应以 Google 实时更新的 Gemini API 定价文档为准;在检查时,Argon 尚未列在其中。
Gemini 4 Argon 在开放前公布的 API 价格
Google 公布的是每 100 万 Token 的首发价格。首发期结束后价格将翻倍,但 Google 尚未公布首发期的结束日期。
| 计费项目 | 首发价格 | 后续价格 |
|---|---|---|
| 输入 Token | $2.00 / 1M | $4.00 / 1M |
| 缓存输入 | $0.10 / 1M,说明为优惠 95% | 未说明 |
| 输出 Token | $10.00 / 1M | $20.00 / 1M |
以一次简单的 Agent 调用为例:输入 Token 共 200,000 个,其中 150,000 个来自缓存,50,000 个未缓存,输出 40,000 个 Token,那么按首发价格估算,总成本为 $0.515:
- 50,000 个未缓存输入 Token,费用为 $0.10。
- 150,000 个缓存输入 Token,费用为 $0.015。
- 40,000 个输出 Token,费用为 $0.40。
- 合计:$0.515,未计入其他服务商或平台费用。
按照已公布的后续输入和输出价格,未缓存输入与输出两部分合计为 $1.00;由于 Google 尚未说明后续缓存输入价格,完整总价仍无法确定。输出是成本中的主要部分,因此“每百万 Token 输出”应视为预算上限,而不是合理的默认用量:按首发输出价格计算需要 $10,后续则为 $20,且还未加上输入费用。
不要只按首发价格做预算。一个在 $2/$10 价格下可行、但到了 $4/$20 就无法承受的功能,还不能算生产就绪。速率限制、地区可用性、批处理条款、最终的缓存规则,以及首发期结束日期,目前都还是未知数。
目前关于 Argon 的证据,能证明什么,又不能证明什么
Google 将 Argon 定位为面向长周期软件工程、企业知识工作、长视频理解和防御性网络安全的模型。其发布材料给出了以下结果:
| 评测 | 公布结果 | 证据范围 |
|---|---|---|
| DeepSWE v1.1 | 77.9% | Google 公布的软件工程成绩 |
| AutomationBench | 51.3% | Google 公布的端到端业务功能成绩 |
| LVBench | 91.7% | Google 公布的长视频成绩 |
| CWE-bench v1 | 68% | Google 公布的漏洞修复成绩 |
Artificial Analysis 的报告显示,其高推理快照的早期 Intelligence Index 得分为 53,并将速度数据标记为不可用。这些信息只能作为参考,不能视为延迟保证。Google 的基准测试结果足以支持针对具体工作负载进行测试,但不能据此假设 Argon 在所有任务上都更强。
百万 Token 输出上限,会直接影响系统架构
Google 表示,Argon 最多可生成 1 million 个输出 Token,而此前的 Gemini 模型上限为 64,000 个。这意味着在处理大型迁移项目或长篇报告时,可能不必再把任务拆成大量响应后手动拼接。但与此同时,它也带来三个运营风险。
第一,超长响应可能在接近完成时失败。应采用流式输出,并为中间结果设置检查点,避免连接中断后,几乎完成的任务变成一笔无法使用的账单。第二,输出越长,审核成本越高。大型代码迁移仍然需要测试、差异审查和明确的回滚边界。第三,输出长度会推高延迟,因此超长生成并不适合交互式界面。
每次调用都应设置明确的输出上限:信息提取和聊天使用较小限制,有边界的代码修改使用更大限制,报告或迁移任务则按具体作业设定预算。只有在任务确实需要时,才使用 1M 上限;不要因为上限很高,就让每个 Agent 都不受限制地运行。
开发者如何安全地提前准备
你完全可以提前准备,而不必假装 Argon 现在已经可用。
- 把模型名称放在
GEMINI_MODEL中,不要写死在应用逻辑里。 - 将
GEMINI_API_KEY放在源码控制之外。 - 从自己的代码仓库、文档或 Agent 运行记录中,整理 20–50 个有代表性的任务。
- 记录 Token 用量、延迟、重试次数、工具错误、结果采纳率、人工修复时间和计费成本。
- 开放访问后,参考 Google 的 Models API 文档检查账号可用的模型列表;不要猜测
gemini-4-argon。 - 切换流量前,先用当前生产模型跑完同一套测试集。
按照 Google 的 Gemini API Python SDK 文档,可以先使用下面这个与具体模型无关的 Python 调用:
import os
from google import genai
from google.genai import types
client = genai.Client()
model = os.environ["GEMINI_MODEL"]
response = client.models.generate_content(
model=model,
contents="Review this bounded code change and list concrete risks.",
config=types.GenerateContentConfig(max_output_tokens=32000),
)
print(response.text)
这个示例并不是说 GEMINI_MODEL=gemini-4-argon 今天就能正常工作。Google 发布正式模型 ID 后,应先确认模型列表响应与 API 文档一致,再修改部署配置。
哪些团队应该等待,哪些团队现在就该准备
| 工作负载 | 当前建议 | 原因 |
|---|---|---|
| 大型重构和长时间运行的编程 Agent | 准备评测 | 输出上限和 DeepSWE 结果都直接对应这类工作负载 |
| 多文档法律或金融分析 | 准备评测 | 企业知识工作和持续推理属于发布时强调的定位 |
| 简短客服、信息提取或分类 | 继续使用经过验证的低价模型 | Argon 的前沿模型成本和延迟可能无法带来足够回报 |
| 防御性漏洞研究 | 符合条件的话,通过已公布的 Fairwind 渠道申请 | 最早期访问受到限制,并且专门面向网络安全场景 |
| 本月必须依赖某个模型上线的产品 | 不要依赖 Argon | 目前没有公开模型 ID,也没有普遍可用日期 |
更务实的建议是做路由,而不是自动替换:日常请求继续交给速度更快的基础模型,Argon 则只用于长耗时、高难度任务,并且要等它通过你的验收测试后再投入使用。
Gemini 4 Argon 常见问题
Gemini 4 Argon 已经对所有人开放了吗?
没有。Google 会先通过 Fairwind 向受信任的网络安全防御人员开放。付费 API 客户和 Google AI Ultra 订阅者被列为下一批用户,但 Google 尚未公布面向公众普遍开放的日期。
Gemini 4 Argon 的 API 模型 ID 是什么?
截至 2026 年 10 月 1 日,在检查到的发布材料中,Google 尚未公布稳定的公开模型 ID。应查询当前凭据实际可用的模型,而不是想当然地认为 gemini-4-argon 有效。
Gemini 4 Argon 的价格是多少?
首发价格为每百万输入 Token $2、每百万输出 Token $10。Google 表示后续价格将分别为 $4 和 $20;缓存输入则按首发输入价格优惠 95%。
“百万 Token”指的是上下文窗口吗?
Google 明确描述的是输出 Token 上限。在 Google 的 API 文档明确说明输入上限之前,不要假设它拥有 1-million-token 的上下文窗口。
我现在应该替换 Gemini 3.8 Flash 吗?
不应该。继续保留已经验证过的基础模型,固定一套有代表性的测试集;只有在 Argon 对你的账号开放、官方模型 ID 已有文档说明,并且同一批任务在成本和人工修复率都可接受的情况下,才考虑切换。