别只盯着每百万输入 token 10 美元、每百万输出 token 50 美元这组 headline 价格。单次请求的输入 token 超过 272,000后,整笔请求都会进入更高费率;同时,GPT-6 Astra 仍在逐步开放,能看到文档并不代表账号已经可以调用。
GPT-6 Astra API 定价一览
下面这张费率表来自 OpenAI 官方模型页面。缓存提示词、长上下文请求和 Fast 模式,都可能让实际成本明显偏离基础价格。
| 项目 | 当前详情 |
|---|---|
| API 模型 ID | gpt-6-astra |
| 标准输入 | 10.00 美元 / 1M token |
| 缓存输入 | 1.00 美元 / 1M token |
| 缓存写入 | 12.50 美元 / 1M token |
| 标准输出 | 50.00 美元 / 1M token |
| 上下文窗口 | 1,050,000 token |
| 最大输出 | 128,000 token |
| 知识截止日期 | 2026 年 4 月 30 日 |
| 输入/输出 | 文本和图像输入;文本输出 |
| 免费 API 层级 | 不支持 |
| 当前可用性 | 正在向 Trusted Access 企业用户逐步开放;更广泛的 API 和付费计划访问权限将在 coming days 开放 |
这些数字来自 GPT-6 Astra 模型页面,并非预发布估算。OpenAI 的模型使用指南还说明,工具调用需要使用 Responses API。
三条会直接改变账单的定价规则
GPT-6 Astra 不只有四类 token 价格,还叠加了服务模式规则。如果把它简单理解成 $10 in / $50 out,就会低估缓存创建、长提示词和低延迟处理的成本。
标准输入、缓存输入和缓存写入
标准输入是每百万 10 美元,缓存输入是每百万 1 美元,缓存写入则是每百万 12.50 美元。提示词完成首次写入后,后续重复使用的成本可能会低很多。
| Token 类别 | 标准费率 | 代表什么 |
|---|---|---|
| 未缓存输入 | 10.00 美元 / 1M | 模型首次处理的新输入 |
| 缓存输入 | 1.00 美元 / 1M | 从缓存中读取、此前已经处理过的输入 |
| 缓存写入 | 12.50 美元 / 1M | 添加到提示词缓存中的输入 |
| 输出 | 50.00 美元 / 1M | 模型生成的回复 token |
不要直接用上下文窗口乘以输入费率。1.05M token 上下文窗口只是容量上限,并不意味着所有 token 都按基础费率计费。
超过 272K 输入 token 后,整笔请求都会加价
当一次请求包含超过 272,000 个输入 token时,OpenAI 列出的费率是:整笔请求的输入和缓存费率提高至 2 倍,输出费率提高至 1.5 倍。也就是说,长上下文档位下,未缓存输入为每百万 20 美元,缓存输入为每百万 2 美元,缓存写入为每百万 25 美元,输出为每百万 75 美元。
| 请求档位 | 输入 | 缓存输入 | 缓存写入 | 输出 |
|---|---|---|---|---|
| 输入 token 不超过 272K | $10 | $1 | $12.50 | $50 |
| 输入 token 超过 272K | $20 | $2 | $25 | $75 |
以一笔 300K 输入 token 的请求为例,所有适用的输入、缓存和输出 token 都按更高的长上下文费率计算;前 272K 并不会按标准档位计费。
Batch、Flex、Fast 与区域部署怎么选
OpenAI 对Batch 和 Flex 按适用费率的 50% 计价。其模型使用指南说明,Fast 模式按适用费率的 2 倍收费,不提供延迟 SLA,而且不支持 EU data residency;Priority processing 同样不支持 EU data residency。
| 模式 | 标准输入 | 标准输出 | 实际理解 |
|---|---|---|---|
| Standard | $10 / 1M | $50 / 1M | 默认的直接 API 档位 |
| Batch 或 Flex | $5 / 1M | $25 / 1M | 适用 Standard 费率的一半 |
| Fast | $20 / 1M | $100 / 1M | 适用 Standard 费率的两倍 |
| 长上下文 Standard | $20 / 1M | $75 / 1M | 输入超过 272K 后适用 |
| 长上下文 Fast | $40 / 1M | $150 / 1M | 长上下文费率的 2 倍 |
上表只展示未缓存输入和输出价格。缓存读取与缓存写入同样会遵循对应服务模式的倍率。
Microsoft Foundry 另有一张单独发布的部署价格表。其GPT-6 Astra 公告列出的 Global Standard 短上下文费率为:输入 10 美元、缓存输入 1 美元、缓存写入 12.50 美元、输出 50 美元。U.S. Data Zone Standard 则分别是11 美元、1.10 美元、13.75 美元和 55 美元。长上下文价格表中,Global 为$20/$2/$25/$75,U.S. Data Zone 为$22/$2.20/$27.50/$82.50。不要把 OpenAI 直连 API 的费率表直接套进 Azure 预算。
一次真实的 Astra 请求要花多少钱
下面的示例采用 OpenAI 直连 API 的 Standard 价格,不包含工具调用和重试;token 会严格按照示例说明,区分为未缓存或已缓存。
| 请求示例 | 计算方式 | 预估 token 费用 |
|---|---|---|
| 100K 未缓存输入 + 10K 输出 | 0.1 × $10 + 0.01 × $50 | $1.50 |
| 200K 缓存输入 + 20K 输出 | 0.2 × $1 + 0.02 × $50 | $1.20 |
| 300K 未缓存输入 + 30K 输出 | 0.3 × $20 + 0.03 × $75 | $8.25 |
在采用长上下文工作流前,先测试 272K 这条分界线;检索或压缩上下文可能降低模型费用,但也会增加应用侧的处理工作。
写入 200K token 的成本是$2.50,之后命中一次 200K 缓存的成本是$0.20;缓存能否回本,取决于后续复用频率。
在 Microsoft Foundry 中,Global 短上下文价格表下,一次 100K 输入、10K 输出的请求,在不计算工具和重试的情况下同样是$1.50。U.S. Data Zone 版本则是$1.65:0.1 × $11 + 0.01 × $55。
OpenAI 的指南称,与早期模型相比,Astra 可能带来更低的单个任务完成成本,但这不是独立的生产成本基准。最好在自己的调用 trace 中记录输入 token、缓存命中、输出 token、工具调用、重试和人工修正,再做实际测量。
访问权限、配额,以及 ChatGPT 与 API 的区别
GPT-6 Astra 正在向加入Trusted Access Program的企业逐步开放,API 以及 Plus、Pro、Business 和 Enterprise 的访问权限将在 coming days 开放。OpenClaw OpenAI provider 文档同样指出,账号的模型目录发现结果决定了是否拥有 Astra 访问权限;仅仅把模型名称写进配置,并不会自动获得权限。
一位用户这样描述了等待开放的过程:
“It’s almost 2 AM and I’m going to bed pissed off. I waited ALL DAY for Astra. ... And then I find out: I CAN’T EVEN USE IT.” — @buildwithrajath,X
模型页面列出了以下 API 使用层级限制:
| 层级 | RPM | TPM | Batch 队列上限 |
|---|---|---|---|
| Free | 不支持 | 不支持 | 不支持 |
| Tier 1 | 500 | 500,000 | 1,500,000 |
| Tier 2 | 5,000 | 1,000,000 | 3,000,000 |
| Tier 3 | 5,000 | 2,000,000 | 100,000,000 |
| Tier 4 | 10,000 | 4,000,000 | 200,000,000 |
| Tier 5 | 15,000 | 40,000,000 | 15,000,000,000 |
Astra 的费率表只针对 API;引用的文档并未说明 ChatGPT 计划包含 API credits,因此应将 Platform API 的使用费用单独纳入预算。
现有 Agent 迁移前要检查什么
OpenAI 的模型使用指南列出了三项迁移检查:
- 模型与 API:将
model设置为gpt-6-astra,确认账号模型目录中已经出现该模型,并使用 Responses API 进行工具调用。 - 请求参数:选择
low、medium、high、xhigh或max;Astra 不支持none。同时移除不支持的采样和 log-probability 参数。 - 缓存与区域:按照 OpenAI 针对旧模型的迁移指南操作时,将
prompt_cache_retention替换为prompt_cache_options.ttl: "30m",然后重新检查 EU data residency 下的 Fast 和 Priority 设置。
预算决策:按 trace 路由,而不是只看 token 价格
当任务上下文很长、工具调用很多、失败代价高,或者被无法提供干净 API 的软件卡住时,GPT-6 Astra 更容易体现价值。如果只是短小、重复性的提示词,而每百万输出 token 50 美元并没有换来更少的重试或更高的任务完成质量,那么它并不适合作为默认模型。
- 先测试 Astra:优先放在长上下文研究、computer-use、复杂编码和多应用工作流中,这些场景一旦失败,往往会产生额外审核或返工成本。
- 让更便宜的模型负责默认任务:用于短文本分类、信息抽取、简单起草和可预测的格式转换。
- 使用 Batch 或 Flex:当延迟不重要,且工作负载适合 50% 费率时采用。
- 不要默认使用 Fast。在任何长上下文倍率计算前,它的价格已经是每百万输入 20 美元、每百万输出 100 美元,因此必须有可量化的吞吐收益支撑。
- 设置 272K 硬性保护线。在请求越过阈值前发出提醒,因为加价会应用于整笔请求。
评估时应根据自己的 trace 日志计算每个可接受任务的成本,而不是只看 token 价格。若要继续做相关预算比较,可以参考GPT-5.6 定价指南和OpenRouter 定价指南中的假设,但不要把它们的费率规则直接套用到 Astra。
GPT-6 Astra API 定价 FAQ
GPT-6 Astra 每 1M token 多少钱?
标准价格为:每百万未缓存输入 token 10 美元、每百万缓存输入 token 1 美元、每百万缓存写入 12.50 美元,以及每百万输出 token 50 美元。
输入 token 超过 272K 后会怎样?
输入和缓存费率翻倍,输出费率上涨 50%:整笔请求按每百万输入 20 美元、缓存输入 2 美元、缓存写入 25 美元、输出 75 美元计费。
缓存输入和缓存写入是一回事吗?
不是。标准档位下,缓存输入代表一次缓存命中,价格是每百万 1 美元;缓存写入则是创建或更新缓存前缀,价格为每百万 12.50 美元。
Batch 或 Flex 会让 GPT-6 Astra 价格减半吗?
OpenAI 将 Batch 和 Flex 定价为适用 Standard 费率的 50%;如果触发长上下文阈值,也包括对应的长上下文费率。
Fast 模式值得多花钱吗?
Fast 模式按适用费率的 2 倍收费,而且没有延迟 SLA。只有当调用 trace 显示吞吐量或用户价值的提升足以抵消溢价时,才值得使用。
我现在可以通过 API 使用 GPT-6 Astra 吗?
目前访问权限仍在逐步开放,并非所有账号都能使用;OpenAI 列出了首批 Trusted Access 企业用户,并表示更广泛的 API 访问权限将在 coming days 开放,因此最终应以账号模型目录中的结果为准。
ChatGPT Plus 包含 GPT-6 Astra API credits 吗?
模型文档并未承诺 ChatGPT 计划包含 API credits。在账号明确的计费条款另有说明之前,应将付费计划中的模型访问权限与按量计费的 Platform API 使用分开看待。
使用 GPT-6 Astra 需要修改哪些 API 配置?
将 model 设置为 gpt-6-astra,使用 Responses API 进行工具调用,选择受支持的 reasoning effort,移除不支持的采样和 log-probability 参数,并检查缓存 TTL 以及区域限制下的 Fast 模式规则。在把 Astra 设为默认模型前,先针对一次具有代表性的运行记录 token、缓存行为、工具调用、重试和人工修正情况。