2026 年 7 月 30 日,OpenAI 将 GPT-5.6 Luna 的价格下调 80%,GPT-5.6 Terra 下调 20%。Sol 的标准价格没有变化;而对多轮 Agent 来说,缓存写入费用可能在账单上吃掉大部分降价空间。
7 月 30 日究竟调整了什么
此次调价自 2026 年 7 月 30 日起生效,现有模型 ID 无需迁移。OpenAI 表示,降价源于其模型服务系统的效率提升;GPT-5.6 Sol 的标准费率则维持不变。
| 模型 | 模型 ID | 原输入价格 | 现输入价格 | 原输出价格 | 现输出价格 |
|---|---|---|---|---|---|
| GPT-5.6 Luna | gpt-5.6-luna | $1.00 | $0.20 | $6.00 | $1.20 |
| GPT-5.6 Terra | gpt-5.6-terra | $2.50 | $2.00 | $15.00 | $12.00 |
| GPT-5.6 Sol | gpt-5.6-sol | $5.00 | $5.00 | $30.00 | $30.00 |
价格单位为每 100 万 token,标准层级、短上下文,来源为 OpenAI API 定价文档(核实日期:2026-07-31)。
所以,“GPT-5.6 系列都便宜了”这句话只对了三分之二。同一天,OpenAI 还为 Sol 增加了 Fast mode:输入 $10.00、输出 $60.00,价格是标准模式的两倍,换取最高 2.5× 吞吐量,底层模型本身不变。定价文档注明,Fast mode 就是此前名为 priority processing 的功能。换言之,两个较低层级在降价,而旗舰层级同步多了一个更贵的选择。
调用时请写明具体模型 ID,不要只写系列简称。OpenAI 的模型目录将 gpt-5.6 列为 gpt-5.6-sol 的别名;如果以为短名称会路由到便宜层级,最终却会按旗舰价格计费。部分转售商甚至并不提供这个别名:AIReiter 的端点上,gpt-5.6 会返回 Model 'gpt-5.6' not found(测试日期:2026-07-31)。
开发者讨论的焦点,已经不只是降幅有多大,还包括这个价格是否可持续:
OpenAI 的 5.6 模型不可能真的只要这么低的运行成本 — r/Anthropic 帖子标题
Luna 价格低过 GPT-5.4 nano 后,模型该怎么选
GPT-5.6 Luna 的输入价格为 $0.20、输出价格为 $1.20;其输出 token 单价如今已低于 gpt-5.4-nano($0.20 / $1.25),也远低于 gpt-5.4-mini($0.75 / $4.50)。如果你一直保留旧版 nano 或 mini 调用只是为了省钱,这个理由已经不成立了。
为了确认低价层级是否够用,我于 2026-07-31 通过 AIReiter 的 OpenAI 兼容端点,对三个 GPT-5.6 模型分别测试了两项任务:一项是带严格 Schema 的客服工单转 JSON,另一项是只有一个正确答案($23.71)的 token 计费算术题。每项各运行两次,max_tokens: 4000,不重试,并按是否匹配预期结果判定通过或失败。
| 任务 | 模型 | 输入 token | 输出 token | 延迟(第 1 次 / 第 2 次) | 正确 |
|---|---|---|---|---|---|
| 工单 → JSON | Luna | 135 | 77–78 | 4.0s / 3.5s | 是 |
| Terra | 135 | 46 | 2.1s / 2.1s | 是 | |
| Sol | 135 | 46 | 2.3s / 2.2s | 是 | |
| 计费算术 | Luna | 119 | 111–122 | 3.1s / 4.3s | 是 |
| Terra | 119 | 87–89 | 3.8s / 2.8s | 是 | |
| Sol | 4,488 | 84–87 | 3.5s / 3.2s | 是 |
其中有两点尤其值得注意。
Luna 在抽取任务中反而是三者里最慢的。它的延迟为 3.5–4.0s,Terra 则为 2.1s。便宜层级并不天然意味着低延迟。
对于 Terra 和 Luna 都统计为 119 个输入 token 的提示词,Sol 却报告了 4,488 个输入 token。其中 3,840 个被标记为 cached_tokens,两次运行的结果完全一致。换成一个极简单的提示词(“Reply with only the word OK.”)后,三个模型都报告相同的 24 个 token,说明膨胀现象与提示词有关,而不是模型本身。我能看到 token 数,但无法确认成因。因此,这只能视为某个端点上实测到的计费行为,而非模型已被文档说明的特性。
按官方标准费率计算,得到同一个正确答案的成本如下:
每 1,000 次运行:Luna 为 $0.16,Terra 为 $1.29,Sol 为 $7.73。为了返回同一个三位数结果,Sol 的收费约为 Terra 的 6 倍、Luna 的 47 倍。
这只是两项简单任务、每项两次运行的小样本,不是基准测试,也不衡量推理质量。但它支持一条实用原则:先从 Luna 开始,只有在自己的真实流量中测到失败时,再向上升级。在这次测试中,Terra 已经能正确回答的问题,选择 Sol 并没有带来任何收益。完整的工作负载分配建议见文末表格。
为什么标称降价 80%,账单未必降 80%
宣传中的降价针对新增输入和输出 token。但多轮 Agent 流量的成本往往受第三个数字主导:缓存写入。在三个 GPT-5.6 层级中,缓存写入的价格均为缓存读取的 12.5 倍。
| 模型 | 缓存输入(读取) | 缓存写入 | 倍数 |
|---|---|---|---|
| GPT-5.6 Luna | $0.02 | $0.25 | 12.5× |
| GPT-5.6 Terra | $0.20 | $2.50 | 12.5× |
| GPT-5.6 Sol | $0.50 | $6.25 | 12.5× |
2026-07-11 发布在 OpenAI 开发者社区的一项受控测试,充分说明了这一点。在通过 previous_response_id 串联的六轮连续 Responses API 对话中,Luna 的输入 token 比 gpt-5.4-mini 少 3%,输出 token 少 29%,但每次对话成本却高出 96%($0.0651 对 $0.0332)。Luna 大约 70% 的输入被按缓存写入计费。这些数据早于本次降价,但底层机制没有变化。
值得关注的是,该实现中的问题可以修复。GPT-5.6 的缓存不会对部分匹配计分,因此只要缓存前缀发生变化,就必须完整重写。测试作者此前一直在 instructions 中重建不断增长的对话快照,导致每轮都让前缀失效。
诊断结果非常明显:稳定 instructions 在之后的 15 轮用户输入中有 15 次命中缓存,而会变化的 instructions 在 15 次中 0 次命中。将这部分上下文移入 developer input item 后,Luna 的成本溢价从 96% 降至 16.7%;在作者的盲评中,Luna 此后运行更快,得分也高于 mini。prompt_cache_key 和显式缓存断点都没有帮助。
在确认降价是否真正传导到自己账单前,先做两件事:
- 不要把动态内容放进缓存前缀。系统提示词、工具定义和角色设定应放在最前面,并保持字节级一致;对话状态应放入 input items。
- 从 API 返回值核对缓存拆分。
usage.prompt_tokens_details.cached_tokens与usage.prompt_tokens的对比,能显示每次调用的缓存读取占比。对于长运行 Agent,这个比例偏低是本系列模型中最值得优先修复的成本问题。
GPT-5.6 的三种价格,到底该看哪一种
搜索 GPT-5.6 Luna 的价格,至少会看到三种不同数字;它们对某些层级而言都曾经或目前仍然正确。先确认报价对应的层级,绝大多数矛盾就能消除。
| 你看到的价格 | Luna 输入 / 输出 | 对应含义 |
|---|---|---|
| $0.20 / $1.20 | 标准层级、短上下文 | 普通 API 调用的默认价格 |
| $0.10 / $0.60 | Batch 和 Flex 层级 | 标准价格的一半,适合异步和低优先级任务 |
| $0.40 / $2.40 | Fast mode | 标准价格的两倍 |
| $1.00 / $6.00 | 7 月 30 日前的标准价格 | 降价前的正确价格 |
同一份定价文档还列出了两个价格修饰条件:长上下文的输入按短上下文输入价的 2× 计费,输出按 1.5× 计费,因此 Luna 的长上下文价格是 $0.40 / $1.80,而不是 $0.40 / $2.40;此外,对于 2026-03-05 当日及以后发布的模型,符合条件的数据驻留端点价格上浮 10%,GPT-5.6 全系均在此范围内。
当定价页与实际账单不一致时,做两个检查即可:先看页面标注的核实日期,再以你实际调用的具体层级为准,对照官方定价文档。聚合平台和转售商也会发布自己的价格,那又是第三类情况:不是过时,而是价格体系不同。
在 AIReiter 上,三个 GPT-5.6 层级均按 OpenAI 标价的 50% 定价,并且跟随了 7 月 30 日的降价:GPT-5.6 Luna 为 $0.10 / $0.60,Terra 为 $1.00 / $6.00,Sol 为 $2.50 / $15.00;缓存输入和缓存写入同样按这一比例减半。
以一个每天消耗 100 万输入 token、20 万输出 token 的 Terra Agent 为例,官方标价下每天为 $4.40,在 AIReiter 则为 $2.20;调用相同,模型 ID 也相同。
Luna 在更广泛市场中的位置,则是另一个问题。根据 VentureBeat 于 7 月 30 日对 30 个模型的比较,Luna 的 $1.40 合计费率低于 Gemini 3.5 Flash-Lite($2.80)和 Gemini 3.1 Flash-Lite($1.75),但高于 DeepSeek v4-flash($0.42)。如果成本是唯一标准,最便宜的 LLM API并不来自 OpenAI。
常见问题
GPT-5.6 Sol 也降价了吗?
没有。Sol 的标准费率仍是每 100 万 token 输入 $5.00、输出 $30.00。它新增了 Fast mode,价格翻倍,换取最高 2.5× 吞吐量。
GPT-5.6 Luna 现在是最便宜的 API 模型吗?
不是。它每 100 万 token 输入加输出合计 $1.40,属于较便宜的前沿系列模型之一;但 VentureBeat 7 月 30 日的表格显示,DeepSeek v4-flash($0.42)、小米 MiMo-V2.5 Flash($0.40)和 DeepSeek v4-pro($1.305)都更低。
为什么有些页面上的 GPT-5.6 Luna 还是 $1 / $6?
这是 2026 年 7 月 30 日前的标准费率。请查看页面标注的核实日期,然后以实际调用层级为准,对照官方定价文档确认。
Batch 和 Flex 也适用这次降价吗?
适用。Batch 和 Flex 的价格为标准费率的一半,因此 Luna 在这两个层级的价格是 $0.10 / $0.60,Terra 是 $1.00 / $6.00;缓存输入和缓存写入也包括在内。
要拿到新价格,需要修改代码吗?
不需要。现有的 gpt-5.6-luna 和 gpt-5.6-terra 模型 ID 会直接适用降价,无需迁移。唯一值得优先调整的是审计缓存读取比例,因为降价最常在这里被抵消。
不同工作负载该选哪个层级
| 工作负载 | 建议层级 | 原因 |
|---|---|---|
| 高并发抽取、分类、摘要 | Luna | 两项测试任务均通过;每 100 万 token 合计 $1.40,现已低于 gpt-5.4-nano |
| 对延迟敏感的面向用户调用 | Terra | 在抽取任务中实测快于 Luna(2.1s 对 3.5–4.0s) |
| Luna 达不到质量要求时的首次升级 | Terra | 合计 $14,对比 Sol 的 $35 |
| Terra 在你的真实流量中可测量地表现不足的任务 | Sol | 这是承担 Terra 实测单任务成本 6 倍的唯一理由 |
| 任意层级的多轮 Agent | 先修复缓存 | 缓存写入成本是读取的 12.5 倍;错误的前缀设计比模型层级选择影响更大 |