AIREITER

AI 图片

FLUX.2 ProGPT-Image 2Wan 2.7 Image ProGPT 4o ImageSeedream 5.0 ProSeedream V5 liteSeedream V4.5更多

AI 视频

Kling 3.0 Motion ControlSora 2 ProKling 3.0 TurboSora 2Kling 3.0Grok Imagine 1.5Veo 3.1更多

LLM

Gemini 3.6 FlashGemini 3.1 ProKimi K3Gemini 3 ProGemini 2.5 ProClaude Opus 5Claude Fable 5更多
即将推出Seedance 2.5
Super ResolutionLyric Video GeneratorGPT Image 2 1K GeneratorGPT Image 2 Product Mockup GeneratorUse GPT-5.6 Online
API 文档价格
博客更新LLM API GuideClaude API GuideKimi K3 API Guide
模板
  • AIReiter
  • 博客
  • GPT-5.6 降价后:Luna 和 Terra 的实际成本

GPT-5.6 降价后:Luna 和 Terra 的实际成本

最后更新: 2026-07-31 11:02:07

2026 年 7 月 30 日,OpenAI 将 GPT-5.6 Luna 的价格下调 80%,GPT-5.6 Terra 下调 20%。Sol 的标准价格没有变化;而对多轮 Agent 来说,缓存写入费用可能在账单上吃掉大部分降价空间。

7 月 30 日究竟调整了什么

此次调价自 2026 年 7 月 30 日起生效,现有模型 ID 无需迁移。OpenAI 表示,降价源于其模型服务系统的效率提升;GPT-5.6 Sol 的标准费率则维持不变。

模型模型 ID原输入价格现输入价格原输出价格现输出价格
GPT-5.6 Lunagpt-5.6-luna$1.00$0.20$6.00$1.20
GPT-5.6 Terragpt-5.6-terra$2.50$2.00$15.00$12.00
GPT-5.6 Solgpt-5.6-sol$5.00$5.00$30.00$30.00

价格单位为每 100 万 token,标准层级、短上下文,来源为 OpenAI API 定价文档(核实日期:2026-07-31)。

OpenAI API 定价表,展示 gpt-5.6-sol、gpt-5.6-terra 和 gpt-5.6-luna 每 100 万 token 的费率

所以,“GPT-5.6 系列都便宜了”这句话只对了三分之二。同一天,OpenAI 还为 Sol 增加了 Fast mode:输入 $10.00、输出 $60.00,价格是标准模式的两倍,换取最高 2.5× 吞吐量,底层模型本身不变。定价文档注明,Fast mode 就是此前名为 priority processing 的功能。换言之,两个较低层级在降价,而旗舰层级同步多了一个更贵的选择。

分组柱状图,对比 7 月 30 日前后 GPT-5.6 每 100 万 token 输入加输出的合计价格

调用时请写明具体模型 ID,不要只写系列简称。OpenAI 的模型目录将 gpt-5.6 列为 gpt-5.6-sol 的别名;如果以为短名称会路由到便宜层级,最终却会按旗舰价格计费。部分转售商甚至并不提供这个别名:AIReiter 的端点上,gpt-5.6 会返回 Model 'gpt-5.6' not found(测试日期:2026-07-31)。

开发者讨论的焦点,已经不只是降幅有多大,还包括这个价格是否可持续:

OpenAI 的 5.6 模型不可能真的只要这么低的运行成本 — r/Anthropic 帖子标题

Luna 价格低过 GPT-5.4 nano 后,模型该怎么选

GPT-5.6 Luna 的输入价格为 $0.20、输出价格为 $1.20;其输出 token 单价如今已低于 gpt-5.4-nano($0.20 / $1.25),也远低于 gpt-5.4-mini($0.75 / $4.50)。如果你一直保留旧版 nano 或 mini 调用只是为了省钱,这个理由已经不成立了。

为了确认低价层级是否够用,我于 2026-07-31 通过 AIReiter 的 OpenAI 兼容端点,对三个 GPT-5.6 模型分别测试了两项任务:一项是带严格 Schema 的客服工单转 JSON,另一项是只有一个正确答案($23.71)的 token 计费算术题。每项各运行两次,max_tokens: 4000,不重试,并按是否匹配预期结果判定通过或失败。

任务模型输入 token输出 token延迟(第 1 次 / 第 2 次)正确
工单 → JSONLuna13577–784.0s / 3.5s是
Terra135462.1s / 2.1s是
Sol135462.3s / 2.2s是
计费算术Luna119111–1223.1s / 4.3s是
Terra11987–893.8s / 2.8s是
Sol4,48884–873.5s / 3.2s是

其中有两点尤其值得注意。

Luna 在抽取任务中反而是三者里最慢的。它的延迟为 3.5–4.0s,Terra 则为 2.1s。便宜层级并不天然意味着低延迟。

对于 Terra 和 Luna 都统计为 119 个输入 token 的提示词,Sol 却报告了 4,488 个输入 token。其中 3,840 个被标记为 cached_tokens,两次运行的结果完全一致。换成一个极简单的提示词(“Reply with only the word OK.”)后,三个模型都报告相同的 24 个 token,说明膨胀现象与提示词有关,而不是模型本身。我能看到 token 数,但无法确认成因。因此,这只能视为某个端点上实测到的计费行为,而非模型已被文档说明的特性。

按官方标准费率计算,得到同一个正确答案的成本如下:

柱状图,展示 Luna、Terra 和 Sol 在同一任务上每 1,000 次运行的实测成本

每 1,000 次运行:Luna 为 $0.16,Terra 为 $1.29,Sol 为 $7.73。为了返回同一个三位数结果,Sol 的收费约为 Terra 的 6 倍、Luna 的 47 倍。

这只是两项简单任务、每项两次运行的小样本,不是基准测试,也不衡量推理质量。但它支持一条实用原则:先从 Luna 开始,只有在自己的真实流量中测到失败时,再向上升级。在这次测试中,Terra 已经能正确回答的问题,选择 Sol 并没有带来任何收益。完整的工作负载分配建议见文末表格。

为什么标称降价 80%,账单未必降 80%

宣传中的降价针对新增输入和输出 token。但多轮 Agent 流量的成本往往受第三个数字主导:缓存写入。在三个 GPT-5.6 层级中,缓存写入的价格均为缓存读取的 12.5 倍。

模型缓存输入(读取)缓存写入倍数
GPT-5.6 Luna$0.02$0.2512.5×
GPT-5.6 Terra$0.20$2.5012.5×
GPT-5.6 Sol$0.50$6.2512.5×

2026-07-11 发布在 OpenAI 开发者社区的一项受控测试,充分说明了这一点。在通过 previous_response_id 串联的六轮连续 Responses API 对话中,Luna 的输入 token 比 gpt-5.4-mini 少 3%,输出 token 少 29%,但每次对话成本却高出 96%($0.0651 对 $0.0332)。Luna 大约 70% 的输入被按缓存写入计费。这些数据早于本次降价,但底层机制没有变化。

值得关注的是,该实现中的问题可以修复。GPT-5.6 的缓存不会对部分匹配计分,因此只要缓存前缀发生变化,就必须完整重写。测试作者此前一直在 instructions 中重建不断增长的对话快照,导致每轮都让前缀失效。

诊断结果非常明显:稳定 instructions 在之后的 15 轮用户输入中有 15 次命中缓存,而会变化的 instructions 在 15 次中 0 次命中。将这部分上下文移入 developer input item 后,Luna 的成本溢价从 96% 降至 16.7%;在作者的盲评中,Luna 此后运行更快,得分也高于 mini。prompt_cache_key 和显式缓存断点都没有帮助。

在确认降价是否真正传导到自己账单前,先做两件事:

  1. 不要把动态内容放进缓存前缀。系统提示词、工具定义和角色设定应放在最前面,并保持字节级一致;对话状态应放入 input items。
  2. 从 API 返回值核对缓存拆分。usage.prompt_tokens_details.cached_tokens 与 usage.prompt_tokens 的对比,能显示每次调用的缓存读取占比。对于长运行 Agent,这个比例偏低是本系列模型中最值得优先修复的成本问题。

GPT-5.6 的三种价格,到底该看哪一种

搜索 GPT-5.6 Luna 的价格,至少会看到三种不同数字;它们对某些层级而言都曾经或目前仍然正确。先确认报价对应的层级,绝大多数矛盾就能消除。

你看到的价格Luna 输入 / 输出对应含义
$0.20 / $1.20标准层级、短上下文普通 API 调用的默认价格
$0.10 / $0.60Batch 和 Flex 层级标准价格的一半,适合异步和低优先级任务
$0.40 / $2.40Fast mode标准价格的两倍
$1.00 / $6.007 月 30 日前的标准价格降价前的正确价格

同一份定价文档还列出了两个价格修饰条件:长上下文的输入按短上下文输入价的 2× 计费,输出按 1.5× 计费,因此 Luna 的长上下文价格是 $0.40 / $1.80,而不是 $0.40 / $2.40;此外,对于 2026-03-05 当日及以后发布的模型,符合条件的数据驻留端点价格上浮 10%,GPT-5.6 全系均在此范围内。

当定价页与实际账单不一致时,做两个检查即可:先看页面标注的核实日期,再以你实际调用的具体层级为准,对照官方定价文档。聚合平台和转售商也会发布自己的价格,那又是第三类情况:不是过时,而是价格体系不同。

在 AIReiter 上,三个 GPT-5.6 层级均按 OpenAI 标价的 50% 定价,并且跟随了 7 月 30 日的降价:GPT-5.6 Luna 为 $0.10 / $0.60,Terra 为 $1.00 / $6.00,Sol 为 $2.50 / $15.00;缓存输入和缓存写入同样按这一比例减半。

AIReiter 定价表,对比 GPT-5.6 Luna、Terra 和 Sol 的官方 API 价格与 AIReiter 价格

以一个每天消耗 100 万输入 token、20 万输出 token 的 Terra Agent 为例,官方标价下每天为 $4.40,在 AIReiter 则为 $2.20;调用相同,模型 ID 也相同。

Luna 在更广泛市场中的位置,则是另一个问题。根据 VentureBeat 于 7 月 30 日对 30 个模型的比较,Luna 的 $1.40 合计费率低于 Gemini 3.5 Flash-Lite($2.80)和 Gemini 3.1 Flash-Lite($1.75),但高于 DeepSeek v4-flash($0.42)。如果成本是唯一标准,最便宜的 LLM API并不来自 OpenAI。

常见问题

GPT-5.6 Sol 也降价了吗?

没有。Sol 的标准费率仍是每 100 万 token 输入 $5.00、输出 $30.00。它新增了 Fast mode,价格翻倍,换取最高 2.5× 吞吐量。

GPT-5.6 Luna 现在是最便宜的 API 模型吗?

不是。它每 100 万 token 输入加输出合计 $1.40,属于较便宜的前沿系列模型之一;但 VentureBeat 7 月 30 日的表格显示,DeepSeek v4-flash($0.42)、小米 MiMo-V2.5 Flash($0.40)和 DeepSeek v4-pro($1.305)都更低。

为什么有些页面上的 GPT-5.6 Luna 还是 $1 / $6?

这是 2026 年 7 月 30 日前的标准费率。请查看页面标注的核实日期,然后以实际调用层级为准,对照官方定价文档确认。

Batch 和 Flex 也适用这次降价吗?

适用。Batch 和 Flex 的价格为标准费率的一半,因此 Luna 在这两个层级的价格是 $0.10 / $0.60,Terra 是 $1.00 / $6.00;缓存输入和缓存写入也包括在内。

要拿到新价格,需要修改代码吗?

不需要。现有的 gpt-5.6-luna 和 gpt-5.6-terra 模型 ID 会直接适用降价,无需迁移。唯一值得优先调整的是审计缓存读取比例,因为降价最常在这里被抵消。

不同工作负载该选哪个层级

工作负载建议层级原因
高并发抽取、分类、摘要Luna两项测试任务均通过;每 100 万 token 合计 $1.40,现已低于 gpt-5.4-nano
对延迟敏感的面向用户调用Terra在抽取任务中实测快于 Luna(2.1s 对 3.5–4.0s)
Luna 达不到质量要求时的首次升级Terra合计 $14,对比 Sol 的 $35
Terra 在你的真实流量中可测量地表现不足的任务Sol这是承担 Terra 实测单任务成本 6 倍的唯一理由
任意层级的多轮 Agent先修复缓存缓存写入成本是读取的 12.5 倍;错误的前缀设计比模型层级选择影响更大

>_AIReiter 模型目录

快速访问与本指南相关的模型 API

GPT-5.6 Luna

Chat

一款均衡的 GPT-5.6 文本模型,适用于日常编码、写作和智能体工作流。

OpenAI获取 API Key >

GPT-5.6 Terra

Chat

一款更强大的 GPT-5.6 文本模型,适用于推理密集型的编码和分析任务。

OpenAI获取 API Key >

GPT-5.6 Sol

Chat

一款高级的 GPT-5.6 文本模型,适用于高要求的编程、推理和长篇 agent 工作。

OpenAI获取 API Key >

Gemini 3.1 Pro

Chat
Google获取 API Key >

Gemini 3 Pro

Chat
Google获取 API Key >

最新文章

Invalid API Key:修复前先判断 401 和 403 的真正原因

2026-07-31

解决 OpenRouter 429:服务商错误还是触发限流?

2026-07-31

DeepSeek V4 Flash vs GLM-5.2:实测 0731 更新

2026-07-31

B2B 广告情报只能从 HTML 挖:如何写一个扛得住改版的解析器

2026-07-31
AIREITER

有问题?请联系我们
[email protected]

LLM

Gemini 3.6 FlashGemini 3.1 ProKimi K3Gemini 3 ProGemini 2.5 Pro

AI 视频

Kling 3.0 Motion ControlSora 2 ProKling 3.0 TurboSora 2Kling 3.0

AI 图片

FLUX.2 ProGPT-Image 2Wan 2.7 Image ProGPT 4o ImageSeedream 5.0 Pro

博客

查看全部 →

公司

隐私政策服务条款退款政策

© 2026 AIReiter。保留所有权利。