2026 年 7 月 30 日,OpenAI 将 GPT-5.6 Luna 的 API 价格下调约 80%:从发布时的 $1/$6,降至每百万 tokens 输入 $0.20 / 输出 $1.20。按这个价格算,Luna 比 GPT-5.4 mini($0.75/$4.50)便宜约 73%;在我们实际跑过的编程与推理提示词中,两者的答案质量也基本打平。不过 mini 仍有一项明确优势:响应速度大约快一倍。因此,只有对延迟极其敏感的工作负载,才更适合继续选择这款较早推出的小模型。
7 月 30 日的降价,彻底改写了两者的性价比
GPT-5.6 Luna 于 2026 年 7 月 9 日正式可用,定价为每百万 tokens $1/$6。它在 GPT-5.6 family 中定位为高性价比档位,但当时仍明显贵于 OpenAI 的低价 gpt-5.4-mini($0.75/$4.50)。大约三周后,OpenAI 在 7 月 30 日将 Luna 的价格下调约 80% 至 $0.20/$1.20,同时将 GPT-5.6 Terra 下调约 20% 至 $2/$12。如今 Luna 与 gpt-5.4-nano($0.20/$1.25)处于同一价格带:nano 的价格,却是当代模型的能力底子。
如果你看到 Luna 仍标为 $1/$6,那是它的发布价,已于 2026 年 7 月 30 日失效。目前 Standard 档价格为 $0.20/$1.20,核实日期为 2026 年 7 月 31 日。
按标价比较:Luna 对阵 mini
按当前 Standard 档定价,无论提示词长短,Luna 的输入和输出单价都低于 mini。此外,Luna 的上下文窗口为 1,050K,而 mini 只有 400K。
| 模型(Standard,每 1M tokens) | 输入 | 缓存输入 | 输出 | 上下文 |
|---|---|---|---|---|
| gpt-5.6-luna(短上下文) | $0.20 | $0.02 | $1.20 | 1,050K |
| gpt-5.6-luna(长上下文,>200K) | $0.40 | $0.04 | $1.80 | 1,050K |
| gpt-5.4-mini | $0.75 | $0.075 | $4.50 | 400K |
来源:developers.openai.com/api/docs/pricing,核实于 2026-07-31。作为参照,gpt-5.4-nano 的标价为 $0.20/$1.25,与 Luna 目前处于同一价格带。
以中等规模的 1000 万输入加 100 万输出计算,Luna 成本为$3.20,mini 则为$12.00(nano 为 $3.25)。若降至 100 万输入加 100 万输出,则分别是 $1.40 和 $5.25。Luna 的输入超过 200K tokens 后价格会翻倍,长上下文价格为 $0.40/$1.80;即便如此,仍低于 mini 固定的 $0.75/$4.50。mini 没有长上下文分档,其 400K 窗口统一按短上下文价格计费。想了解整个产品家族的定价细分,可参考 GPT-5.6 pricing guide。
同一提示词实测:质量、tokens 与响应速度
我们通过同一个 API endpoint,向两个模型发送完全相同的提示词:一道编程题,要求返回最长有效括号子串的长度;以及一道推理题,即井中蜗牛问题,连续运行三次。两个模型都正确解决了所有任务:括号题均给出相同的基于栈的算法,蜗牛题三次均回答“28 天”。差别不在正确性,而在速度和输出篇幅。
质量与正确性:基本持平
在编程提示词上,Luna 和 mini 都给出了功能等价的 O(n) 栈解法,使用哨兵基准索引,均无错误。推理题中,两者都得出正确答案 28 天,也都正确指出蜗牛会在第 28 天逃出井口,不会再下滑。就这两项基础任务而言,两者可以视为平手;我们没有进一步用更高难度的推理任务做压力测试。
速度与延迟:mini 明显更快
从完整响应时间来看,mini 大约快一倍。三次推理测试中,mini 平均约为 ~2.8s,Luna 为 ~5.5s;唯一一次编程测试中,mini 用时 4.0s,Luna 为 4.6s。Luna 花费更多时间,与其更长的输出相对应:推理任务中 Luna 输出 168 tokens,mini 为 76。它更倾向于给出完整推导,而非快速作答。
“如果使用 medium thinking,它基本和 5.4 mini 一样快,而且推理非常好,像是高于 5.4 的水平。”—— r/codex,“GPT-5.6 Luna is really underrated”讨论帖
在默认设置下,mini 的响应更快。
单次任务成本:Luna 仍然更低
Luna 虽然输出更长,但更低的单价足以抵消这一点。在推理提示词中,Luna 平均输出 168 个 tokens,mini 为 76 个;按当前价格计算,Luna 这次回答的成本约为$0.001,mini 则约为$0.004。这些数据属于不足一美分、样本量为个位数的单次测试结果(于 2026-07-31 通过 AIReiter API 测试,使用 gpt-5.6-luna 与 gpt-5.4-mini、默认 effort、美国 endpoint;时间为完整响应的 wall-clock 时间,token 数为 API 报告的 completion tokens),因此应视为趋势参考,而不是基准测试。不过方向非常明确:每个正确答案的成本,Luna 更低。
“谁更聪明”的基准争议,主要是设置没对齐
从原始成绩来看,Luna 在编程和推理项目上均超过 mini:SWE-Bench Pro 为 62.7 对 54.4,GPQA Diamond 为 92.3 对 88.0,Toolathlon 为 53.4 对 42.9(成绩来自 OpenAI 的模型 scorecards)。唯一经常被引用、且结论相反的结果来自 Artificial Analysis 的 Intelligence Index:GPT-5.4 得分 51,Luna 为 46。但该指数比较的是 high effort 下运行的 Luna,以及 xhigh effort 下运行的 GPT-5.4。两边推理预算不同,并非公平对比。
| 基准测试 | GPT-5.6 Luna | GPT-5.4 mini | 说明 |
|---|---|---|---|
| SWE-Bench Pro | 62.7 | 54.4 | Luna 更高 |
| GPQA Diamond | 92.3 | 88.0 | Luna 更高 |
| MMMU Pro | 78.4 | 76.6 | 接近 |
| Toolathlon | 53.4 | 42.9 | Luna 更高 |
| Terminal-Bench | 84.7 (v2.1) | 60.0 (v2.0) | 版本不同 |
| OSWorld | 45.6 (v2.0) | 72.1 (Verified) | 测试协议不同 |
成绩汇总自 OpenAI 公开的模型 scorecards,并与 docsbot.ai 进行了交叉核对。
解读这些数据时有两个重要前提。第一是 effort 档位:mini 提供 None / Low / Medium / High / XHigh 的精细调节,而 Luna 默认采用高推理档位。因此,将 mini 调至 xhigh,再与默认状态的 Luna 比较,会抬高 mini 的表面成绩。第二,表中的项目并不完全可比。docsbot.ai 指出,Terminal-Bench 和 OSWorld 的数据混用了不同基准版本及协议;这也解释了为何 mini 的 OSWorld 72.1 会高于 Luna 的 45.6——两者实际测试的内容存在细微差异。
除分数以外,Luna 的知识截止日期为 2026 年 2 月,mini 为 2025 年 8 月;Luna 的上下文窗口为 1.05M,mini 则为 400K。
“Luna 贵 96%”的讨论已经过时
一项广泛传播的 OpenAI community test 曾发现,在六轮对话中,Luna 的单次成本比 mini 高出 96%。这个数字本身真实,但它出现于降价前:测试于 7 月 11 日进行,当时 Luna 的价格仍为 $1/$6。而且成本差距的大部分来自测试应用中的缓存失效 bug,并非模型本身。作者停止在每一轮修改顶层 instructions 后,Luna 的溢价降至 16.7%,同时其速度快了 9.9%,盲评质量分也更高(4.80 对 4.28)。
在当前 $0.20/$1.20 的价格下,即使不考虑缓存,Luna 也已比 mini 更便宜,因此缓存不再会左右 Luna 与 mini 之间的选择。不过,对于成本优化而言,缓存机制仍值得了解:OpenAI 对缓存写入按输入价格的 1.25× 计费(Luna 目前为 $0.25/M),缓存读取则有 90% 折扣,且缓存最短存活时间为 30 分钟。如果应用每轮都重写 system prompt,缓存前缀就会失效,计费会从读取价变为写入价。这正是 96% 数字背后的陷阱。
到底该调用哪一个
对于大多数工作负载,如今答案是 Luna:无论哪种上下文档位都更便宜,质量相当或更好,知识截止日期更新,上下文窗口也大 2.6×。只有在延迟是硬约束,或需要 Luna 未提供的 effort 精细控制时,才应优先选 mini。
| 你的需求 | 推荐 | 原因 |
|---|---|---|
| 每个正确答案的最低成本 | Luna | $0.20/$1.20,比 mini 低约 73% |
| 最低延迟 | mini | 端到端约快 ~2×(推理任务约为 ~2.8s 对 ~5.5s) |
| 精细控制 None/XHigh effort | mini | Luna 仅提供 high-tier |
| 超过 400K tokens 的提示词 | Luna | 1.05M 窗口;mini 上限为 400K |
| 最简洁的输出 | mini | 在相同任务中输出的 tokens 约为一半 |
一个实用的路由方案是:在 mini 的低延迟优势重要时默认使用 mini;在质量和上下文窗口更关键时,使用 Luna 处理升级任务和长上下文任务。两者都可通过统一 API 调用,模型名分别为 gpt-5.6-luna 和 gpt-5.4-mini;例如可使用 AIReiter GPT-5.6 Luna endpoint。还要注意一个路由陷阱:旗舰版 Sol 的价格为 $5/$30,约是 Luna 的 25×。如果你的 endpoint 将不带后缀的 gpt-5.6 id 别名指向 Sol,请明确固定使用完整的 gpt-5.6-luna id。
常见问题
GPT-5.6 Luna 比 GPT-5.4 mini 便宜吗?
是的,按当前价格约便宜 73%。在 2026 年 7 月 30 日降价后,Luna 的每百万 tokens 输入/输出价格为 $0.20 / $1.20,而 mini 为 $0.75 / $4.50,输入和输出两端都是如此。
GPT-5.6 Luna 比 5.4 mini 更快还是更慢?
更慢。在我们的同提示词测试中,mini 大约快 2×:推理任务中 mini 平均约为 ~2.8s,Luna 为 ~5.5s。Luna 以速度换取更完整的推理;调低其 effort 可以缩小差距。
GPT-5.6 Luna 会取代 mini 档位吗?
不会。Luna 是 GPT-5.6 这一代中的高性价比档位;gpt-5.4-mini 则是一款独立、较早推出的小模型,目前仍在销售并继续获得支持。
GPT-5.4 nano 与 Luna,哪个更便宜?
实际几乎持平。Luna 为 $0.20/$1.20,nano 为 $0.20/$1.25。Luna 的输出价格略低,并且更新一代,知识截止日期也更晚。
Luna 和 mini 分别何时发布?
Luna 于 2026 年 7 月 9 日发布,并于 2026 年 7 月 30 日降至当前价格。GPT-5.4 mini 于 2026 年 3 月 17 日发布。
资料来源
- 当前定价(核实于 2026-07-31):developers.openai.com/api/docs/pricing
- GPT-5.6 发布信息、产品家族档位和缓存写入政策:openai.com/index/gpt-5-6/
- 受控多轮成本测试(降价前):community.openai.com
- 基准测试与能力汇总:artificialanalysis.ai、docsbot.ai