AIREITER

GPT-5.6 Luna vs GPT-5.4 Mini:现在谁更便宜?

最后更新: 2026-07-31 03:30:06

2026 年 7 月 30 日,OpenAI 将 GPT-5.6 Luna 的 API 价格下调约 80%:从发布时的 $1/$6,降至每百万 tokens 输入 $0.20 / 输出 $1.20。按这个价格算,Luna 比 GPT-5.4 mini($0.75/$4.50)便宜约 73%;在我们实际跑过的编程与推理提示词中,两者的答案质量也基本打平。不过 mini 仍有一项明确优势:响应速度大约快一倍。因此,只有对延迟极其敏感的工作负载,才更适合继续选择这款较早推出的小模型。

7 月 30 日的降价,彻底改写了两者的性价比

GPT-5.6 Luna 于 2026 年 7 月 9 日正式可用,定价为每百万 tokens $1/$6。它在 GPT-5.6 family 中定位为高性价比档位,但当时仍明显贵于 OpenAI 的低价 gpt-5.4-mini($0.75/$4.50)。大约三周后,OpenAI 在 7 月 30 日将 Luna 的价格下调约 80% 至 $0.20/$1.20,同时将 GPT-5.6 Terra 下调约 20% 至 $2/$12。如今 Luna 与 gpt-5.4-nano($0.20/$1.25)处于同一价格带:nano 的价格,却是当代模型的能力底子。

如果你看到 Luna 仍标为 $1/$6,那是它的发布价,已于 2026 年 7 月 30 日失效。目前 Standard 档价格为 $0.20/$1.20,核实日期为 2026 年 7 月 31 日。

在 1000 万输入加 100 万输出的工作负载下,Luna、mini 与 nano 的成本对比反转

按标价比较:Luna 对阵 mini

按当前 Standard 档定价,无论提示词长短,Luna 的输入和输出单价都低于 mini。此外,Luna 的上下文窗口为 1,050K,而 mini 只有 400K。

模型(Standard,每 1M tokens)输入缓存输入输出上下文
gpt-5.6-luna(短上下文)$0.20$0.02$1.201,050K
gpt-5.6-luna(长上下文,>200K)$0.40$0.04$1.801,050K
gpt-5.4-mini$0.75$0.075$4.50400K

来源:developers.openai.com/api/docs/pricing,核实于 2026-07-31。作为参照,gpt-5.4-nano 的标价为 $0.20/$1.25,与 Luna 目前处于同一价格带。

以中等规模的 1000 万输入加 100 万输出计算,Luna 成本为$3.20,mini 则为$12.00(nano 为 $3.25)。若降至 100 万输入加 100 万输出,则分别是 $1.40 和 $5.25。Luna 的输入超过 200K tokens 后价格会翻倍,长上下文价格为 $0.40/$1.80;即便如此,仍低于 mini 固定的 $0.75/$4.50。mini 没有长上下文分档,其 400K 窗口统一按短上下文价格计费。想了解整个产品家族的定价细分,可参考 GPT-5.6 pricing guide。

OpenAI 开发者定价页面,显示 gpt-5.6-luna 输入 $0.20、输出 $1.20,核实于 2026-07-31

同一提示词实测:质量、tokens 与响应速度

我们通过同一个 API endpoint,向两个模型发送完全相同的提示词:一道编程题,要求返回最长有效括号子串的长度;以及一道推理题,即井中蜗牛问题,连续运行三次。两个模型都正确解决了所有任务:括号题均给出相同的基于栈的算法,蜗牛题三次均回答“28 天”。差别不在正确性,而在速度和输出篇幅。

质量与正确性:基本持平

在编程提示词上,Luna 和 mini 都给出了功能等价的 O(n) 栈解法,使用哨兵基准索引,均无错误。推理题中,两者都得出正确答案 28 天,也都正确指出蜗牛会在第 28 天逃出井口,不会再下滑。就这两项基础任务而言,两者可以视为平手;我们没有进一步用更高难度的推理任务做压力测试。

速度与延迟:mini 明显更快

从完整响应时间来看,mini 大约快一倍。三次推理测试中,mini 平均约为 ~2.8s,Luna 为 ~5.5s;唯一一次编程测试中,mini 用时 4.0s,Luna 为 4.6s。Luna 花费更多时间,与其更长的输出相对应:推理任务中 Luna 输出 168 tokens,mini 为 76。它更倾向于给出完整推导,而非快速作答。

“如果使用 medium thinking,它基本和 5.4 mini 一样快,而且推理非常好,像是高于 5.4 的水平。”—— r/codex,“GPT-5.6 Luna is really underrated”讨论帖

在默认设置下,mini 的响应更快。

单次任务成本:Luna 仍然更低

Luna 虽然输出更长,但更低的单价足以抵消这一点。在推理提示词中,Luna 平均输出 168 个 tokens,mini 为 76 个;按当前价格计算,Luna 这次回答的成本约为$0.001,mini 则约为$0.004。这些数据属于不足一美分、样本量为个位数的单次测试结果(于 2026-07-31 通过 AIReiter API 测试,使用 gpt-5.6-luna 与 gpt-5.4-mini、默认 effort、美国 endpoint;时间为完整响应的 wall-clock 时间,token 数为 API 报告的 completion tokens),因此应视为趋势参考,而不是基准测试。不过方向非常明确:每个正确答案的成本,Luna 更低。

“谁更聪明”的基准争议,主要是设置没对齐

从原始成绩来看,Luna 在编程和推理项目上均超过 mini:SWE-Bench Pro 为 62.7 对 54.4,GPQA Diamond 为 92.3 对 88.0,Toolathlon 为 53.4 对 42.9(成绩来自 OpenAI 的模型 scorecards)。唯一经常被引用、且结论相反的结果来自 Artificial Analysis 的 Intelligence Index:GPT-5.4 得分 51,Luna 为 46。但该指数比较的是 high effort 下运行的 Luna,以及 xhigh effort 下运行的 GPT-5.4。两边推理预算不同,并非公平对比。

基准测试GPT-5.6 LunaGPT-5.4 mini说明
SWE-Bench Pro62.754.4Luna 更高
GPQA Diamond92.388.0Luna 更高
MMMU Pro78.476.6接近
Toolathlon53.442.9Luna 更高
Terminal-Bench84.7 (v2.1)60.0 (v2.0)版本不同
OSWorld45.6 (v2.0)72.1 (Verified)测试协议不同

成绩汇总自 OpenAI 公开的模型 scorecards,并与 docsbot.ai 进行了交叉核对。

解读这些数据时有两个重要前提。第一是 effort 档位:mini 提供 None / Low / Medium / High / XHigh 的精细调节,而 Luna 默认采用高推理档位。因此,将 mini 调至 xhigh,再与默认状态的 Luna 比较,会抬高 mini 的表面成绩。第二,表中的项目并不完全可比。docsbot.ai 指出,Terminal-Bench 和 OSWorld 的数据混用了不同基准版本及协议;这也解释了为何 mini 的 OSWorld 72.1 会高于 Luna 的 45.6——两者实际测试的内容存在细微差异。

除分数以外,Luna 的知识截止日期为 2026 年 2 月,mini 为 2025 年 8 月;Luna 的上下文窗口为 1.05M,mini 则为 400K。

“Luna 贵 96%”的讨论已经过时

一项广泛传播的 OpenAI community test 曾发现,在六轮对话中,Luna 的单次成本比 mini 高出 96%。这个数字本身真实,但它出现于降价前:测试于 7 月 11 日进行,当时 Luna 的价格仍为 $1/$6。而且成本差距的大部分来自测试应用中的缓存失效 bug,并非模型本身。作者停止在每一轮修改顶层 instructions 后,Luna 的溢价降至 16.7%,同时其速度快了 9.9%,盲评质量分也更高(4.80 对 4.28)。

在当前 $0.20/$1.20 的价格下,即使不考虑缓存,Luna 也已比 mini 更便宜,因此缓存不再会左右 Luna 与 mini 之间的选择。不过,对于成本优化而言,缓存机制仍值得了解:OpenAI 对缓存写入按输入价格的 1.25× 计费(Luna 目前为 $0.25/M),缓存读取则有 90% 折扣,且缓存最短存活时间为 30 分钟。如果应用每轮都重写 system prompt,缓存前缀就会失效,计费会从读取价变为写入价。这正是 96% 数字背后的陷阱。

到底该调用哪一个

对于大多数工作负载,如今答案是 Luna:无论哪种上下文档位都更便宜,质量相当或更好,知识截止日期更新,上下文窗口也大 2.6×。只有在延迟是硬约束,或需要 Luna 未提供的 effort 精细控制时,才应优先选 mini。

你的需求推荐原因
每个正确答案的最低成本Luna$0.20/$1.20,比 mini 低约 73%
最低延迟mini端到端约快 ~2×(推理任务约为 ~2.8s 对 ~5.5s)
精细控制 None/XHigh effortminiLuna 仅提供 high-tier
超过 400K tokens 的提示词Luna1.05M 窗口;mini 上限为 400K
最简洁的输出mini在相同任务中输出的 tokens 约为一半

一个实用的路由方案是:在 mini 的低延迟优势重要时默认使用 mini;在质量和上下文窗口更关键时,使用 Luna 处理升级任务和长上下文任务。两者都可通过统一 API 调用,模型名分别为 gpt-5.6-luna 和 gpt-5.4-mini;例如可使用 AIReiter GPT-5.6 Luna endpoint。还要注意一个路由陷阱:旗舰版 Sol 的价格为 $5/$30,约是 Luna 的 25×。如果你的 endpoint 将不带后缀的 gpt-5.6 id 别名指向 Sol,请明确固定使用完整的 gpt-5.6-luna id。

常见问题

GPT-5.6 Luna 比 GPT-5.4 mini 便宜吗?

是的,按当前价格约便宜 73%。在 2026 年 7 月 30 日降价后,Luna 的每百万 tokens 输入/输出价格为 $0.20 / $1.20,而 mini 为 $0.75 / $4.50,输入和输出两端都是如此。

GPT-5.6 Luna 比 5.4 mini 更快还是更慢?

更慢。在我们的同提示词测试中,mini 大约快 2×:推理任务中 mini 平均约为 ~2.8s,Luna 为 ~5.5s。Luna 以速度换取更完整的推理;调低其 effort 可以缩小差距。

GPT-5.6 Luna 会取代 mini 档位吗?

不会。Luna 是 GPT-5.6 这一代中的高性价比档位;gpt-5.4-mini 则是一款独立、较早推出的小模型,目前仍在销售并继续获得支持。

GPT-5.4 nano 与 Luna,哪个更便宜?

实际几乎持平。Luna 为 $0.20/$1.20,nano 为 $0.20/$1.25。Luna 的输出价格略低,并且更新一代,知识截止日期也更晚。

Luna 和 mini 分别何时发布?

Luna 于 2026 年 7 月 9 日发布,并于 2026 年 7 月 30 日降至当前价格。GPT-5.4 mini 于 2026 年 3 月 17 日发布。

资料来源