GPT-6 Sol 和 GPT-6 Luna 的标价看起来很简单:Sol 每百万输入 token 2 美元、每百万输出 token 10 美元;Luna 则分别是 0.10 美元和 0.50 美元。真正让账单变复杂的,是缓存、超长提示词、推理强度,以及任务失败后的重试。大规模抽取和路由任务可以先用 Luna;常规 API 工作,Sol 是更均衡的默认选择;而当一次多步骤任务失败的代价高于节省下来的 token 费用时,应该保留 Astra。
模型怎么选,关键不只是 token 单价
GPT-6 Sol 和 GPT-6 Luna 是 OpenAI 于 2026 年 9 月 22 日发布的商业 API 模型。OpenAI 将 Sol 定位为更强的通用模型,将 Luna 定位为适合专注、重复性工作的高效率模型。根据 GPT-6 模型文档,两者都支持 1.05 million-token 上下文窗口,最大输出为 128,000 token。
实际选型可以先按下面的方式划分:
| 工作负载 | 建议起点 | 原因 |
|---|---|---|
| 分类、抽取、路由、摘要 | GPT-6 Luna | 公开 token 价格最低,吞吐量高 |
| 编码智能体、工具调用、混合型生产流量 | GPT-6 Sol | 价格远低于 Astra,同时不会降到 Luna 的质量档位 |
| 对失败敏感的复杂多步骤任务 | GPT-6 Astra | OpenAI 自己的图表仍显示,Astra 在最高努力级别下的得分高于 Sol 和 Luna |
这是一种路由策略,并不意味着最便宜的模型总能带来最低的完成任务成本。如果模型需要重试、漏掉字段,或者错误调用工具,原本可观的 token 折扣很快就会被抵消。
GPT-6 Sol 和 Luna API 定价逐项拆解
下表采用 OpenAI API 定价文档公布的标准价格,单位均为每百万 token。
| 计费项目 | GPT-6 Sol | GPT-6 Luna |
|---|---|---|
| 输入 | $2.00 | $0.10 |
| 缓存输入 | $0.20 | $0.01 |
| 写入缓存 | $2.50 | $0.125 |
| 输出 | $10.00 | $0.50 |
| 超过 272K token 的输入 | $4.00 | $0.20 |
| 超过 272K token 的输出 | $15.00 | $0.75 |
| Batch/Flex 输入 | $1.00 | $0.05 |
| Batch/Flex 输出 | $5.00 | $0.25 |
| Fast 模式输入 | $4.00 | $0.20 |
| Fast 模式输出 | $20.00 | $1.00 |
API 模型 ID 分别是 gpt-6-sol 和 gpt-6-luna。两者都可通过 Responses 和 Chat Completions 使用,具体功能差异则以各自模型页面的说明为准。如果应用依赖启用推理的工具调用,切换模型 ID 之前要先确认 endpoint 与 effort 的组合;兼容性本身就是迁移成本的一部分。
与 GPT-5.6 公布的促销价格相比,Sol 从 4/20 美元降至 2/10 美元;Luna 则从 0.20/1.20 美元降至 0.10/0.50 美元。输入和缓存输入价格都正好减半,Luna 的输出价格降幅则超过一半。OpenAI 在发布对比中称,新价格比 GPT-5.6 促销价格低 50%,因此这组比较应视为带有时间背景的参考。
哪些因素会改变最终账单
表面上的单价之下,有三个生产环境中必须重点关注的计费因素。
长上下文能用,但并不便宜
单次请求的输入 token 超过 272,000 后,整次请求会按更高的长上下文价格计费。上下文窗口虽然达到 1.05 million token,但更大的窗口并不是免费额度。以 Sol 为例,一次包含 300,000 个输入 token 和 20,000 个输出 token 的请求,输入成本约为 $1.20,输出成本约为 $0.30,其他调整前合计约 $1.50。使用 Luna 时,则约为 $0.06 加 $0.015,合计约 $0.075。
重复使用后,缓存才真正省钱
写入缓存的价格高于普通输入 token:Sol 每百万 token 为 $2.50,Luna 为 $0.125。读取缓存的价格则是普通输入价格的 10%。如果多个请求复用稳定的系统提示词,第一次写入之后,后续读取成本会低得多;但对于一次性提示词,启用缓存本身并不会自动省钱。
OpenAI 还表示,GPT-6 的缓存对推理强度、工具配置等变化更加宽容。但不要假设所有看起来相似的请求都能共享前缀,实际缓存命中率仍需要测量。
Batch 和 Fast 模式解决的是相反的问题
Batch 和 Flex 将标准输入、输出价格都减半,适合离线分类、批量抽取,以及不要求立即返回结果的评测任务。Fast 模式则会让标准价格翻倍:它买的是延迟,不是折扣。
例如,一项包含 10 million Luna 输入 token 和 1 million 输出 token 的 Batch 任务,成本为 $0.50 + $0.25 = $0.75。同样的标准任务成本为 $1.00 + $0.50 = $1.50。如果使用 Fast 模式,同样的 token 数量将花费 $3.00。
Luna、Sol 和 Astra,应该怎么选
对于大规模任务队列,GPT-6 Luna 是值得优先测试的选择。Digital Applied 汇总的发布数据表明,Luna 在 OpenAI 的智能体基准测试中最高得分低于 Sol,但单任务成本却低得多。在该厂商报告的表格中,Luna 以最高努力级别运行时,在 DeepSWE 上达到 66.6%,单任务成本为 $0.22;Sol 则达到 68.8%,单任务成本为 $2.74。这些并不是适用于所有场景的固定价格——实际账单取决于提示词和重试策略——但足以说明 Luna 为什么适合路由和后台任务。
GPT-6 Sol 是更稳妥的通用 API 起点。Capital & Compute 的报告称,Sol 与 Claude Sonnet 5 的公开价格完全相同:输入 $2、输出 $10、缓存输入 $0.20。该报告的独立 Intelligence Index 对比更看好 Sol,但同一页面也提醒,综合基准测试并不能衡量模型与具体 harness 的适配程度。当工具使用、编码能力和输出完整性足够重要,以至于 Luna 的低价错误反而会带来更高成本时,就应该使用 Sol。
GPT-6 Astra 仍然适合作为升级路径。OpenAI 自己的最高努力级别表格显示,Astra 在 AutomationBench、Agents’ Last Exam、FrontierCode、DeepSWE 和 OSWorld 上都领先于 Sol,同时事实错误率更低。这些是厂商测试结果,并不能保证适合你的工作负载,但足以支持这样一种做法:把 Astra 放在由失败触发的备用路径上,而不是让每个请求都直接使用它。
一场真实用户讨论说明了备用路径为什么重要。在一条讨论 Luna 6 与 Luna 5.6 的 Reddit 帖子中,u/AdmiralMcNugget 写道:“它回答的是你问的问题。你应该问你真正想知道的问题:‘哪些项目符合这个标准?’”(讨论串)。这只是单个用户的体验,不是基准测试结果,但它指出了一个值得加入生产评测的检查项:模型返回的是所要求的列表,还是仅仅给出了一个技术上正确的摘要。
目前的早期证据究竟说明了什么
现有证据足以支持“成本明显下降”的判断,但对能力提升则需要更谨慎。
OpenAI 的发布材料称,Sol 和 Luna 的价格低于 GPT-5.6,并将 Astra 定位为顶级模型。Digital Applied 对发布图表的分析发现,在两张被引用的图表——DeepSWE 和 OSWorld——中,GPT-5.6 Sol 的得分仍高于 GPT-6 Sol,尽管在报告所采用的设置下,新模型的单任务成本更低。Capital & Compute 同样提醒,厂商基准测试所使用的 harness 与独立基准测试的 harness 并不能自动进行横向比较。
被引用的讨论中,早期用户反馈并不一致。一些 API 用户表示,更低的价格让 Luna 更适合自己的场景;另一些用户则反馈,Luna 的回答更短、更不完整,需要投入更多提示词工作。反复出现的实际问题不是“哪个模型赢了”,而是“考虑重试、漏字段和工具调用失败后,更低的 token 账单是否仍然成立?”
建议先进行一轮小规模留出评测,至少记录三个指标:已完成任务成本、需要后续追问的比例,以及关键错误率。将最高努力级别的 Luna、xhigh 或 max 的 Sol 与当前模型进行对比。基准条件要保持不变;如果同时修改提示词和 effort 设置,结果会很难解释。
GPT-6 Sol 和 Luna API 常见问题
GPT-6 Sol 的 API 价格是多少?
GPT-6 Sol 的输入价格为每百万 token $2,缓存输入价格为每百万 token $0.20,输出价格为每百万 token $10。写入缓存的价格为每百万 token $2.50。
GPT-6 Luna 的 API 价格是多少?
GPT-6 Luna 的输入价格为每百万 token $0.10,缓存输入价格为每百万 token $0.01,输出价格为每百万 token $0.50。写入缓存的价格为每百万 token $0.125。
编码智能体应该选 GPT-6 Sol 还是 Luna?
如果编码质量和工具调用可靠性很重要,建议先从 Sol 开始。对于后台子智能体和重复性任务,则可以测试 Luna,尤其是在更低的完成任务成本比前沿能力更重要时。
GPT-6 Sol 和 Luna 是否有长上下文价格?
有。输入 token 超过 272,000 后,公开价格会变为 Sol 输入/输出 $4/$15,Luna 输入/输出 $0.20/$0.75。整次请求都适用长上下文计费规则。
Batch 和 Flex 更便宜吗?
是的。OpenAI 对 Batch 或 Flex 处理列出的输入和输出价格,都是标准价格的一半。它们适合可以等待处理完成的任务,而不是交互式请求。
我应该先用哪个模型?
大规模结构化任务先用 Luna;大多数生产 API 流量使用 Sol;当一次失败运行的代价高于价格差异时,再使用 Astra。最终应根据自己的完成任务成本验证路由策略,而不是只看 token 单价。
实际落地建议
先把可预测、高流量的任务迁移到 GPT-6 Luna。针对编码和工具密集型流量,在同一套接口后接入 GPT-6 Sol,同时保留 GPT-6 Astra 作为升级路径。这样的三层架构既能利用价格下降,也不会误以为更便宜的 token 必然意味着更低的结果成本。