AIREITER

GPT-6.1 Sol API 价格评测:到底改了什么

最后更新: 2026-09-30 00:23:57

GPT-6.1 Sol 已通过 API、Codex 和 ChatGPT Work 上线,但它的核心优势其实没有发布口号听起来那么全面。API 标准价格仍是每百万输入 token $2、每百万输出 token $10;相比 GPT-6 Sol,真正有意义的变化是缓存输入降到了每百万 token $0.10。OpenAI 公布的基准结果显示,Sol 6.1 很适合拿来做编程和计算机操作方向的试点,但这些数据仍主要来自厂商自身,暂时不足以支持直接切换生产环境。

GPT-6.1 Sol 到底改了什么

GPT-6.1 Sol 是 OpenAI 于 September 29, 2026 发布的模型,API 标识符为 gpt-6.1-sol。OpenAI 将它定位为面向智能体编程、计算机操作、文档处理以及其他多步骤专业任务的模型。官方模型文档显示,它支持 1.05-million-token 上下文窗口、推理、工具和图像输入。

它的可用范围也很关键。模型目前面向 API、Codex 和 ChatGPT Work,但发布时并未开放给普通 ChatGPT 对话。所以这首先是一款面向开发者和工作型智能体的产品,而不是一次普通的 ChatGPT 升级。

早期用户反馈并不一致,因此不能拿来替代固定任务测试。在r/OpenAI 讨论中,u/Foreign_Helicopter24 分享了一次低成本且成功的使用结果;而 u/shuwatto 则表示,在一项 PCB 任务中,Opus 5.5 的表现优于 Astra。这些都只是个人体验,不是受控测试。

GPT-6.1 Sol API 价格:真正发生变化的地方

以下标准费率来自OpenAI 价格文档,发布当天的多家报道也给出了相同数据。它们适用于短上下文价格档位内的请求。

计费项目GPT-6.1 SolGPT-6 SolGPT-6 Astra
输入 / 每 1M tokens$2.00$2.00$10.00
缓存输入 / 每 1M tokens$0.10$0.20$1.00
缓存写入 / 每 1M tokens$2.50$2.50$12.50
输出 / 每 1M tokens$10.00$10.00$50.00

真正值得比较的,并不是“Sol 6.1 全面比 Sol 6 便宜”。普通输入和输出价格都没有变化,唯一例外是缓存输入:GPT-6.1 Sol 将 GPT-6 Sol 的 $0.20 费率减半,同时比自身的标准输入价格低 95%。

举个例子:如果一次请求包含 100,000 个缓存输入 token、10,000 个普通输入 token 和 5,000 个输出 token,在不计算缓存写入、工具调用、重试和人工审核的情况下,成本约为 $0.08:

  1. 缓存输入:100,000 × $0.10 / 1,000,000 = $0.01。
  2. 普通输入:10,000 × $2 / 1,000,000 = $0.02。
  3. 输出:5,000 × $10 / 1,000,000 = $0.05。

同样的示例配比,在 GPT-6 Sol 上约为 $0.09,在 GPT-6 Astra 上约为 $0.45。这只是价格表计算示例,不代表实际生产运行结果。

长提示词会改变计算方式。根据OpenAI 价格页面,输入 token 超过 272,000 后,费率会提高到每百万输入 token $4、每百万缓存输入 token $0.20,以及每百万输出 token $15。更高费率适用于整个请求,因此面对 300,000-token 的提示词时,不能只按 headline $2/$10 价格来做预算。

缓存只有在可复用的前缀确实符合供应商的缓存规则时才有价值。稳定的系统指令、工具定义和反复出现的策略文本都适合缓存;如果每次请求都改写开头部分,预期中的节省可能就不存在了。

现有基准能说明什么,又不能说明什么

厂商公布的基准结果适合用来选择试点方向,但不能据此宣称它在所有场景都更强。

评测项目GPT-6.1 Sol 结果真正值得关注的对比
DeepSWE v1.1高推理强度下 75.2%与 GPT-6 Astra 大致持平;比报告表格中的 GPT-6 Sol 高 6.4 个百分点
OSWorld 2.0 offline最高推理强度下 71.4%落后 Astra 约 2.1 个百分点,但报告中的单任务成本低得多
AutomationBench最高推理强度下 36.1%;中等推理强度下 35.4%低于 Astra 的 41.4% 峰值,也低于部分更高推理强度下的 Claude 结果
Terminal-Bench Science 0.1最高推理强度下 57.0%落后 Astra 的 68.1%;但仍超过报告中的 GPT-6 Sol 结果两倍

编程是 GPT-6.1 Sol 最有说服力的应用方向。BitsMinds 报告称,GPT-6.1 Sol 完成每个 DeepSWE 任务的成本为 $0.65,Astra 则为 $4.43;在其选定的对比中,两者得分分别为 75.2% 和 74.1%。这组成本与性能数据很有吸引力,但分数和成本都来自发布材料,而不是独立复测。

计算机操作也体现出类似的性价比优势,但还谈不上稳稳赢下:发布数据显示,GPT-6.1 Sol 在 OSWorld 2.0 上的成绩为 71.4%,Astra 为 73.5%,报告中的单任务成本分别是 $1.27 和 $9.44。业务自动化则是需要特别谨慎的地方。同一个模型可能在某个推理强度下胜过竞争对手,在另一个推理强度下却落败,因此“接近 Astra”不能理解成“适合所有工作流”。

OpenAI 报告称,在低推理强度下,GPT-6.1 Sol 的事实错误率从 GPT-6 Sol 的 11.4% 降至 7.7%。这意味着下降了 3.7 个百分点,但仅凭该来源,无法判断它在你的文档、工具或审批规则上的实际表现。

API 集成需要注意什么

即使接口接受新的模型标识符,只改模型名也可能导致集成失败。

  • 模型 ID: gpt-6.1-sol。
  • 推理强度: OpenAI 模型文档列出了 low、medium、high、xhigh 和 max;不支持 none 和 minimal。
  • 工具调用: OpenAI 模型文档显示,工具调用需要使用 Responses API。不带工具的请求仍可使用 Chat Completions。
  • 上下文价格:超过 272K token 后,价格档位会发生变化。
  • 输出上限: 开发者文档列出的最高输出长度为 128,000 tokens。
  • 模态:同一份规格列出了文本和图像输入,但没有列出原生音频或视频输入。

在修改生产环境默认模型之前,应该使用相同的工具、权限、验收标准和推理强度,回放一组固定任务。记录任务通过率、重试次数、总 token 成本、耗时和审核人员投入。一款每 token 便宜 80% 的模型,如果带来更多修复工作,按最终验收结果计算,仍可能更贵。

哪些团队应该优先切换

正在使用 GPT-6 Sol 的团队,应该先做灰度测试。基础输入和输出价格没有上涨,缓存输入还变得更便宜,而已公布的编程和计算机操作结果有所提升。如果应用会复用较长前缀,并且已经支持 Responses API,那么迁移理由最充分。

正在为 Astra 付费的团队,可以把常规任务分流给 Sol 6.1,但不建议直接移除 Astra。带测试的编程工单、具有明确校验流程的文档提取,以及可重复的浏览器任务,都是合适的首批候选。科学研究、异常情况较多的工作流,或难以验证的决策任务,仍应保留 Astra。

没有可靠验收测试的团队,建议先等等。基准成绩接近,并不能代替质量门槛。如果没人能判断智能体是否正确完成任务,那么更低的 token 价格不足以成为换模理由。

GPT-6.1 Sol 常见问题

GPT-6.1 Sol 比 GPT-6 Sol 便宜吗?

只在部分情况下便宜。标准输入和输出价格仍为每百万 token $2 和 $10。缓存输入从 $0.20 降至 $0.10,因此缓存使用率高的智能体能获得最直接的节省。

GPT-6.1 Sol 的能力和 GPT-6 Astra 一样吗?

从已公布的发布基准来看,它在编程和计算机操作方面接近 Astra,但在部分业务自动化和科学任务上落后。应把“接近 Astra”视为需要验证的工作负载假设,而不是全面替代结论。

GPT-6.1 Sol 的准确 API 模型名称是什么?

在 API 请求中使用 gpt-6.1-sol。

普通 ChatGPT 用户可以选择 GPT-6.1 Sol 吗?

本文所讨论的发布范围包括 API、Codex 和 ChatGPT Work。它在发布时并未列入普通 ChatGPT 对话。

GPT-6.1 Sol 支持工具调用吗?

发布文档显示,工具调用需要使用 Responses API。在切换现有集成之前,应先在预发布环境测试接口和工具 schema。

实际的路由规则并不复杂:对于可重复、缓存使用率高且容易验收的任务,优先使用 GPT-6.1 Sol;而在一次边界情况失误的代价高于模型调用成本时,继续保留 Astra。