这周要接入的 Agent,究竟该调用 claude-opus-5,还是 gpt-5.6?先别急着二选一:后者并不是一个具体模型,而是指向三个 SKU 之一的别名,而这三个 SKU 分别对应不同的价格表。
结论先说:输入低于 272,000 token 时,两家旗舰模型的价格差距不到 7%;一旦超过这个门槛,Claude Opus 5 的成本大约只有 GPT-5.6 Sol 的一半。我们在 2026 年 7 月 24 日让四个模型完成同一组四项检查,并逐项对照两家厂商文档核算价格。
Sol、Terra、Luna:同一代模型的三个档位
OpenAI 于 2026 年 7 月 9 日同时发布了这三个型号。其模型文档将它们对应到此前 GPT-5 系列的尺寸分层:Sol 对应“早期 GPT-5 系列中不带后缀的档位”,Terra 对应“mini 模型档”,Luna 对应“nano 模型档”。它们是同代的三个 SKU,不是三代不同模型。
裸写的 gpt-5.6 只是一个别名。OpenAI 的更新日志将它解析至 gpt-5.6-sol,因此配置里填入 gpt-5.6,实际会按这一代最高档的价格计费。
| 型号 | 模型 ID | 对应旧分层 | 每 1M 输入 / 输出价格(≤272K) | 推理评级 |
|---|---|---|---|---|
| Sol | gpt-5.6-sol(别名:gpt-5.6) | 无后缀档 | $5.00 / $30.00 | 最高 |
| Terra | gpt-5.6-terra | mini | $2.50 / $15.00 | 更高 |
| Luna | gpt-5.6-luna | nano | $1.00 / $6.00 | 高 |
比起差异,三者的共性更值得关注。三个模型页面列出的以下规格完全一致:
- 上下文窗口均为 1,050,000 token,最大输出均为 128,000 token
- 知识截止日期均为 2026 年 2 月 16 日
- 支持文本和图像输入、文本输出;不支持微调;没有带日期的快照版本
- 采用同一套 effort 档位,速度评级同为“Fast”
文档明确列出的差别只有价格与推理评级。每个型号页面各自所属档位中都标有“Default”,因此 Terra 页面上的这个标签,并不代表 Terra 是整个 GPT-5.6 家族的默认模型。
另一边,Anthropic 只提供一个 SKU。Claude Opus 5 于 2026 年 7 月 24 日发布,模型 ID 为 claude-opus-5;这是一个没有日期后缀的固定快照。它的价格为每百万 token 输入 $5、输出 $25,1M 上下文窗口既是默认值,也是最大值。
代码能力:四项可机械判定的测试,全部通过
我们通过一个兼容 OpenAI 的网关,将相同的用户提示词发给每个模型,测试任务均带有可由机器验证的通过条件:
- 修 Bug:修复
kth_smallest。原实现既通过原地sort()修改了调用方列表,也存在索引偏一错误 - 严格 JSON:要求键顺序固定,数量与校验和自洽
- 推理题:只能使用 7 个一包和 12 个一包时,无法凑出的最大总数,也就是 Frobenius 数:7×12−7−12 = 65
- 重构:在不改变函数签名的前提下加入校验
四个模型均取得 4/4:使用 sorted() 或副本避免改动原列表,索引调整为 k-1;输出符合要求的键顺序且可解析的 JSON;得到 65;并完成干净的重构。这只是每个模型与每项任务各跑一次,并非基准测试。在这个任务规模下,正确性没有拉开差距。
更宏观的能力说法则主要来自厂商公布的数据,均未由我们独立复现。Anthropic 的发布材料称,Opus 5 在最高 effort 下的 CursorBench 3.2 峰值成绩距 Fable 5 不到 0.5%,但单任务成本只有一半;这是厂商自行测试的相对数据。OpenAI 的 GPT-5.6 发布页面会对自动抓取返回 403,因此 Sol 的代码分数只能引用发布这些结果的第三方:
| 第三方基准 | Sol | Terra | Luna |
|---|---|---|---|
| Vellum,Terminal-Bench 2.1 | 88.8% | 87.4% | 84.7% |
| Artificial Analysis,Coding Agent Index | 80,使用 Codex | 77 | 75 |
实际使用者的判断并不完全跟着榜单走。一位开发者在 High effort 下比较两者后,于 7 月 24 日发文称:“GPT 5.6 Sol High 在代码能力上依然强于 Claude Opus 5 High。”
Anthropic 的迁移指南还给出了一个值得直接执行的建议:Opus 5 会自行验证工作结果,因此如果继承的提示词额外要求执行验证步骤,模型会过度验证,应将这类提示删除。
指令遵循:差异出在输出格式
其中两项任务本质上也是指令遵循测试。JSON 任务要求 items 按小写字母序排列、校验和为 14,且不得包含多余键;重构任务则要求抛出 ValueError,同时不写任何注释和文档字符串——模型经常会忍不住解释自己的代码,从而违反要求。四个模型都通过了这两项。
不过输出形式确实不同。Sol 与 Luna 将答案包装为 LaTeX,返回 \boxed{65};Opus 5 和 Terra 则直接返回数字。用正则提取最后一个整数,两种格式都能处理;但若解析器只接受纯数字或 JSON 字段,就会出问题。把 claude-opus-5 直接替换成 gpt-5.6 而不修改其他设置时,继承到的正是这些默认输出行为。
Token 效率:Opus 5 输出 1,182 token,Sol 为 464
下面的输出量差距,很可能主要来自两个默认配置,而非质量差异。Opus 5 默认开启 thinking,且 API 与 Claude Code 中的默认 effort 为 high,所以一个不带额外设置的请求本身就是推理请求。GPT-5.6 的默认 effort 则是 medium。
以下为四项任务的可见完成 token 总数,成本按官方输出费率计算。每组仅请求一次,不重试,全部采用默认设置:
| 模型 | 输出 token | 重构任务 | 仅输出成本 |
|---|---|---|---|
| Claude Opus 5 | 1,182 | 600 tok / 8.3s | $0.0296 |
| GPT-5.6 Sol | 464 | 321 tok / 12.0s | $0.0139 |
| GPT-5.6 Terra | 737 | 603 tok / 11.8s | $0.0111 |
| GPT-5.6 Luna | 612 | 380 tok / 8.7s | $0.0037 |
这些成本数字有两点限制需要注意。对于同一条用户提示词,网关在 GPT 模型上报出的提示 token 在 62 到 4,471 之间,而 Claude 始终在 592 到 640 之间。这意味着请求在传输层并不完全相同:输入侧成本没有比较意义,差异也无法被干净地归因。
OpenAI 的推理指南还指出,除非主动选择启用,否则不会返回推理摘要;但 GPT-5.6 仍会将这些隐藏 token 按输出 token 收费。因此,这三个 GPT 成本低估了实际账单。正确性才是这里相对可比的信号;token 消耗和延迟只适合作方向参考。
图中还包含同一轮测试中的 Claude 侧基线:Opus 4.8 和 Sonnet 5。四项任务累计下来,Opus 5 是六个模型中最慢的,为 24.6 秒;Sol 为 20.3 秒、Terra 为 22.7 秒、Luna 为 18.4 秒。Opus 4.8 默认关闭 thinking,仅用 11.8 秒完成,这更说明差距来自配置,而不是能力。
Artificial Analysis 在 Opus 5 发布当天进行评估时,将其 effort 设置描述为:相比其他实验室的模型,覆盖更宽的 token 使用范围。因此,它的成本可调空间比价目表表面看起来更大。
价格:按美元算清 272K 断崖
Claude Opus 5 与 GPT-5.6 的价格比较,关键就藏在一条公开说明里。按标价看,两家旗舰模型几乎只是零头差异:Opus 5 为每百万 token 输入 $5、输出 $25;Sol 为输入 $5、输出 $30。因此 Opus 5 的输出便宜 17%,输入价格相同。但这只适用于输入不超过 272,000 token 的情况。
三个 GPT-5.6 模型页面都有同一句话:“Prompts with >272K input tokens are priced at 2x input and 1.5x output for the full request.” 也就是说,超过 272K 后,翻倍价格适用于整次请求,而不是只对超出的部分收费。哪怕只多一个 token,Sol 的整次调用就会按输入 $10、输出 $45 计费;Opus 5 的 1M 窗口则从头到尾维持输入 $5、输出 $25。
以一次输出 20,000 token 的 Agent 请求为例,改变输入规模。价格采用OpenAI 公布费率和 Anthropic 标准费率,均读取于 2026 年 7 月 25 日:
| 输入 token | Claude Opus 5 | GPT-5.6 Sol | GPT-5.6 Terra |
|---|---|---|---|
| 200,000 | $1.50 | $1.60 | $0.80 |
| 400,000 | $2.50 | $4.90 | $2.45 |
| 900,000 | $5.00 | $9.90 | $4.95 |
门槛以下,两款旗舰模型相差 7%。超过门槛后,400K 输入时 Sol 的成本是 Opus 5 的 1.96 倍;900K 时为 1.98 倍。若有 100 次 400K 形态的请求,总成本分别为 $250 和 $490。
更值得注意的是 Terra。超过 272K 后,它的输入价格与 Opus 5 一样,都是每百万 $5,所以两者的整体差别只在输出单价:每百万相差 $2.50。在这个输出 20K token 的请求中,无论输入是 300K 还是 900K,差额都只有 $0.05;差距随输出量而非输入量增长。这个门槛是价目表上的离散跳变,并不是均匀坐标轴所呈现的平滑斜率。
Batch 折扣、分词器与购买渠道
折扣档位下,400K 请求的价格比例仍然不变:
- Anthropic Batch API:Opus 5 价格为输入 $2.50、输出 $12.50,该请求成本降至 $1.25
- OpenAI Batch 与 Flex:标准价格五折,因此 Sol 的长上下文价格变为输入 $5、输出 $22.50;同一调用成本为 $2.45
跨厂商不能直接拿每 token 费率做比较。Anthropic 的定价文档指出,从 Claude 4.7 开始的模型——包括 Opus 5——使用较新的分词器,对同一段文本通常会产生约多 30% 的 token,具体比例取决于内容和语言。一份被 GPT-5.6 计为 400,000 token 的文档,Opus 5 可能接近 520,000 token,使该行输入成本从 $2.00 变为 $2.60。即便如此,仍低于 Sol 的 $4.00;但在最终选型前,应先对自己的提示词做分词测试。
购买渠道也会影响价格。AIReiter以低于标价的价格转售 Claude,Opus 4.8 为每百万 token 输入 $1.56、输出 $7.76,比官方价格低约 69%;但其目录最高只到 Fable 5 和 Opus 4.8,暂时还不能调用 Opus 5。若只在 Anthropic 自家阵容中比较,Fable 5 的 $10/$50 与 Opus 5 的 $5/$25才是需要权衡的临界点。
上下文:都写着 1M,但只有一方全程统一计价
Opus 5 的上下文窗口是 1,000,000 token,默认值与最大值相同,因此不存在误选较小上下文版本的可能。三个 GPT-5.6 变体均为 1,050,000 token,窗口大 5%。两边最大输出都是 128,000 token,不过 Anthropic Batch API 有一项不同:加上 output-300k-2026-03-24 beta header 后,Opus 5 的上限可提升至 300,000。
Sol 可以接收 900K token 的提示词,但整次请求都将按长上下文费率收费,也就是说,其宣传窗口中约 74% 的部分位于低价门槛之上。长上下文能力则是另一回事:Vellum 的分析中,Luna 的 MRCR 得分为 41.3%,Sol 为 91.5%,Terra 为 89.6%。无论价格多低,这都足以说明 nano 档不适合长上下文任务。Anthropic 为 Opus 5 标注的知识截止日期为 2026 年 5 月,三个 GPT-5.6 模型页面则均为 2026 年 2 月 16 日。
推理控制:同一档位梯,但控制方式不同
Opus 5 的所有 effort 级别都不需要 beta header,thinking 默认开启。关闭 thinking 有明确限制:thinking: {"type": "disabled"} 只在 effort 不高于 high 时可用;若设置为 xhigh 或 max,会返回 400。Anthropic 将其标为相较早期模型的一项破坏性变更。
| 控制项 | Claude Opus 5 | GPT-5.6 |
|---|---|---|
| effort 档位 | low → medium → high → xhigh → max | none → low → medium → high → xhigh → max |
| 默认 effort | API 和 Claude Code 均为 high | medium |
| 第二个控制项 | 无 | reasoning.mode:standard(默认)或 pro |
| 关闭推理 | effort 高于 high 时不可关闭 | effort: none |
OpenAI 的推理指南只记录了这两个 mode 值。API 不提供 ultra,也没有说明 Pro mode 的实现机制。7 月 9 日的更新日志将持久化推理、max effort 与 Pro mode 列为该系列新增能力。
实际差异在于:对延迟极敏感的调用,GPT-5.6 可以完全停止推理;Opus 5 在 effort 高于 high 时则不能这么做。反过来,Opus 5 在启用推理的范围内可调跨度更大。一位同时追踪两者的开发者最终采用了一套跨厂商档位梯:Luna high、Sol medium,接着是 Opus medium、high 和 xhigh。
可用渠道、速率限制与微调
Opus 5 可通过 Claude API、Amazon Bedrock(模型名为 anthropic.claude-opus-5)、Google Cloud、Microsoft Foundry、claude.ai、Claude Code 和 Claude Cowork 调用,也是 Claude Max 的新默认模型。Anthropic 的 fast mode 仅限 Claude API 使用,价格为 $10/$50,吞吐量约为 2.5 倍。
三个 GPT-5.6 变体均为 OpenAI API 产品,免费 API 档不提供 Sol 或 Terra。Sol 的公开限额从 Tier 1 的 500 RPM 提升到 Tier 5 的 15,000 RPM,Terra 也共享这一上限。三个模型都不支持微调,也不提供带日期的快照版本;因此所谓版本固定,只能固定使用普通 ID,同时接受原地更新。
不同场景该指向哪个模型
先看输入长度,因为这是唯一存在公开计费突变点的维度。缓存、是否适用 Batch,以及输出量,之后才会改变总成本。
低于 272K 时,两款旗舰模型的价格接近到足以由其他因素决定胜负;高于 272K 后,按标价计算,Opus 5 相对 Sol 约有 2 倍成本优势。但这并不能推广到整个 GPT-5.6 家族:同样的请求中,越过门槛后的 Terra 为 $2.45,而 Opus 5 为 $2.50。因此,长上下文的省钱优势是 Sol 对比,不是 GPT-5.6 全家族对比。
- Claude Opus 5:适合大提示词、需要在完整 1M 窗口中保持统一费率、要求知识覆盖至 2026 年 5 月,或推理必须部署在 Bedrock、Google Cloud 或 Foundry 的场景。
- GPT-5.6 Terra:适合作为高吞吐量默认选择,因为无论输入规模两端,它都低于 Opus 5。
- GPT-5.6 Sol:适合确实需要
promode 或noneeffort 的情况。它的溢价来自控制能力,而不是我们能够测出的正确性优势。 - GPT-5.6 Luna:适合浅层、高量工作,但应避免用于长上下文任务。
Claude Opus 5 与 GPT-5.6 的选择,本质上取决于输入长度所在的档位,而两家厂商都明确公布了这条边界。
常见问题
Claude Opus 5 写代码比 GPT-5.6 更好吗?
在我们的四项机械化检查中,Opus 5、Sol、Terra 与 Luna 都取得 4/4,因此在这个任务规模下,正确性没有区分度;同时,High effort 下同时使用两者的开发者意见也不一致。成本上的结论更明确:输入超过 272K token 后,Opus 5 的价格约为 Sol 的一半。
GPT-5.6 Sol、Terra 和 Luna 有什么区别?
区别在于价格和定性的推理评级。OpenAI 文档将 Sol 对应此前的无后缀档、Terra 对应 mini、Luna 对应 nano;输入低于 272K token 时,每百万 token 的输入/输出价格分别为 $5/$30、$2.50/$15 和 $1/$6。三者的上下文窗口、最大输出、知识截止日期、模态与 effort 档位完全一致。
GPT 和 Claude,哪个 AI 更好?
答案取决于比较维度,而公开差距最大的维度恰好不是两家厂商主打的指标。benchlm.ai 记录的 AA-Omniscience 幻觉率中,Claude Opus 4.8 为 35.9%,GPT-5.6 Sol 为 88.8%;但 Sol 在数学、知识和 Agent 类别上得分更高。这是目前最接近的公开配对,尚无聚合平台提供 Opus 5 或 Terra 数据。如果错误答案的代价高于漏答,这一排序的重要性就超过任何代码分数。
应该用 GPT-5.6 Terra 替代 Sol 吗?
对于大多数高量工作,答案是肯定的。根据r/codex 中按任务深度路由的从业者反馈,约 75% 的工作会落在 Terra,Luna 占 15%,Sol 占 10%。Artificial Analysis 则认为中间档可能被两端型号支配:某个 Luna 或 Sol 设置通常能以相同或更低成本匹配它。因此,不要想当然地认为中档最稳妥,应先将 Terra 与相邻两个型号实测对比。
GPT-5.6 有 ultra 推理模式吗?
API 提供 reasoning.mode,文档中只有 standard 和 pro 两个值;同时 reasoning.effort 可从 none 调至 max。Pro mode 出现在 2026 年 7 月 9 日的更新日志中。OpenAI 推理指南和模型页面均未列出 ultra。
