Sonnet 5 于 2026 年 6 月 30 日发布后,r/ClaudeAI 很快冒出了一个单看价目表无法回答的问题:“Sonnet 5 在 high 和 xhigh 档位下,为什么同价反而不如 Opus?”
其中一位用户用一句话说清了原因。Sonnet 的“单 token 确实更便宜,但它得走更多步骤、消耗更多 token 才能完成任务,价格优势也就没了。”
这个判断基本正确,但有一个例外。若按相同预算比较 Claude Opus 5 与 Sonnet 5,Opus 几乎在所有场景中都占优:单任务预算超过约 $2.30 时,选择比 Sonnet 低一档 effort 的 Opus,成本和质量都更好。低于这条线,或者任务很短、一次调用即可完成时,Sonnet 5 则便宜 3.4 倍。
Opus 5 和 Sonnet 5 各自适合什么
| Claude Opus 5 | Claude Sonnet 5 | |
|---|---|---|
| 模型 ID | claude-opus-5 | claude-sonnet-5 |
| 发布时间 | 2026 年 7 月 24 日 | 2026 年 6 月 30 日 |
| 每 MTok 输入 / 输出价格 | $5 / $25 | 截至 2026 年 8 月 31 日为 $2 / $10,之后为 $3 / $15 |
| Batch 输入 / 输出价格 | $2.50 / $12.50 | 截至 2026 年 8 月 31 日为 $1 / $5 |
| Effort 档位 | low、medium、high、xhigh、max(默认 high) | 同样五档(默认 high) |
| 扩展思考 | 默认开启 | 自适应 |
| 上下文 / 最大输出 | 1M / 128k tokens | 1M / 128k tokens |
| 知识截止时间 | 2026 年 5 月 | 2026 年 1 月 |
| 单 token 折扣 | 无 | 当前比 Opus 低 60%,9 月 1 日起低 40% |
| 最适合的任务 | 长周期 agentic 任务、高难度推理、审核代价高的工作 | 单次提取、高并发、对延迟敏感的交互体验 |
| 我们的四任务冒烟测试 | 4/4 通过,1,182 个输出 token,2.955¢ | 4/4 通过,858 个输出 token,0.858¢ |
目前还没有公开的长周期基准测试覆盖 Opus 5,因此下文的单任务表格仍以 Opus 4.8 代表 Opus。可以把这些数据视为保守下限:两者定价完全一致,而 Anthropic 表示 Opus 5 在 agentic 工作上优于 4.8。
之所以能按预算比较 Claude Opus 5 和 Sonnet 5,是因为两个模型都支持同一套五档 effort 参数,且不需要 beta header。能力提升靠调高档位,而不只是换模型。价格取自 Claude Platform 价格页,核验日期为 2026 年 7 月 25 日。
逐档成本:两条曲线在哪里反转
各 effort 档位的数据来自 Datacurve 的长周期 agentic 榜单 DeepSWE v1.1:
- 113 个从零编写的任务,并非从已合并 PR 中提取,这是其“无污染”主张的基础
- 91 个仓库,覆盖 5 种编程语言
- 所有模型使用同一套测试框架,每个任务运行四次
- 最后更新于 7 月 21 日,比 Opus 5 发布早三天
因此,Opus 栏位使用 Opus 4.8 数据;唯一未知变量,是 Opus 5 每项任务的 token 消耗是否高于 4.8。
| Effort | Sonnet 5 $/任务 | Opus 4.8 $/任务 | Sonnet ÷ Opus | Sonnet pass@1 | Opus pass@1 |
|---|---|---|---|---|---|
| low | $2.19 | $2.29 | 0.95x | 30.5% | 40.8% |
| medium | $4.08 | $3.44 | 1.18x | 39.8% | 48.7% |
| high | $7.43 | $4.28 | 1.73x | 48.2% | 51.8% |
| xhigh | $11.89 | $8.01 | 1.49x | 49.7% | 54.4% |
| max | $26.40 | $13.22 | 2.00x | 53.8% | 59.0% |
Sonnet 5 只有在 low 档更便宜,而代价是 pass rate 低了 10.3 个百分点。
单 token 更便宜,为何总账反而更高
问题不在输出太长,而在于步骤太多。
| Effort | Sonnet 5 步数中位数 | Opus 4.8 步数中位数 | Sonnet 单任务输入 | Opus 单任务输入 |
|---|---|---|---|---|
| low | 70 | 47 | 4.5M | 2.4M |
| max | 260 | 116 | 72.4M | 17.0M |
单 token 打六折,也抵不过多读四倍文本。
为什么这些成本数据值得参考
先说一个限制:DeepSWE 没有公开其计费口径。
另一次在 7 月 13 日进行的 24 任务测试,覆盖 Claude Code 中两个模型的全部五档 effort。将 DeepSWE 的 Sonnet 列乘以 0.67,即从标准 $3/$15 换算到首发 $2/$10 后,两组数据在每个档位的差异都不超过 0.03。
两套独立任务集,都在 medium 与 high 之间出现同一个成本交叉点。这种一致性也很能说明 DeepSWE 对 Sonnet 使用的是标准价格计费。
该测试作者开发并销售 Stet,也就是该文章链接的测试框架,因此应将其视作厂商自测。
按预算选档位,才是决定胜负的比较
同档位横比其实问错了问题,因为没人会购买一个 effort 档位。你花钱买的是结果;以这个角度给 Claude Opus 5 和 Sonnet 5 定价,结论会完全重排。
下表针对每一种 Sonnet 5 配置,列出能达到或超过其 pass rate 的最低成本 Opus 4.8 档位。首发价格列为标准价格乘以 0.67 的估算值。
| Sonnet 5 配置 | Sonnet pass@1 | Sonnet $,标准价 | Sonnet $,首发价(估算) | 达到该表现的最低 Opus 4.8 档位 | Opus $ | Opus pass@1 | Opus 成本相对首发 Sonnet | 质量差异 |
|---|---|---|---|---|---|---|---|---|
| low | 30.5% | $2.19 | $1.47 | low | $2.29 | 40.8% | 1.56x | +10.3pp |
| medium | 39.8% | $4.08 | $2.73 | low | $2.29 | 40.8% | 0.84x | +1.0pp |
| high | 48.2% | $7.43 | $4.98 | medium | $3.44 | 48.7% | 0.69x | +0.4pp |
| xhigh | 49.7% | $11.89 | $7.97 | high | $4.28 | 51.8% | 0.54x | +2.1pp |
| max | 53.8% | $26.40 | $17.69 | xhigh | $8.01 | 54.4% | 0.45x | +0.5pp |
看最后两列即可。相比你原本考虑的 Sonnet 档位,Opus 降一档就能以低 16% 到 55% 的成本,达到相同或更高的 pass rate,即使按促销价比较也是如此。只有最低档相反:首发价下,low effort 的 Sonnet 5 便宜 36%,但 pass rate 低 10.3 个百分点。
也有另一种合理读法
最初那篇讨论中的一位评论者,引用官方图表的 medium effort 数据:Opus 成功率 68%,价格接近 $7;Sonnet 成功率 62%,价格为 $4.50。也就是说,“在这项测试里,价格高 55%,成功率提升却不到 10%”。
如果少 6 个百分点的成功率没有任何损失,这笔交易完全合理;但如果一个有问题的 diff 会直接进入生产环境,那就不成立。
两种看法都建立在别人的任务分布上。拿自己的 20 到 50 个任务,按每次成功完成的成本而非每 token 成本打分,胜过本文任何一张表。
同样是 $5/$25,Opus 5 带来了什么变量
Opus 5 的发布定价与 Opus 4.8 逐项相同,因此还剩第三个变量:每项任务消耗多少 token。目前证据指向两边。
| 支持 Opus 5 单任务成本更低的证据 | 支持其成本更高的证据 |
|---|---|
| Anthropic 称 Opus 5 登顶 Frontier-Bench v0.1,并且“以更低的单任务成本,将 Opus 4.8 的表现提升超过一倍”(厂商自行报告、基于其内部测试,尚无独立复现) | 扩展思考默认开启,而 Opus 4.8 当时默认关闭 |
| 一位未具名的法律合作伙伴称,max reasoning 下 token 消耗约少了 26%(由 Anthropic 转述,未提供方法论) | 我们的四项任务中:Opus 4.8 使用 380 个输出 token,Opus 5 使用 1,182 个 |
两种可能性都不能排除,因此在锁定预算前,应在自己的仓库上重新测量成本列。
还有一个容易踩的坑:若想用最直接的方式压低 Opus 5 成本,thinking: {"type": "disabled"} 只在 high 及以下 effort 可用,在 xhigh 或 max 会返回 400。迁移前还应了解 Opus 4.8 与 Opus 5 之间的其他破坏性变更。
Sonnet 5 的主场:短小、单次完成的任务
我们在 2026 年 7 月 24 日让两个模型完成四项小任务,每项都由脚本判定,而不是凭主观感受:修复 kth_smallest 中两个缺陷;按固定键顺序输出严格 JSON 并生成自洽校验和;解答结果为 65 的 Frobenius number 问题;以及在保持函数签名、零注释的前提下,为一次重构补上验证逻辑。
两个模型均通过全部四项测试,差异出现在账单上。
| Claude Sonnet 5 | Claude Opus 5 | |
|---|---|---|
| 通过检查数 | 4/4 | 4/4 |
| 四项任务输出 token | 858 | 1,182 |
| 总延迟 | 13.7s | 24.6s |
| 按首发 / 标准价格计算的输出成本 | 0.858¢ / 1.287¢ | 2.955¢ |
在输出完全一致且经验证的情况下,按当前 Sonnet 定价,Opus 5 的成本高 3.4 倍;促销结束后仍高 2.3 倍。Sonnet 用时也只略高于 Opus 一半。我们又通过 Claude Code 的官方渠道重复两项编程任务,结果方向一致:Sonnet 5 输出 240 个 token,Opus 5 输出 465 个。
这组数字有三个比结果本身更重要的边界:
- 每个模型每项任务只运行一次。这是冒烟测试,不是基准测试。
- 仅统计输出 token 成本,并按官方输出价格计算。因为网关注入了长度不固定的系统提示词,输入 token 无法用于可靠的计费计算。
- 只有四个短提示词,而这正是社区争论排除的任务区间。这里没有任何任务运行 70 步,因此也不会复现步骤数膨胀的问题。
在这个边界内,Sonnet 5 的折扣没有被吃掉。一位开发者描述过完全相同的工作形态:文档密集型 agent 执行“几乎不需要推理的单次提取”,此时“Opus 就太重了”。
本文所有数字都要对应两个日期
2026 年 6 月 30 日:官方成本图表曾修订
Anthropic 的 Claude Sonnet 5 发布公告附有一则更新说明。最初的成本性能图采用了“较简单的方法论,未能反映我们用于 agentic 搜索评估的标准方法论”,结果是“低估了 Sonnet 5 在该评估中的表现”。
图表及周边文本随后被修订,以匹配 system card 的 BrowseComp 方法论;后者“使用了 10M token 预算、压缩以及程序化工具调用”。
因此,引用这张图之前请确认版本,并阅读图注:其中 Sonnet 5 按标准 $3/$15 定价,注明首发价会让现实成本低于图中数值;Opus 4.8 则按 $5/$25 定价。
2026 年 9 月 1 日:促销价格结束
Sonnet 5 的首发价格到期后,所有已发布价格项均上涨 50%,而 Opus 5 仍维持 $5/$25。文章发布时距离调价还有 37 天,这意味着任何基于当前价格建立的成本模型,届时都会失效。
还有一个日期常被拿来讨论,但不适用于这里。Claude 4.7 tokenizer 对相同文本产生的 token 数,大约比 Sonnet 4.6 多 30%,因此按 token 对比 Sonnet 5 与 Sonnet 4.6,会低估实际涨幅。Opus 5 和 Sonnet 5 使用同一 tokenizer,因此在两者比较中这项影响会相互抵消。
按预算怎么选
Claude Opus 5 vs Sonnet 5 并不存在一个放之四海皆准的赢家,更适合用三条路由规则来判断。阈值来自 DeepSWE 的平均单任务成本,且 Opus 一栏使用 Opus 4.8;它们适合作为仓库类任务的起始区间,而不是研究 agent、客服流程或文档工作流的固定常数。
- 单任务预算低于约 $2.30:选 low effort 的 Sonnet 5。这是它在 agentic 工作中唯一能守住价格优势的配置,但 pass rate 只有 30.5%。单次提取、分类、输出边界明确的任务都适合这里,能获得我们测得的 3.4 倍成本优势。一位开发者称 Sonnet 5 “90% 的工作都已经足够接近 Opus,但相对而言几乎是即时响应”;当人正在等待结果时,这点很关键。
- 单任务约 $2.30 到 $8:不要把 Sonnet 提高一档,改选低一档的 Opus。Opus medium 可作为日常默认,审核中发现错误成本很高时用 Opus high。Opus 5 的单 token 价格相同,但每任务 token 数尚未测量,所以应把这个区间当作测试起点。
- 超过 $8:不要继续往上调 Sonnet。DeepSWE 上,Sonnet 5 max 每项任务成本 $26.40,pass rate 为 53.8%;Opus 4.8 xhigh 成本 $8.01,pass rate 为 54.4%;Fable 5 low effort 以 $3.76 达到 59.6%。AIReiter 列出的 Opus 4.8 价格为每 MTok $1.56/$7.76,比官方标价低约 69%,但其 Claude 产品线尚未提供 Opus 5。
FAQ
Claude Opus 5 比 Sonnet 5 贵吗?
按 token 算,是的:Opus 5 为 $5/$25,Sonnet 5 的促销价为 $2/$10。因此截至 2026 年 8 月 31 日,Opus 的价格是 2.5 倍;之后为 1.67 倍。但按完成一项任务的成本计算,排序可能反转,而且这不是少数极端运行拉高的结果,中位数也支持这一点。DeepSWE 中,max effort 的成本中位数为 Sonnet 5 $23.28、Opus 4.8 $12.35。
Claude Sonnet 5 的价格是多少?
截至 2026 年 8 月 31 日,每百万输入 token $2、每百万输出 token $10;从 9 月 1 日起分别为 $3 和 $15。所有已发布价格项均上涨 50%:5 分钟缓存写入从 $2.50 升至 $3.75,1 小时缓存写入从 $4 升至 $6,缓存命中从 $0.20 升至 $0.30。促销期的 Batch 定价为 $1/$5。
为什么更便宜的模型,最终任务成本反而更高?
因为账单随步骤数增长,而不是随任务数增长。随着 effort 档位升高,Sonnet 5 的步骤数中位数从 70 升至 260,Opus 4.8 则从 47 升至 116;max 档时,Sonnet 每项任务读取 72.4M token,而 Opus 为 17.0M。多读四倍文本,足以吞没每个 token 60% 的折扣。
Opus 5 比 Sonnet 5 强很多吗?
按单次尝试看,是的:在 DeepSWE 上,Opus 4.8 的 pass@1 比 Sonnet 5 高 3.5 到 10.3 个百分点,差距在低档位最大。
如果每个任务都给四次机会,差距几乎消失:Sonnet 5 high effort 的 pass@4 为 79.6%,Opus 4.8 为 77.9%;max 档分别为 78.8% 和 79.3%。Sonnet 也能达到相近结果,只是需要更多尝试,而每次尝试都要付费。
Sonnet 5 在 9 月 1 日涨价后,结论会变吗?
交叉点会下移,而不是上移。Sonnet 5 的单 token 优势从 60% 缩至 40%,Opus 5 仍为 $5/$25,因此同预算表中的每一种组合对 Sonnet 都更不利。唯一对 Sonnet 有利的一行——首发价下 low 档比 Opus low 便宜 36%——在标准价下会缩小到大约便宜 4%。
