Claude Opus 5 vs Sonnet 5:同预算下谁更划算

最后更新: 2026-07-25 05:11:36

Sonnet 5 于 2026 年 6 月 30 日发布后,r/ClaudeAI 很快冒出了一个单看价目表无法回答的问题:“Sonnet 5 在 high 和 xhigh 档位下,为什么同价反而不如 Opus?”

其中一位用户用一句话说清了原因。Sonnet 的“单 token 确实更便宜,但它得走更多步骤、消耗更多 token 才能完成任务,价格优势也就没了。”

这个判断基本正确,但有一个例外。若按相同预算比较 Claude Opus 5 与 Sonnet 5,Opus 几乎在所有场景中都占优:单任务预算超过约 $2.30 时,选择比 Sonnet 低一档 effort 的 Opus,成本和质量都更好。低于这条线,或者任务很短、一次调用即可完成时,Sonnet 5 则便宜 3.4 倍。

Opus 5 和 Sonnet 5 各自适合什么

Claude Opus 5Claude Sonnet 5
模型 IDclaude-opus-5claude-sonnet-5
发布时间2026 年 7 月 24 日2026 年 6 月 30 日
每 MTok 输入 / 输出价格$5 / $25截至 2026 年 8 月 31 日为 $2 / $10,之后为 $3 / $15
Batch 输入 / 输出价格$2.50 / $12.50截至 2026 年 8 月 31 日为 $1 / $5
Effort 档位low、medium、high、xhigh、max(默认 high)同样五档(默认 high)
扩展思考默认开启自适应
上下文 / 最大输出1M / 128k tokens1M / 128k tokens
知识截止时间2026 年 5 月2026 年 1 月
单 token 折扣当前比 Opus 低 60%,9 月 1 日起低 40%
最适合的任务长周期 agentic 任务、高难度推理、审核代价高的工作单次提取、高并发、对延迟敏感的交互体验
我们的四任务冒烟测试4/4 通过,1,182 个输出 token,2.955¢4/4 通过,858 个输出 token,0.858¢

目前还没有公开的长周期基准测试覆盖 Opus 5,因此下文的单任务表格仍以 Opus 4.8 代表 Opus。可以把这些数据视为保守下限:两者定价完全一致,而 Anthropic 表示 Opus 5 在 agentic 工作上优于 4.8。

之所以能按预算比较 Claude Opus 5 和 Sonnet 5,是因为两个模型都支持同一套五档 effort 参数,且不需要 beta header。能力提升靠调高档位,而不只是换模型。价格取自 Claude Platform 价格页,核验日期为 2026 年 7 月 25 日。

Anthropic Claude Platform Docs 中 effort 参数的页面,列出 Claude Fable 5、Claude Mythos 5、Claude Opus 5、Claude Opus 4.8、Claude Sonnet 5 等支持的模型,并说明 Claude 默认使用 high effort

逐档成本:两条曲线在哪里反转

各 effort 档位的数据来自 Datacurve 的长周期 agentic 榜单 DeepSWE v1.1

  • 113 个从零编写的任务,并非从已合并 PR 中提取,这是其“无污染”主张的基础
  • 91 个仓库,覆盖 5 种编程语言
  • 所有模型使用同一套测试框架,每个任务运行四次
  • 最后更新于 7 月 21 日,比 Opus 5 发布早三天

因此,Opus 栏位使用 Opus 4.8 数据;唯一未知变量,是 Opus 5 每项任务的 token 消耗是否高于 4.8。

EffortSonnet 5 $/任务Opus 4.8 $/任务Sonnet ÷ OpusSonnet pass@1Opus pass@1
low$2.19$2.290.95x30.5%40.8%
medium$4.08$3.441.18x39.8%48.7%
high$7.43$4.281.73x48.2%51.8%
xhigh$11.89$8.011.49x49.7%54.4%
max$26.40$13.222.00x53.8%59.0%

Sonnet 5 只有在 low 档更便宜,而代价是 pass rate 低了 10.3 个百分点。

单 token 更便宜,为何总账反而更高

问题不在输出太长,而在于步骤太多。

EffortSonnet 5 步数中位数Opus 4.8 步数中位数Sonnet 单任务输入Opus 单任务输入
low70474.5M2.4M
max26011672.4M17.0M

单 token 打六折,也抵不过多读四倍文本。

为什么这些成本数据值得参考

先说一个限制:DeepSWE 没有公开其计费口径。

另一次在 7 月 13 日进行的 24 任务测试,覆盖 Claude Code 中两个模型的全部五档 effort。将 DeepSWE 的 Sonnet 列乘以 0.67,即从标准 $3/$15 换算到首发 $2/$10 后,两组数据在每个档位的差异都不超过 0.03。

两套独立任务集,都在 medium 与 high 之间出现同一个成本交叉点。这种一致性也很能说明 DeepSWE 对 Sonnet 使用的是标准价格计费。

该测试作者开发并销售 Stet,也就是该文章链接的测试框架,因此应将其视作厂商自测。

按预算选档位,才是决定胜负的比较

同档位横比其实问错了问题,因为没人会购买一个 effort 档位。你花钱买的是结果;以这个角度给 Claude Opus 5 和 Sonnet 5 定价,结论会完全重排。

下表针对每一种 Sonnet 5 配置,列出能达到或超过其 pass rate 的最低成本 Opus 4.8 档位。首发价格列为标准价格乘以 0.67 的估算值。

Sonnet 5 配置Sonnet pass@1Sonnet $,标准价Sonnet $,首发价(估算)达到该表现的最低 Opus 4.8 档位Opus $Opus pass@1Opus 成本相对首发 Sonnet质量差异
low30.5%$2.19$1.47low$2.2940.8%1.56x+10.3pp
medium39.8%$4.08$2.73low$2.2940.8%0.84x+1.0pp
high48.2%$7.43$4.98medium$3.4448.7%0.69x+0.4pp
xhigh49.7%$11.89$7.97high$4.2851.8%0.54x+2.1pp
max53.8%$26.40$17.69xhigh$8.0154.4%0.45x+0.5pp

看最后两列即可。相比你原本考虑的 Sonnet 档位,Opus 降一档就能以低 16% 到 55% 的成本,达到相同或更高的 pass rate,即使按促销价比较也是如此。只有最低档相反:首发价下,low effort 的 Sonnet 5 便宜 36%,但 pass rate 低 10.3 个百分点。

也有另一种合理读法

最初那篇讨论中的一位评论者,引用官方图表的 medium effort 数据:Opus 成功率 68%,价格接近 $7;Sonnet 成功率 62%,价格为 $4.50。也就是说,“在这项测试里,价格高 55%,成功率提升却不到 10%”。

如果少 6 个百分点的成功率没有任何损失,这笔交易完全合理;但如果一个有问题的 diff 会直接进入生产环境,那就不成立。

两种看法都建立在别人的任务分布上。拿自己的 20 到 50 个任务,按每次成功完成的成本而非每 token 成本打分,胜过本文任何一张表。

同样是 $5/$25,Opus 5 带来了什么变量

Opus 5 的发布定价与 Opus 4.8 逐项相同,因此还剩第三个变量:每项任务消耗多少 token。目前证据指向两边。

支持 Opus 5 单任务成本更低的证据支持其成本更高的证据
Anthropic 称 Opus 5 登顶 Frontier-Bench v0.1,并且“以更低的单任务成本,将 Opus 4.8 的表现提升超过一倍”(厂商自行报告、基于其内部测试,尚无独立复现)扩展思考默认开启,而 Opus 4.8 当时默认关闭
一位未具名的法律合作伙伴称,max reasoning 下 token 消耗约少了 26%(由 Anthropic 转述,未提供方法论)我们的四项任务中:Opus 4.8 使用 380 个输出 token,Opus 5 使用 1,182 个

两种可能性都不能排除,因此在锁定预算前,应在自己的仓库上重新测量成本列。

还有一个容易踩的坑:若想用最直接的方式压低 Opus 5 成本,thinking: {"type": "disabled"} 只在 high 及以下 effort 可用,在 xhigh 或 max 会返回 400。迁移前还应了解 Opus 4.8 与 Opus 5 之间的其他破坏性变更

Sonnet 5 的主场:短小、单次完成的任务

我们在 2026 年 7 月 24 日让两个模型完成四项小任务,每项都由脚本判定,而不是凭主观感受:修复 kth_smallest 中两个缺陷;按固定键顺序输出严格 JSON 并生成自洽校验和;解答结果为 65 的 Frobenius number 问题;以及在保持函数签名、零注释的前提下,为一次重构补上验证逻辑。

两个模型均通过全部四项测试,差异出现在账单上。

Claude Sonnet 5Claude Opus 5
通过检查数4/44/4
四项任务输出 token8581,182
总延迟13.7s24.6s
按首发 / 标准价格计算的输出成本0.858¢ / 1.287¢2.955¢
横向柱状图,对比相同四项任务的输出 token 成本,单位为美分:Sonnet 5 按每 MTok $10 的首发价为 0.858 美分,按每 MTok $15 的标准价为 1.287 美分,Opus 5 按每 MTok $25 计为 2.955 美分

在输出完全一致且经验证的情况下,按当前 Sonnet 定价,Opus 5 的成本高 3.4 倍;促销结束后仍高 2.3 倍。Sonnet 用时也只略高于 Opus 一半。我们又通过 Claude Code 的官方渠道重复两项编程任务,结果方向一致:Sonnet 5 输出 240 个 token,Opus 5 输出 465 个。

这组数字有三个比结果本身更重要的边界:

  • 每个模型每项任务只运行一次。这是冒烟测试,不是基准测试。
  • 仅统计输出 token 成本,并按官方输出价格计算。因为网关注入了长度不固定的系统提示词,输入 token 无法用于可靠的计费计算。
  • 只有四个短提示词,而这正是社区争论排除的任务区间。这里没有任何任务运行 70 步,因此也不会复现步骤数膨胀的问题。

在这个边界内,Sonnet 5 的折扣没有被吃掉。一位开发者描述过完全相同的工作形态:文档密集型 agent 执行“几乎不需要推理的单次提取”,此时“Opus 就太重了”。

本文所有数字都要对应两个日期

2026 年 6 月 30 日:官方成本图表曾修订

Anthropic 的 Claude Sonnet 5 发布公告附有一则更新说明。最初的成本性能图采用了“较简单的方法论,未能反映我们用于 agentic 搜索评估的标准方法论”,结果是“低估了 Sonnet 5 在该评估中的表现”。

图表及周边文本随后被修订,以匹配 system card 的 BrowseComp 方法论;后者“使用了 10M token 预算、压缩以及程序化工具调用”。

因此,引用这张图之前请确认版本,并阅读图注:其中 Sonnet 5 按标准 $3/$15 定价,注明首发价会让现实成本低于图中数值;Opus 4.8 则按 $5/$25 定价。

2026 年 9 月 1 日:促销价格结束

Sonnet 5 的首发价格到期后,所有已发布价格项均上涨 50%,而 Opus 5 仍维持 $5/$25。文章发布时距离调价还有 37 天,这意味着任何基于当前价格建立的成本模型,届时都会失效。

还有一个日期常被拿来讨论,但不适用于这里。Claude 4.7 tokenizer 对相同文本产生的 token 数,大约比 Sonnet 4.6 多 30%,因此按 token 对比 Sonnet 5 与 Sonnet 4.6,会低估实际涨幅。Opus 5 和 Sonnet 5 使用同一 tokenizer,因此在两者比较中这项影响会相互抵消。

按预算怎么选

Claude Opus 5 vs Sonnet 5 并不存在一个放之四海皆准的赢家,更适合用三条路由规则来判断。阈值来自 DeepSWE 的平均单任务成本,且 Opus 一栏使用 Opus 4.8;它们适合作为仓库类任务的起始区间,而不是研究 agent、客服流程或文档工作流的固定常数。

  • 单任务预算低于约 $2.30:选 low effort 的 Sonnet 5。这是它在 agentic 工作中唯一能守住价格优势的配置,但 pass rate 只有 30.5%。单次提取、分类、输出边界明确的任务都适合这里,能获得我们测得的 3.4 倍成本优势。一位开发者称 Sonnet 5 “90% 的工作都已经足够接近 Opus,但相对而言几乎是即时响应”;当人正在等待结果时,这点很关键。
  • 单任务约 $2.30 到 $8:不要把 Sonnet 提高一档,改选低一档的 Opus。Opus medium 可作为日常默认,审核中发现错误成本很高时用 Opus high。Opus 5 的单 token 价格相同,但每任务 token 数尚未测量,所以应把这个区间当作测试起点。
  • 超过 $8:不要继续往上调 Sonnet。DeepSWE 上,Sonnet 5 max 每项任务成本 $26.40,pass rate 为 53.8%;Opus 4.8 xhigh 成本 $8.01,pass rate 为 54.4%;Fable 5 low effort 以 $3.76 达到 59.6%。AIReiter 列出的 Opus 4.8 价格为每 MTok $1.56/$7.76,比官方标价低约 69%,但其 Claude 产品线尚未提供 Opus 5。

FAQ

Claude Opus 5 比 Sonnet 5 贵吗?

按 token 算,是的:Opus 5 为 $5/$25,Sonnet 5 的促销价为 $2/$10。因此截至 2026 年 8 月 31 日,Opus 的价格是 2.5 倍;之后为 1.67 倍。但按完成一项任务的成本计算,排序可能反转,而且这不是少数极端运行拉高的结果,中位数也支持这一点。DeepSWE 中,max effort 的成本中位数为 Sonnet 5 $23.28、Opus 4.8 $12.35。

Claude Sonnet 5 的价格是多少?

截至 2026 年 8 月 31 日,每百万输入 token $2、每百万输出 token $10;从 9 月 1 日起分别为 $3 和 $15。所有已发布价格项均上涨 50%:5 分钟缓存写入从 $2.50 升至 $3.75,1 小时缓存写入从 $4 升至 $6,缓存命中从 $0.20 升至 $0.30。促销期的 Batch 定价为 $1/$5。

为什么更便宜的模型,最终任务成本反而更高?

因为账单随步骤数增长,而不是随任务数增长。随着 effort 档位升高,Sonnet 5 的步骤数中位数从 70 升至 260,Opus 4.8 则从 47 升至 116;max 档时,Sonnet 每项任务读取 72.4M token,而 Opus 为 17.0M。多读四倍文本,足以吞没每个 token 60% 的折扣。

Opus 5 比 Sonnet 5 强很多吗?

按单次尝试看,是的:在 DeepSWE 上,Opus 4.8 的 pass@1 比 Sonnet 5 高 3.5 到 10.3 个百分点,差距在低档位最大。

如果每个任务都给四次机会,差距几乎消失:Sonnet 5 high effort 的 pass@4 为 79.6%,Opus 4.8 为 77.9%;max 档分别为 78.8% 和 79.3%。Sonnet 也能达到相近结果,只是需要更多尝试,而每次尝试都要付费。

Sonnet 5 在 9 月 1 日涨价后,结论会变吗?

交叉点会下移,而不是上移。Sonnet 5 的单 token 优势从 60% 缩至 40%,Opus 5 仍为 $5/$25,因此同预算表中的每一种组合对 Sonnet 都更不利。唯一对 Sonnet 有利的一行——首发价下 low 档比 Opus low 便宜 36%——在标准价下会缩小到大约便宜 4%。

延伸阅读