Claude Opus 5.5 High 确实已经发布,并不是传闻中的产品。但“1,509 分、Text Arena 第一”只是某个时间点的榜单结果,并非永久有效的产品规格。真正值得关注的购买问题是:对于长期运行的编程和研究任务,它是否值得你接受始终开启的自适应思考、更慢的高强度运行,以及迁移 API 后可能出现的新 400 错误。
Anthropic 实际发布了什么
Anthropic 宣布了 Claude Opus 5.5,时间是 September 22, 2026,这是 Claude 5.5 系列的首个模型。官方发布信息显示,它可通过 Claude 和 API 渠道使用,定位于智能体编程、计算机操作和知识型工作。直接使用的模型 ID 是 claude-opus-5-5;标准上下文窗口为 1 million tokens,标准最大输出为 128,000 tokens。
| 事实 | Claude Opus 5.5 | 这并不能证明什么 |
|---|---|---|
| 发布日期 | September 22, 2026 | 所有网关都使用相同的路由或价格 |
| API 模型 ID | claude-opus-5-5 | 旧版 Opus 5 集成可以直接兼容 |
| 上下文窗口 | 1 million tokens | 把窗口填满就能提升所有任务的表现 |
| 默认强度 | Medium | Medium 等同于 Opus 5 过去的默认行为 |
| 思考模式 | 自适应且始终开启 | 延迟会完全可预测 |
Anthropic 在官方公告中称,Opus 5.5 在大多数工作上的表现达到 Claude Fable 5.1 的水平,而典型工作负载下的运行成本比 Opus 5 低 40%。这些都属于厂商说法;Anthropic 同时也提醒,随着模型之间的基准分差越来越小,基准测试成绩正变得越来越难以准确反映真实使用差异。
1,509 分的 Text Arena 成绩到底说明了什么
Text Arena 宣布,Claude Opus 5.5 High 以 1,509 分首次登顶,领先 Opus 5 High 18 分。这说明在 Arena 的测试环境中,当前用户偏好很强,但它并不是对编程、工具调用或事实准确性的全方位测试。
这个数字可能很快变化。之后的追踪快照显示了不同分数,也进一步说明 Arena 排名具有明显的时效性。Arena 公告还把 Opus 5.5 High 放在 Pareto 前沿上,对应的综合价格为每 million tokens $16。不过,在为实际工作负载做预算时,这个综合数字不能替代官方 API 价格表。
之所以要保留这份不确定性,是因为一位用户在 Arena 公告下指出,18 分的差距小于误差线。更合理的做法是把这个排名当作值得验证的信号,而不是证明 Opus 5.5 High 在所有任务上都胜过所有模型。
“1509 对 1491,只差 18 分,说实话,这个差距比误差线还小。”——@Avery_Coree,回复 Text Arena 公告(来源)
别只看榜单:其他证据怎么说
Anthropic 发布的测试表显示,Opus 5.5 在 Terminal-Bench 4.0 上得分 66.4%,FrontierCode Main 上为 54.4%,CursorBench 4.0 上为 57.8%,GDPval-AA v2.1 上为 1,846 Elo。它也并非全面领先:GPT-6 Astra 在 AutomationBench 上得分 41.4%,高于 Opus 5.5 的 40.0%;在 Terminal-Bench-Science 上得分 64.6%,也高于 Opus 5.5 的 58.7%。
| 评测项目 | Opus 5.5 | 值得关注的对比 |
|---|---|---|
| Terminal-Bench 4.0 | 66.4% | Fable 5.1:55.8%;GPT-6 Astra:57.9% |
| FrontierCode Main | 54.4% | GPT-6 Astra:53.3% |
| CursorBench 4.0 | 57.8% | Opus 5:46.6% |
| GDPval-AA v2.1 | 1,846 Elo | Fable 5.1:1,735;Opus 5:1,708 |
| AutomationBench | 40.0% | GPT-6 Astra:41.4% |
| Terminal-Bench-Science | 58.7% | GPT-6 Astra:64.6% |
这些数字必须结合测试设置解读。Anthropic 的大多数 Opus 5.5 结果都采用了最高级别的自适应强度;Terminal-Bench 中,Opus 5.5 使用 xhigh,而 Astra 使用 high。Terminal-Bench 给出的 Opus 5.5 标准误差为 ±2.6 分,因此相近的成绩不应被当成精确排名。
独立评测大体指向相似结论,但也暴露出一些实际摩擦。Sonar 的 Java 评测显示,Opus 5.5 High 的通过率为 87.68%,低于 Opus 5 的 88.6%;生成代码量则从 916,813 行降至 664,890 行,总问题数从 18,814 个降至 10,941 个。同一测试还发现,每 million 行代码的缺陷密度从 576 上升到 644,并发相关问题也有所增加。这说明自动化测试仍应保留在流程中,而不是未经审查就直接接收生成代码。
哪些场景值得优先测试 Claude Opus 5.5 High
它最适合的场景,是需要长时间运行、频繁调用工具的任务——在这些任务中,规划能力和更少的重试往往比即时响应更重要。Anthropic 称,Opus 5.5 用不到三小时完成了一次 200,000 行代码审计,而 Opus 5 用时超过 20 小时;另一个 HAProxy 从 C 重写到 Rust 的任务,Opus 5.5 用时 9.5 小时,Fable 5.1 则为 12 小时。这些案例都来自 Anthropic,因此更适合当作试点假设,而不是保证。
真实用户的反馈也呈现出类似趋势,但并不一致。一位 Reddit 用户表示,模型大约四分钟就重建了一个网站,而且设计效果更好;另一位用户则说,Opus 5.5 在编排任务中“就是停不下来”。不过,写作质量并没有得到所有人的认可:@rchitectopteryx 称它“在写作方面产出的垃圾是我见过最糟的”。因此,实际建议必须基于具体工作负载:优先在多步骤编程、代码仓库审计,以及拥有客观验收标准的研究任务上测试,而不要只拿审美高度主观的文案任务来判断。
“我注意到 Opus 5.5 的一个特点是,它就是停不下来。给它一个编排任务,它就会……一直跑下去。”——@bridgerloftin(来源)
价格、强度,以及等待的成本
官方直接 API 价格为:输入每 million tokens $4,输出每 million tokens $20,读取缓存每 million tokens $0.20。写入缓存的价格为每 million tokens $5。Anthropic 表示,更低的单价加上每项任务使用更少的 tokens,使 Opus 5.5 相比 Opus 5 的典型成本降低 40%;但具体比例会受到缓存命中率、强度、重试次数和工具调用的影响。
| API 项目 | Opus 5.5 | Opus 5 |
|---|---|---|
| 输入 / 1M tokens | $4 | $5 |
| 输出 / 1M tokens | $20 | $25 |
| 读取缓存 / 1M tokens | $0.20 | $0.50 |
| 五分钟缓存写入 / 1M | $5 | $6.25 |
| 快速模式 | $8 输入 / $40 输出 | — |
更高的强度并不自动等于更高的性价比。BitsMinds 的独立评测引用 Artificial Analysis 的单任务成本数据称,Medium 为 $1.34,High 为 $1.82,xhigh 为 $3.46,Max 为 $5.98;对应的基准测试分数分别为 51、54、56 和 58。如果你的任务并不需要最高级别的规划,High 或 Medium 可能才是更合适的运行档位。
切换前必须完成的 API 迁移检查
Claude Opus 5.5 并不是只改一个模型字符串就能完成的升级。Anthropic 的迁移指南和独立评测都指出,下面四项变化值得在 staging 环境中测试:
- 无法关闭思考模式。使用已禁用思考模式或手动思考预算的请求可能会返回 HTTP 400。请改用自适应思考,并通过强度控制行为。
- 强制选择工具的方式发生变化。
tool_choice中的any或指定工具等值不再被接受;应围绕受支持的自动选择和验证机制重新设计调用循环。 - 思考区块与对话历史有关。按照要求保留返回的思考区块,并测试修改消息或工具调用历史后的行为。
- 进度处理方式发生变化。工具调用之间的文本可能会出现在思考区块中,因此需要根据区块类型解析进度,不能假设可见文本始终位于第一个内容项中。
在迁移生产流量之前,先使用 staging key 完成这些检查。在确认成功完成率、重试次数、延迟、计费 tokens 以及人工修正时间后,再下线旧路由。
一套实用的 Opus 5.5 High 试点方案
不要拿榜单提示词做测试,应该选择边界清晰的真实任务:
- 挑选 20 个过去已经解决的工单、审计任务或研究交付物。
- 在完全相同的工具和验收测试下,分别使用 Opus 5.5 的 Medium 和 High 运行。
- 记录完成率、重试次数、耗时、输入/输出/缓存 tokens,以及评审人员投入的分钟数。
- 分别检查并发、安全性和事实准确性问题,不要把它们简单压缩成一个总分。
- 比较每个合格交付物的成本,而不是每个请求的成本。
- 只有在质量提升足以抵消额外等待时间和 tokens 消耗时,才使用 Max。
如果 Opus 5.5 能在你的常规工作中降低整体交付成本或评审负担,那么切换就有合理性。单凭 Arena 排名还不够。
Claude Opus 5.5 High 常见问题
Claude Opus 5.5 High 已经正式发布了吗?
Claude Opus 5.5 已由 Anthropic 正式发布,时间是 September 22, 2026。“High”是评测和工具中使用的一种强度配置,并不是一个拥有独立模型身份的单独产品公告。
1,509 还是当前的 Text Arena 分数吗?
不一定。1,509 是 September 26 Arena 公告中的分数;之后的追踪数据已经显示了不同快照。引用这个数字时,应同时注明日期和来源。
Opus 5.5 High 比 Fable 5.1 更好吗?
它在多项已发布评测中领先,而且每个 token 的价格更低,但 Anthropic 表示,真实使用中的差距没有基准测试分数看起来那么大。Fable 仍可能在某个特定代码仓库、工作流或复杂的多文件任务中胜出,因此最好让两者接受同一套试点测试。
Claude Opus 5.5 的价格是多少?
直接 API 的基础价格为:输入每 million tokens $4,输出每 million tokens $20,读取缓存每 million tokens $0.20,五分钟缓存写入每 million tokens $5。网关价格和订阅方案中的用量规则可能不同。
应该使用最高强度吗?
通常不应该。先从 Medium 或 High 开始,测量合格任务的质量和总成本,再把 Max 留给确实能从更深层规划中受益的工作。最高强度可能提高基准测试分数,但也会增加延迟和 tokens 消耗。
这个决定其实很简单,尽管榜单并不简单:如果你的长期工作流能通过更高的完成质量抵消等待时间和迁移成本,就选择 Claude Opus 5.5 High。对于短任务、对延迟敏感的任务,或对文风高度敏感的任务,在自己的试点证明明显收益之前,仍应保留更便宜或更快的路线。