Claude Opus 5.5 不是泄露出来的模型名称,而是已经正式发布的产品:Anthropic 于 2026 年 9 月 22 日宣布了这款模型,API 价格为每百万 Token $4/$20,上下文窗口达到 1 million tokens。需要注意的是,更低的标价不一定意味着每个任务的最终成本都会下降,尤其是在最高 effort 设置下。
Claude Opus 5.5 评测:一张表看懂是否值得选
| 问题 | 答案 |
|---|---|
| Claude Opus 5.5 是否已正式发布? | 是。Anthropic 于 2026 年 9 月 22 日宣布了这款模型。 |
| API 模型 ID | claude-opus-5-5 |
| 标准 API 价格 | 每百万输入 Token $4;每百万输出 Token $20 |
| 上下文窗口 | 1 million tokens |
| 最大输出 | 128,000 tokens |
| 最适合的场景 | 长时间编码任务、Agent 工作流、研究,以及高价值写作 |
| 主要注意事项 | 思考始终开启,最高 effort 运行可能消耗明显更多的输出 Token |
Anthropic 表示,Opus 5.5 在大多数任务上的表现达到 Claude Fable 5.1 的水平;在典型工作负载下,运行成本比 Opus 5 低 40%,输出速度则提升超过 30%。不过,这些是官方定位说法,不能替代针对自身工作负载的实测。根据发布材料,Opus 5.5 已通过 Claude、Claude Code、API 以及主要云服务渠道提供。
API 成本:$4/$20 不等于每个任务都更便宜
如果你的流量以输入为主,或者能够充分利用提示词缓存,Claude Opus 5.5 的标价确实很有吸引力。它比 Opus 5 的 $5/$25 低 20%;但 Anthropic 所说的典型工作负载节省幅度更大,是因为缓存读取和任务行为也会影响最终总成本。
| 模型 | 输入 / 1M tokens | 输出 / 1M tokens | 上下文 |
|---|---|---|---|
| Claude Opus 5.5 | $4 | $20 | 1M tokens |
| Claude Opus 5 | $5 | $25 | 1M tokens |
| Claude Fable 5.1 | $10 | $50 | 1M tokens |
以一个未使用缓存的简单任务为例:输入 200,000 tokens、输出 30,000 tokens,在 Opus 5.5 上的成本约为 $1.40,其中输入成本 $0.80,输出成本 $0.60。相同 Token 用量放在 Opus 5 上,成本约为 $1.75。缓存输入的标价为每百万 Token $0.20,因此反复使用相同简报时,输入侧成本可能显著下降。
但上述计算建立在 Token 用量相同的前提上,而早期独立评论表明,这个前提并不稳妥。Artificial Analysis 报告称,在其对比中,Opus 5.5 每个最高 effort 任务大约会产生 119,000 个输出 Token;Opus 5 约为 73,000 个,GPT-6 Astra 则为 27,000 个。换句话说,模型虽然单 Token 更便宜,却可能因为额外消耗了足够多的 Token,导致每个成功完成任务的节省幅度被压缩,甚至完全抵消。
除非任务确实需要最高 effort,否则大多数生产任务使用 high 或 medium effort 就够了。较低的 effort 设置不只是一个质量开关,它还会改变延迟、输出量和最终账单。
发布当天的证据能说明什么
截至发布当天,现有证据显示 Opus 5.5 很适合处理复杂、多步骤任务,但现在还不能断言模型排名已经尘埃落定。Anthropic 的发布页面称,Opus 5.5 在大多数工作上的表现可与 Fable 5.1 持平,在典型负载下比 Opus 5 便宜 40%,速度则快 30% 以上。Artificial Analysis 给出了 58 分的 Intelligence Index,并特别指出该模型在最高 effort 下拥有很大的输出预算。
早期测试者的反馈,则更具体地集中在写作和编码体验上。早期测试者 Theo Jaffee 表示,Anthropic “真的修好了写作”,而且相比近期的 Claude 版本,模型输出更直接、更自然(X 上的原帖)。这对评估写作场景很有参考价值,但归根结底仍只是单个用户的早期体验。
“我最大的感受是,他们真的修好了写作。”——@theojaffee,Opus 5.5 早期测试者(X)
另一类负面信号则不是风格问题,而是运行层面的问题。有些早期用户表示,最高 effort 运行会消耗大量 Token;还有用户称,Claude Code 中的 Opus 5.5 “就是无缘无故地争辩,然后直接放弃任务”(X 上的原帖)。这并不是经过测量的失败率,但也正说明了为什么迁移前应该在自己的 Agent 测试框架中验证,而不能只看发布图表得出结论。
目前能下的结论应该保持克制:Opus 5.5 在长时间编码和写作工作流中很有潜力,但独立、可复现的正面对比测试仍然有限。不要把发布当天的舆论反馈当成稳定性保证。
按工作负载选择 Opus 5.5,不要只看排行榜
长时间编码和 Agent 任务优先考虑 Opus 5.5
当一个任务涉及多个文件、大量工具调用或多轮推理时,Opus 5.5 是目前最值得考虑的候选模型。它的价值不只是回答一个难问题,而是把一个混乱、复杂的任务持续推进到完成。验收时,应重点观察测试结果、代码 diff 和工具调用是否真正完成。
写作和研究场景建议选择性使用
早期反馈对它的写作能力评价格外积极,尤其是输出没那么“Claude 味”。如果是高价值简报、研究汇总,或者能通过更好的初稿减少审核时间的编辑工作,Opus 5.5 值得考虑。但对于便宜模型就能完成的常规改写,它的成本效益并不理想。
日常流量继续使用更便宜的模型
短文本分类、FAQ 草稿、信息抽取和模板化代码,通常都不值得使用 Opus 级别的价格。把这些任务路由到更低档位的模型,把 Opus 5.5 留给那些更少重试或更强判断力确实能够改变结果的场景。
不要默认它在科学或自动化任务上占优
发布当天的讨论显示,Opus 5.5 在编码和写作上的表现更强,但在部分科学和自动化评测中的定位相对较弱。Anthropic 所说的“most tasks”并不等于“every task”。如果你的工作负载涉及科学分析、浏览器自动化或结构化工具调用,应分别测试这些路径。
高风险领域需要单独评估
Anthropic 表示,Opus 5.5 在生物学和网络安全领域采用了接近 Fable 5.1 的安全防护机制,部分请求还可能回退到其他模型。通用能力升级,并不意味着拒答会更少,也不代表它会与 Opus 5 采用相同的路由行为。
可能导致 API 或 Claude Code 工作流出问题的迁移细节
- 有意识地修改模型 ID。 使用
claude-opus-5-5;固定生产流量时,不要依赖服务商提供的友好显示名称。 - 重新测试工具调用。 早期 API 用户反映,
any或tool等tool_choice值的支持方式可能与之前不同,而none在某些情况下可能返回空内容。请结合你所使用的 SDK 版本确认实际行为。 - 为始终开启的思考机制预留预算。 社区反馈称,Opus 5.5 无法关闭 thinking。检查你的集成如何存储 thinking blocks,以及这些内容如何计入输出 Token 账单。
- 测试 effort 默认值。 早期报告称,默认 effort 是 medium,而不是 high。如果输出量或延迟会影响应用表现,请显式固定该设置。
- 确认配额和重置行为。 Anthropic 宣布提高 Pro、Max 和 Team 计划的五小时限额,并提供可保存的限流重置功能。用户还反映,在最初几个小时里,重置状态的显示并不一致,因此在向团队承诺容量之前,应先确认实际账户状态。
- 采用影子迁移。 向 Opus 5.5 和当前模型分别发送 20–50 条具有代表性的提示词,对比通过率、输出 Token、延迟、工具调用完成率、拒答情况和人工审核时间。
如果你在做 API 集成,Claude API 页面是 AIReiter 上适合测试 Claude 系列访问能力的入口,无需围绕单一服务商重新设计应用。
Claude Opus 5.5 常见问题
Claude Opus 5.5 是否已正式发布?
是。Anthropic 于 2026 年 9 月 22 日宣布了 Claude Opus 5.5。官方发布页面见Anthropic 的 Claude Opus 5.5 公告。
Claude Opus 5.5 的 API 价格是多少?
标准标价为每百万输入 Token $4、每百万输出 Token $20。根据发布当天的定价信息,缓存输入的价格为每百万 Token $0.20。
Opus 5.5 比 Opus 5 便宜吗?
按 Token 计算,是的:Opus 5.5 的标价为 $4/$20,Opus 5 则为 $5/$25。但按每个完成任务计算时,应以实际 Token 用量为准,因为 Opus 5.5 在最高 effort 下运行可能产生明显更多的输出。
Claude Opus 5.5 比 Fable 5.1 更好吗?
Anthropic 表示,Opus 5.5 在大多数任务上的表现达到 Fable 5.1 的水平,同时成本低得多。早期用户反馈更看好 Opus 5.5 的编码和写作能力,但这一结论并不适用于科学、自动化或安全敏感任务中的所有场景。
可以关闭 Opus 5.5 的 thinking 吗?
早期 API 报告称,thinking 始终处于开启状态。应将其视为集成限制;在构建对 Token 成本敏感的工作流前,请确认当前开发者文档中的说明。
Opus 5.5 能生成图片或视频吗?
不能。Opus 5.5 是具备图像理解能力的文本推理模型,不是图像或视频生成模型。
应该立即从 Opus 5 切换吗?
不建议。先进行范围受控的影子测试。只有在综合考虑 Token 用量、延迟、工具行为和审核时间后,Opus 5.5 能够改善每个成功完成任务的成本或质量时,才值得切换。
最终判断:先做范围受控的试点,再调整生产流量
如果你的工作负载包含长时间编码、多步骤研究,或者输出质量能够显著减少审核时间,那么 Claude Opus 5.5 现在就值得试点。它的 $4/$20 价格相较 Opus 5 的标价确实是一次明显改善,但尚未完全解决的取舍是:每个 Token 的价格更低,却可能在最高 effort 下消耗更多 Token。
让两个模型分别处理同一批 20–50 个真实任务,明确固定 effort 设置,然后比较每次成功完成任务的成本,而不是每百万 Token 的成本。对于你的系统来说,这才是判断 Claude Opus 5.5 是否真的更便宜的关键指标。