Anthropic 仅公布了三个可直接对比其 Mythos 系列模型与 Claude Opus 4.8 的基准测试:SWE-Bench Pro(80.3% 对 69.2%)、Cognition 的 FrontierCode(29.3% 对 13.4%)以及 ExploitBench(78% 对 40%)。网上流传的所有其他与“Claude Mythos vs Claude Opus”相关的数字——Humanity's Last Exam 分数、GPQA、AIME,或除 4.8 之外的 Opus 版本——都不在 Anthropic 的发布内容中。其中有些是完全编造的;有些则是把当前的 Mythos 模型与落后整整一代的 Opus 版本进行对比。
还有第二个复杂之处:几乎没有人在并排比较 Mythos 和 Opus 4.8 时实际运行的是 Mythos。大多数人调用 Mythos 级 API 时得到的模型是 Fable 5,而一旦请求涉及网络安全、生物学或其他少数被标记的领域,它就会静默重定向到 Opus 4.8。因此,很多“Mythos vs Opus”的正面比较,作者并未意识到,其实是在拿 Opus 4.8 和它自己比。
Anthropic 实际发布的三个基准测试
Anthropic 于 2026 年 6 月 9 日发布的 Fable 5 和 Mythos 5 包含一张基准测试表,将底层的 Mythos 系列模型与 Claude Opus 4.8 进行比较。Anthropic 自身的发布内容以及直接引用它的独立媒体中,持续出现了三个结果,包括 The Decoder 和 Vellum 对同一发布的解析:
| 基准 | Mythos-class | Claude Opus 4.8 |
|---|---|---|
| SWE-Bench Pro(真实 GitHub 问题修复) | 80.3% | 69.2% |
| Cognition 的 FrontierCode | 29.3% | 13.4% |
| ExploitBench(进攻性安全任务) | 78% | 40% |
SWE-Bench Pro 的差距为 11.1 分,如果你正在决定是否值得为编码工作追逐 Mythos 级推理,这个数字最值得引用。ExploitBench 分数对普通买家来说最不重要:它衡量的是在 Fable 5 的安全分类器介入之前底层模型的原始能力,而在生产环境中,Fable 5 在网络安全任务上的得分接近 0%,因为分类器会在这种能力真正暴露出来之前将其重定向到 Opus 4.8。
Anthropic 发布的任何数字都没有将 Mythos-class 和 Opus 4.8 在 Humanity's Last Exam、GPQA Diamond、AIME 或 Terminal-Bench 上相互对比。如果你看到一个表格把这些基准都填上了,并且两个模型都有数据,请问它的来源——截至撰写本文时,这并不是来自 Anthropic。
Anthropic 未发布的重复评分
搜索“Claude Mythos vs Claude Opus”会找到几个包含这场对比详细基准测试表格的网站。将它们与 Anthropic 的发布内容交叉核对后,发现有两个独立的问题,而不是一个:
没有可追溯来源的数字。 Benchlm 对 Mythos 5 与 Opus 4.6 的比较列出了 Mythos 的 Math 基准分数为 97.6%,而 Opus 为 36.3%——在一个两种模型的公开材料都未以该名称提及的基准上,相差 61 分。Anthropic 的公告、The Decoder 或 Vellum 对其的独立解读,以及任何 Opus 4.8 system card 中都没有出现这两个数字。
真实数字,错误的对手。 同一个 Benchlm 页面把 Mythos-class 自己的 SWE-Bench Pro 分数算对了,80.3%,与 Anthropic 的真实数据一致,但却把它与 Claude Opus 4.6 的 53.4% 配对,而不是 Opus 4.8 的 69.2%。Opus 4.6 早于 Fable 5/Mythos 5 的发布,跨越了多个发布周期,因此把它与更新的 Mythos 数值相配,会人为制造出 27 个百分点的差距,而当前一代的对比只显示 11 个百分点。
这两种说法都不会使其背后的主张——即 Mythos 级推理在编码和 agentic 任务上优于 Opus 4.8——变成错误。SWE-Bench Pro 的 11 分差距是真实存在的。但 11 分的差距和人为制造的 44 分差距,会导向关于 Mythos 实际到底好多少的不同结论,而这两个数字中只有一个来自 Anthropic。
为什么问这个问题的大多数人无法自己测试它
基准测试表格遗漏了这一点:Mythos 5 并不是你可以调用的模型。Anthropic 仅将其提供给 Project Glasswing 合作伙伴——美国政府网络防御者——并通过一个可信访问计划向网络安全组织,以及另外向生物医学研究人员开放。没有定价页面,没有注册表单,也没有你可以生成的 API key 来运行你自己的 SWE-Bench Pro 对比。
目前普遍可用的是 Fable 5:其底层仍是相同的 Mythos-class 权重,并配有安全分类器,会监控每个请求是否包含网络安全、生物/化学或模型蒸馏内容。当某个请求触发其中一个分类器时,Fable 5 会在对话过程中将其交给 Opus 4.8,告知你发生了切换,并按 Opus 4.8 更低的按 token 计费费率对重定向部分收费。Anthropic 自己的数据将触发率定在低于 5% 的会话中。对于其余 95% 以上的情况,你调用 Fable 5 得到的确实是上述 Mythos-class 基准表现;而对于被标记的少数情况,你实际上又是在让 Opus 4.8 与它自己对比测试。
这就是为什么那么多“Mythos vs Opus”的文章读起来都很模糊(“Mythos 在复杂的多步骤任务上显然更强”),而不是基于基准测试:大多数作者根本没有 Mythos 可供测试。他们要么在重复 Anthropic 自己发布的数字,要么在重复彼此没有来源的数字,要么是在描述 Fable 5 却把它称作 Mythos。
那么你到底应该使用哪一个
如果你的工作是通用软件工程、写作或分析,那么实际的选择并不是 Mythos vs Opus 4.8 ——而是 Fable 5 vs Opus 4.8,因为 Fable 5 是你实际上能获得的最接近 Mythos 级能力的东西。Fable 5 和 Opus 4.8 的定价不同(每百万 tokens 分别为 $10/$50 vs $5/$25),因此 11 分的 SWE-Bench Pro 差距需要大致值双倍成本,Fable 5 才能在对价格敏感的工作负载上算得过账。对于已经按任务难度在不同 Claude 级别之间路由的团队来说,这是一项按任务决定的选择,而不是一刀切的选择;这也是 API aggregator 自动处理的路由逻辑,而不是为所有事情都只选一个级别。
如果你的工作是安全研究、漏洞利用开发,或者是具有合法机构案例的生物医学研究,那么 ExploitBench 差距(78% 对 40%,测量的是未受阻止的模型)才是关键数字,而真正的下一步是申请 Anthropic 的可信访问计划——而不是去寻找声称转售 Mythos 访问权限的供应商,因为这并不存在可供购买的产品。
要全面了解 Fable 5 和 Mythos 5 之间的关系——同一模型、不同的安全配置,以及这在实际使用中会给你带来什么影响——请参见 Fable 5 vs Mythos 5。
常见问题
Claude Mythos 比 Claude Opus 4.8 更强大吗?
在 Anthropic 已发布的三项正面对比基准——SWE-Bench Pro、Cognition 的 FrontierCode 和 ExploitBench——上,确实,领先幅度为 11 到 38 分,具体取决于基准。除此之外的说法,包括这场对比中的 Humanity's Last Exam 或 GPQA 分数,都没有任何 Anthropic 发布内容作为来源。
我真的可以自己测试 Claude Mythos 与 Opus 4.8 的对比吗?
不能直接使用。Mythos 5 仅限于 Project Glasswing 政府网络防御合作伙伴以及一个小型受信任访问计划。你可以测试的是 Fable 5,它共享相同的底层权重,并在大约 95% 的会话中提供 Mythos 级输出,其余会话则会重定向到 Opus 4.8。
为什么有些网站显示的 Mythos 与 Opus 分数不同?
反复出现的两个原因是:没有可追溯来源的数字,这些数字并未出现在 Anthropic 的发布中;以及真实的 Mythos 级分数却与较旧的 Opus 版本(4.6 而不是 4.8)进行对比,这会夸大表面差距。
Fable 5 和 Mythos 5 的真正区别是什么?
它们是同一个模型。Fable 5 会运行安全分类器,将与网络安全、生物学以及蒸馏相关的请求重定向到 Opus 4.8;Mythos 5 则取消了这些防护措施,但仅限于经过审核的合作伙伴使用。有关完整说明,请参见 Fable 5 vs Mythos 5。
Opus 4.8 比 Mythos 系列模型更便宜吗?
是的。Opus 4.8 的价格为每百万输入/输出 tokens 5 美元/25 美元,而 Fable 5 和 Mythos 5 则为 10 美元/50 美元。对于不需要 SWE-Bench Pro 或 FrontierCode 提升的工作负载,Opus 4.8 是成本更低的选择,而且无需担心分类器重路由。
结论
Anthropic 发布的三个基准显示,Mythos 级推理以一个真实、适度的优势领先于 Opus 4.8。除这三个数字之外的所有内容——以及大多数推动“Mythos 碾压 Opus”标题的说法——要么没有来源,要么是在与过时的 Opus 版本比较。而且,除非你是经过审核的网络防御或生物医学合作伙伴,否则你实际会拿来与 Opus 4.8 进行测试的模型是 Fable 5,而不是 Mythos 5 本身。
