Anthropic 僅發布了三項直接比較其 Mythos 級模型與 Claude Opus 4.8 的基準:SWE-Bench Pro(80.3% 對 69.2%)、Cognition 的 FrontierCode(29.3% 對 13.4%)以及 ExploitBench(78% 對 40%)。網路上流傳的所有其他標註為「Claude Mythos vs Claude Opus」的數字——Humanity's Last Exam 分數、GPQA、AIME,或非 4.8 的 Opus 版本——都不在 Anthropic 的發布內容中。其中有些是憑空捏造的;有些則是把目前的 Mythos 模型與落後一整代的 Opus 版本進行配對比較。
還有第二個複雜之處:幾乎沒有人在並排比較 Mythos 和 Opus 4.8 時,真的在執行 Mythos。大多數人呼叫 Mythos 級 API 時拿到的模型其實是 Fable 5,而一旦請求碰到資安、生物學,或少數其他被標記的領域,它就會悄悄轉送到 Opus 4.8。因此,很多「Mythos vs Opus」的正面對決,作者自己都沒察覺,其實是 Opus 4.8 在跟它自己比。
Anthropic 實際發布的三項基準測試
Anthropic 於 2026 年 6 月 9 日推出的 Fable 5 和 Mythos 5包含一個基準測試表,將底層的 Mythos 類型模型與 Claude Opus 4.8 進行比較。有三項結果在 Anthropic 自家的發布內容與直接引用該內容的獨立媒體中一致出現,包括 The Decoder 和 Vellum 對同一發布內容所做的解析:
| 基準 | Mythos-class | Claude Opus 4.8 |
|---|---|---|
| SWE-Bench Pro(真實 GitHub 問題解決) | 80.3% | 69.2% |
| Cognition 的 FrontierCode | 29.3% | 13.4% |
| ExploitBench(進攻性資安任務) | 78% | 40% |
SWE-Bench Pro 的差距 11.1 分,是在你判斷 Mythos 級推理是否值得投入於程式開發工作時,最值得引用的數字。對一般買家而言,ExploitBench 分數最不重要:它衡量的是底層模型在 Fable 5 的安全分類器介入之前的原始能力,而在正式環境中,Fable 5 在網路安全任務上的得分接近 0%,因為分類器會在這種能力真正暴露之前,將這些任務重新導向到 Opus 4.8。
Anthropic 發布的任何數字都沒有把 Mythos-class 和 Opus 4.8 在 Humanity's Last Exam、GPQA Diamond、AIME 或 Terminal-Bench 上彼此對照。如果你看到一個表格把這些基準對兩個模型都填上了,請問它的來源是什麼——截至本文撰寫時,這不是來自 Anthropic。
Anthropic 未發布但被重複提及的分數
搜尋「Claude Mythos vs Claude Opus」會找到幾個網站,其中有針對這場對決的詳細基準測試表。將它們與 Anthropic 的發布內容交叉比對後,會發現有兩個獨立的問題,而不是一個:
沒有可追溯來源的數字。Benchlm 的 Mythos 5 與 Opus 4.6 比較列出 Mythos 的 Math 基準分數為 97.6%,而 Opus 為 36.3%——在一個兩個模型的公開資料都未以該名稱提及的基準上,差距達 61 分。這兩個數字都沒有出現在 Anthropic 的公告中,也沒有出現在 The Decoder 或 Vellum 對該公告的獨立撰文中,或任何 Opus 4.8 system card 中。
真實數字,錯誤對手。 同一個 Benchlm 頁面正確呈現了 Mythos-class 自身的 SWE-Bench Pro 分數,80.3%,與 Anthropic 的真實數字一致,但卻把它與 Claude Opus 4.6 的 53.4% 相比,而不是 Opus 4.8 的 69.2%。Opus 4.6 的發布時間早於 Fable 5/Mythos 5 的上市,多個版本週期之前,因此把它拿來和較新的 Mythos 數字配對,硬生生製造出 27 個百分點的差距;而以當前世代來比較時,差距只有 11 個百分點。
兩種說法都沒有讓核心主張——即 Mythos 級推理在程式設計和 agentic 任務上勝過 Opus 4.8——變成錯誤。SWE-Bench Pro 的 11 分差距是真實的。但 11 分差距和刻意製造的 44 分差距,會導致對 Mythos 實際上到底好多少得出不同結論,而這兩個數字中只有一個是來自 Anthropic。
為什麼大多數問這個問題的人無法自己測試它
基準測試表格省略了這一點:Mythos 5 不是你可以直接呼叫的模型。Anthropic 只將它提供給 Project Glasswing 夥伴——美國政府的網路防禦者——並透過一個可信存取計畫,向資安組織以及另外的生物醫學研究人員開放。沒有定價頁面,沒有註冊表單,也沒有可讓你自行產生 API key 來執行自己的 SWE-Bench Pro 比較。
目前一般可用的是 Fable 5:它採用相同的底層 Mythos-class 權重,並配備安全分類器,會監看每個請求中是否包含資安、生物/化學,或模型蒸餾相關內容。當某個請求觸發其中一個分類器時,Fable 5 會在對話進行中將其交給 Opus 4.8,告知你此事已發生,並以 Opus 4.8 較低的每 token 費率計費被改派的部分。Anthropic 自己的資料顯示,觸發率低於 5% 的會話。至於其餘超過 95% 的情況,你呼叫 Fable 5 所得到的,確實就是高於它的 Mythos-class 基準;而對於被標記的少數情況,你又是在拿 Opus 4.8 與它自己做測試。
這就是為什麼那麼多「Mythos vs Opus」的文章讀起來都很模糊(「Mythos 在複雜的多步驟任務上明顯更好」),而不是有基準測試依據:大多數作者根本沒有拿到 Mythos 來測試。他們不是在重複 Anthropic 自己發布的數據,就是在重複彼此沒有來源的數字,或是把 Fable 5 描述成 Mythos。
那麼你實際上應該使用哪一個呢
如果你的工作是一般軟體工程、寫作或分析,實際上的選擇不是 Mythos vs Opus 4.8——而是 Fable 5 vs Opus 4.8,因為 Fable 5 是你實際上能取得的、最接近 Mythos 級能力的選項。Fable 5 和 Opus 4.8 的定價不同(每百萬 tokens 分別為 $10/$50 vs $5/$25),因此 SWE-Bench Pro 相差 11 分的差距,對於價格敏感的工作負載來說,Fable 5 必須帶來大約兩倍的價值才划算。對於已經會依任務難度在不同 Claude 等級之間切換的團隊來說,這是按任務決定,而不是一體適用;這也正是 API aggregator 會自動處理的路由邏輯,而不是為所有事情只選一個等級。
如果你的工作是安全研究、漏洞利用開發,或具有合法機構個案的生物醫學研究,那麼 ExploitBench 差距(78% 對 40%,衡量未受阻擋的模型)才是關鍵數字,而真正的下一步是申請 Anthropic 的 trusted-access 計畫——而不是去尋找聲稱轉售 Mythos 存取權的供應商,因為那並不存在可購買的產品。
如需完整了解 Fable 5 和 Mythos 5 彼此之間的關係——同一模型、不同的安全設定,以及這在實務上會帶來什麼代價——請參閱 Fable 5 vs Mythos 5。
常見問題
Claude Mythos 比 Claude Opus 4.8 更強大嗎?
在 Anthropic 已公開的三項一對一基準測試——SWE-Bench Pro、Cognition 的 FrontierCode,以及 ExploitBench——是的,依基準測試不同,領先 11 到 38 分。超出這三項基準測試的說法,包括這場對比中的 Humanity's Last Exam 或 GPQA 分數,都沒有引自 Anthropic 已發布的任何內容。
我真的可以親自測試 Claude Mythos 與 Opus 4.8 嗎?
不直接提供。Mythos 5 僅限於 Project Glasswing 政府網路防禦合作夥伴以及少數受信任存取計畫。您可以測試的是 Fable 5,它共享相同的底層權重,並在約 95% 的會話中提供 Mythos 級輸出,其餘則會重新路由至 Opus 4.8。
為什麼有些網站顯示的 Mythos 與 Opus 分數不同?
有兩個原因反覆出現:沒有可追溯來源、且未出現在 Anthropic 發佈內容中的數字,以及將真實的 Mythos 級分數拿去與較舊的 Opus 版本(4.6 而非 4.8)相比,這會放大表面上的差距。
Fable 5 和 Mythos 5 的真正差異是什麼?
它們是同一個模型。Fable 5 會執行安全分類器,將與資安、生物學以及蒸餾相關的請求重新導向至 Opus 4.8;Mythos 5 則移除了這些防護措施,但僅限經審核的合作夥伴使用。請參閱 Fable 5 vs Mythos 5 以取得完整解析。
Opus 4.8 比 Mythos-class 模型更便宜嗎?
是。Opus 4.8 的價格為每百萬輸入/輸出 tokens $5/$25,相較之下,Fable 5 和 Mythos 5 為 $10/$50。對於不需要 SWE-Bench Pro 或 FrontierCode 提升的工作負載,Opus 4.8 是較低成本的選擇,而且不必擔心分類器重新路由。
結論
Anthropic 發布的三項基準測試顯示,Mythos 級推理能力以實際且適度的幅度領先 Opus 4.8。超過這三個數字之後的所有內容——以及大多數推動「Mythos 壓制 Opus」這類標題的內容——不是沒有來源,就是在拿一個過時的 Opus 版本做比較。而且,除非你是經過審核的網路防禦或生物醫學合作夥伴,否則你實際上會用來與 Opus 4.8 對抗測試的模型是 Fable 5,而不是 Mythos 5 本身。
