Sonnet 5 在 2026 年 6 月 30 日推出後,r/ClaudeAI 很快出現一個光看價目表不會預料到的疑問:「Sonnet 5 在 high 和 xhigh 相同價格下,比 Opus 差嗎?」
其中一位使用者用一句話點出關鍵:Sonnet 「每 token 的確比較便宜,但完成任務要走更多步、消耗更多 token,因此價格優勢就沒了。」
這個判斷大致正確,但有一個例外。若以相同預算比較 Claude Opus 5 與 Sonnet 5,幾乎所有情況都是 Opus 較有利:單一任務預算高於約 $2.30 時,把 Opus 的 effort 降一級,通常就能同時以更低成本取得比 Sonnet 高一級更好的品質。不過,低於這條線,以及短小的一次性任務,Sonnet 5 則便宜 3.4 倍。
Opus 5 與 Sonnet 5 各自適合什麼工作
| Claude Opus 5 | Claude Sonnet 5 | |
|---|---|---|
| 模型 ID | claude-opus-5 | claude-sonnet-5 |
| 推出日期 | 2026 年 7 月 24 日 | 2026 年 6 月 30 日 |
| 每 MTok 輸入 / 輸出價格 | $5 / $25 | 至 2026 年 8 月 31 日為 $2 / $10,之後為 $3 / $15 |
| Batch 輸入 / 輸出價格 | $2.50 / $12.50 | 至 2026 年 8 月 31 日為 $1 / $5 |
| Effort tiers | low、medium、high、xhigh、max(預設為 high) | 相同五個 tier(預設為 high) |
| Extended thinking | 預設啟用 | 自適應 |
| Context / 最大輸出 | 1M / 128k tokens | 1M / 128k tokens |
| 知識截止時間 | 2026 年 5 月 | 2026 年 1 月 |
| 每 token 折扣 | 無 | 目前比 Opus 低 60%,9 月 1 日起低 40% |
| 最適合的工作 | 長時程 agentic 執行、困難推理、人工審查代價高的工作 | 一次性擷取、高併發、對延遲敏感的 UX |
| 我們的四項任務 smoke test | 4/4 通過,1,182 個輸出 tokens,2.955¢ | 4/4 通過,858 個輸出 tokens,0.858¢ |
目前還沒有公開的長時程 benchmark 測過 Opus 5,因此下方每任務成本表中的 Opus 欄位先以 Opus 4.8 代表。請把這些數字視為保守下限:兩者定價完全相同,而 Anthropic 表示 Opus 5 在 agentic 工作上優於 4.8。
之所以能以相同預算比較 Claude Opus 5 與 Sonnet 5,是因為兩款模型都支援同一個 effort 參數、同樣五個 tier,且無須 beta header;能力差異可透過調整旋鈕購買,而不是非得換模型。價格取自 Claude Platform pricing page,於 2026 年 7 月 25 日核對。
逐級看成本:兩條曲線在哪裡交叉
各 tier 的數據來自 Datacurve 長時程 agentic 排行榜 DeepSWE v1.1:
- 113 項從零撰寫的任務,並非直接取自已合併的 PR,這也是其宣稱無資料污染的依據
- 91 個 repository、5 種程式語言
- 所有模型共用同一套 harness,每項任務執行四次
- 最後更新於 7 月 21 日,也就是 Opus 5 推出前三天
因此,Opus 欄位使用 Opus 4.8;唯一未定的變數,是 Opus 5 每項任務是否比 4.8 消耗更多 tokens。
| Effort | Sonnet 5 $/task | Opus 4.8 $/task | Sonnet ÷ Opus | Sonnet pass@1 | Opus pass@1 |
|---|---|---|---|---|---|
| low | $2.19 | $2.29 | 0.95x | 30.5% | 40.8% |
| medium | $4.08 | $3.44 | 1.18x | 39.8% | 48.7% |
| high | $7.43 | $4.28 | 1.73x | 48.2% | 51.8% |
| xhigh | $11.89 | $8.01 | 1.49x | 49.7% | 54.4% |
| max | $26.40 | $13.22 | 2.00x | 53.8% | 59.0% |
Sonnet 5 只有在 low 這一級更便宜,而它也在這一級少了 10.3 個百分點的通過率。
為何單價較低,帳單反而更高
關鍵不是回答冗長,而是執行步數。
| Effort | Sonnet 5 中位步數 | Opus 4.8 中位步數 | Sonnet 每任務輸入量 | Opus 每任務輸入量 |
|---|---|---|---|---|
| low | 70 | 47 | 4.5M | 2.4M |
| max | 260 | 116 | 72.4M | 17.0M |
每 token 就算便宜 60%,讀取的文字量若多了四倍,折扣也撐不住。
為何這份美元成本值得參考
先說一項保留:DeepSWE 並未公開其採用的計價基準。
另有一組在 7 月 13 日進行的 24 項任務測試,涵蓋 Claude Code 中兩個模型的五個 tier。將 DeepSWE 的 Sonnet 欄位乘以 0.67,也就是促銷價 $2/$10 相對標準價 $3/$15 的比例後,兩組數據在每個 tier 的差異都不超過 0.03。
兩個獨立任務集,交叉點都落在 medium 與 high 之間。這種一致性也是 DeepSWE 應是按 Sonnet 標準費率計價的有力佐證。
其作者開發並銷售 Stet,也就是該文章所連結的 harness,因此應將其視為廠商自己的測試。
預算相同、tier 不同:真正該看的比較
同 tier 對照其實回答了錯的問題,因為沒有人是在買一個 effort tier。你買的是特定價格下的成果;以這個角度比較 Claude Opus 5 與 Sonnet 5,結論會完全重排。
下表針對每個 Sonnet 5 設定,找出可達到或超越其 pass rate 的最低成本 Opus 4.8 tier。促銷價欄位則是標準費率乘以 0.67 的估算值。
| Sonnet 5 config | Sonnet pass@1 | Sonnet $,標準 | Sonnet $,促銷(估計) | 可匹配的最低成本 Opus 4.8 tier | Opus $ | Opus pass@1 | Opus 成本相對促銷 Sonnet | 品質差異 |
|---|---|---|---|---|---|---|---|---|
| low | 30.5% | $2.19 | $1.47 | low | $2.29 | 40.8% | 1.56x | +10.3pp |
| medium | 39.8% | $4.08 | $2.73 | low | $2.29 | 40.8% | 0.84x | +1.0pp |
| high | 48.2% | $7.43 | $4.98 | medium | $3.44 | 48.7% | 0.69x | +0.4pp |
| xhigh | 49.7% | $11.89 | $7.97 | high | $4.28 | 51.8% | 0.54x | +2.1pp |
| max | 53.8% | $26.40 | $17.69 | xhigh | $8.01 | 54.4% | 0.45x | +0.5pp |
直接看最後兩欄即可。若把原本考慮的 Sonnet tier 改為低一級的 Opus,能以少 16% 至 55% 的成本取得相同或更高的 pass rate,即使對照促銷價格也是如此。唯一相反的是最低一列:low effort 的促銷 Sonnet 5 比 Opus low 便宜 36%,但要讓出 10.3 個百分點的 pass rate。
也有合理的反向解讀
在最初那篇討論串中,有留言者以官方 medium effort 圖表解讀:Opus 成功率為 68%、成本接近 $7;Sonnet 為 62%、成本 $4.50,「在這項測試中,價格增加 55%,成功率卻提升不到 10%。」
如果少 6 個百分點的成功率不會造成代價,這筆取捨很合理;但若錯誤的 diff 會進到 production,判斷就不對了。
兩種解讀都建立在別人的任務分布上。拿自己的 20 到 50 項任務,以每次成功完成的成本而非每 token 成本來評分,會比本頁任何表格都更有參考價值。
同樣 $5 / $25,Opus 5 改變了什麼
Opus 5 的上市定價與 Opus 4.8 完全一致,因此問題落在第三個維度:每項任務消耗多少 tokens。目前證據兩邊都有。
| 支持 Opus 5 單任務成本更低的證據 | 支持其成本更高的證據 |
|---|---|
| Anthropic 表示 Opus 5 在 Frontier-Bench v0.1 名列第一,且「以更低的每任務成本,效能超過 Opus 4.8 的兩倍」(廠商自行報告與執行,尚無獨立重現) | Extended thinking 預設啟用,但 Opus 4.8 預設關閉 |
| 一名未具名法律合作夥伴在 max reasoning 下的 token 用量約少 26%(由 Anthropic 轉述,未提供方法) | 我們的四項任務中,Opus 4.8 使用 380 個輸出 tokens,Opus 5 使用 1,182 個 |
兩種走向都仍有可能,因此在承諾預算前,請先於自己的 repository 重新測量成本欄位。
若想用最直覺的方法降低 Opus 5 成本,還有一個陷阱:thinking: {"type": "disabled"} 只在 high 以下的 effort 可接受,在 xhigh 或 max 會回傳 400。這是 Opus 4.8 與 Opus 5 之間多項破壞性變更之一,遷移前值得先看。
Sonnet 5 的主場:短小、一次完成的任務
我們在 2026 年 7 月 24 日讓兩款模型處理四項小任務,全部以腳本而非主觀判斷評分:修正 kth_smallest 的兩個缺陷、輸出 key 順序固定且 checksum 自洽的嚴格 JSON、回答結果為 65 的 Frobenius-number 問題,以及加入驗證功能但維持函式 signature 且不留下任何 comments 的重構。
兩者四題全過;差異出現在帳單上。
| Claude Sonnet 5 | Claude Opus 5 | |
|---|---|---|
| 通過檢查 | 4/4 | 4/4 |
| 四項任務的輸出 tokens | 858 | 1,182 |
| 總延遲 | 13.7s | 24.6s |
| 促銷 / 標準費率下的輸出成本 | 0.858¢ / 1.287¢ | 2.955¢ |
在驗證結果完全相同的情況下,按目前 Sonnet 定價,Opus 5 成本是 3.4 倍;促銷結束後仍是 2.3 倍,而且 Sonnet 用時略高於 Opus 的一半。再透過 Claude Code 的第一方管道重跑兩項程式任務,結論也相同:Sonnet 5 輸出 240 個 tokens,Opus 5 為 465 個。
不過,比起這個數字,更應注意三項限制:
- 每個模型、每項任務只跑一次。這是 smoke test,不是 benchmark。
- 只計算輸出 token 成本,並套用官方輸出費率。gateway 注入了長度可變的 system prompt,導致輸入 token 數無法用於計費計算。
- 四個 prompt 都很短,正是社群爭論排除的工作類型。這裡沒有任何一項跑到 70 步,因此也不會重現步數暴增的問題。
在這個範圍內,Sonnet 5 的折扣完整保留下來。一位開發者描述過完全相同的工作型態:文件密集型 agent 進行「幾乎不需要推理的一次性擷取」,此時「Opus 顯得殺雞用牛刀」。
本文每個數字都要留意的兩個日期
2026 年 6 月 30 日:官方成本圖表曾修訂
Anthropic 的 Claude Sonnet 5 announcement 附有 changelog 說明。原始成本效能圖表採用了「未能反映我們用於 agentic search 評估之標準方法的較簡化方法」,結果「低估了 Sonnet 5 在該評估中的表現。」
圖表與周邊文字已調整為符合 system card 的 BrowseComp 方法,也就是「採用 10M token 預算,搭配 compaction 與程式化 tool calling。」
因此,引用這張圖前請確認你看到的是哪個版本,也要閱讀圖說:它按 Sonnet 5 標準 $3/$15 價格計算、註明促銷價格會令實際成本低於圖中數字,並將 Opus 4.8 計為 $5/$25。
2026 年 9 月 1 日:促銷定價結束
Sonnet 5 的促銷費率到期後,所有已公布的價格都會上升 50%,Opus 5 則維持 $5/$25。自本文發布起只剩 37 天緩衝期,之後任何以目前費率建立的支出模型都會失準。
這類討論還常提到另一個日期,但不適用於此處。Claude 4.7 tokenizer 對相同文字產生的 tokens 約比 Sonnet 4.6 多 30%,因此以每 token 價格比較 Sonnet 5 與 Sonnet 4.6,會低估真實漲幅。Opus 5 與 Sonnet 5 共用該 tokenizer,兩者比較時這項成本會互相抵銷。
依預算選模型:三條實用路由規則
Claude Opus 5 vs Sonnet 5 並不存在單一贏家,而是可分成三條選擇規則。門檻採用 DeepSWE 的平均每任務成本,並由 Opus 4.8 代表 Opus;它們是 repository 工作的起始區間,不是研究 agent、客服 pipeline 或文件流程的固定常數。
- 每項任務低於約 $2.30:選 Sonnet 5 的 low effort。這是 Sonnet 5 在 agentic 工作中唯一能守住成本優勢的設定,但 pass rate 僅有 30.5%。一次性擷取、分類、任何輸出有明確上限的工作,都應留在這一級,享受我們測得的 3.4 倍成本差。一位開發者形容 Sonnet 5 「90% 的工作都已經夠接近 Opus,而且相對來說快得多」;當真人在等待時,這點很重要。
- 每項任務約 $2.30 到 $8:不要把 Sonnet 調高一級,改用低一級的 Opus。日常預設可從 Opus medium 開始;若錯誤在 review 階段代價高,則使用 Opus high。Opus 5 的每 token 價格相同,但每任務 token 用量尚未測得,因此這個區間應視為測試起點。
- 超過 $8:別再往上調 Sonnet 的旋鈕。DeepSWE 中,Sonnet 5 max 每任務成本 $26.40、pass rate 53.8%;Opus 4.8 xhigh 為 $8.01、pass rate 54.4%;Fable 5 low effort 則以 $3.76 達到 59.6%。AIReiter 列出的 Opus 4.8 每 MTok 價格為 $1.56/$7.76,約比定價低 69%,但其 Claude 產品線尚未提供 Opus 5。
FAQ
Claude Opus 5 比 Sonnet 5 貴嗎?
以每 token 計,答案是肯定的:$5/$25 對 Sonnet 5 促銷期的 $2/$10,因此到 2026 年 8 月 31 日前是 2.5 倍,之後為 1.67 倍。但以完成任務計,成本順序可能顛倒,而且中位數也證實這不是少數失控執行造成的假象。DeepSWE 中,max effort 的中位成本為 Sonnet 5 $23.28,Opus 4.8 則為 $12.35。
Claude Sonnet 5 的價格是多少?
至 2026 年 8 月 31 日,每百萬輸入 tokens 為 $2、輸出 tokens 為 $10;9 月 1 日起改為 $3 與 $15。每一條已公布的價格都會上漲 50%:5 分鐘 cache write 從 $2.50 漲至 $3.75,1 小時 cache write 從 $4 漲至 $6,cache hit 從 $0.20 漲至 $0.30。促銷期間的 Batch 定價是 $1/$5。
為什麼較便宜的模型最後反而花更多錢?
因為帳單隨步數成長,而不是隨任務數量成長。隨著 effort 往上調,Sonnet 5 的中位步數從 70 增至 260,Opus 4.8 則從 47 到 116;max 時,Sonnet 5 每任務輸入量達 72.4M tokens,Opus 4.8 是 17.0M。讀取量多四倍,足以吞掉每 token 60% 的折扣。
Opus 5 比 Sonnet 5 強很多嗎?
單次嘗試下是的:DeepSWE 上,Opus 4.8 的 pass@1 比 Sonnet 5 高 3.5 至 10.3 個百分點,差距在低 effort 時最大。
但兩者各給四次嘗試後,差距幾乎消失:Sonnet 5 high effort 的 pass@4 為 79.6%,Opus 4.8 為 77.9%;max 時分別為 78.8% 與 79.3%。Sonnet 5 可以追上,只是需要更多次嘗試,而每次都要付費。
Sonnet 5 在 9 月 1 日漲價後,結論會改變嗎?
交叉點會下移,不會上移。Sonnet 5 的每 token 優勢由 60% 縮至 40%,Opus 5 仍維持 $5/$25,因此同預算表格中的每一組對照都會對 Sonnet 更不利。原本唯一有利於 Sonnet 的一列,也就是促銷期 low tier 比 Opus low 低 36%,到了標準費率時只剩約低 4%。
