Sonnet 5 的標價低於 Sonnet 4.6($2/$10 introductory through Aug 31, 2026, vs. Sonnet 4.6's $3/$15),而 Anthropic 自己的發布圖表也稱其為相較於 Sonnet 4.6 的「strict improvement」。我們在相同任務上、以數個努力等級對兩個模型進行測試,看看這在實務上代表什麼。結果:在我們的測試中,Sonnet 5 在我們嘗試的每個努力等級下都比 Sonnet 4.6 花費 更多——而不是更少。以下是我們的發現,以及原因。
一項任務,單次執行。 以下所有內容都來自一項編碼任務,每個模型/努力配置各執行一次。請將這些具體數字視為方向性參考,而非經統計平均的基準——如果您想在自己的工作負載上重現,附錄中提供了確切提示詞以及原始 API 輸出的範例。
Sonnet 5 實際上比 Sonnet 4.6 更便宜嗎?我們測試了。
我們給了兩個模型相同的任務——用 Python 建立一個 token-bucket rate limiter,並附上測試、執行測試、修正任何失敗之處——透過 Claude Code CLI(claude -p --model <id> --effort <level> --output-format json),因此成本和耗時直接來自 API 回應。執行於 2026-07-01。
設定 | 成本 | 持續時間 | 回合數 | 結果 |
|---|---|---|---|---|
Sonnet 5, effort | $0.344 | 31.6s | 5 | 6/6 tests pass |
Sonnet 4.6, effort | $0.261 | 36.0s | 6 | 7/7 tests pass |
Sonnet 4.6, effort | $0.253 | 35.3s | 5 | 7/7 tests pass |
Sonnet 5, effort | $0.349 | 36.4s | 5 | 8/8 tests pass |
Sonnet 5 在 medium 努力程度下更快,但成本高於我們測試的 Sonnet 4.6 兩種設定中的 Sonnet 4.6 —— 包括以較低努力設定執行的 Sonnet 4.6。這與一些社群的零星回報相反,這些回報聲稱一旦比較相同努力等級,Sonnet 5 會比 Sonnet 4.6 更便宜。
最可能的原因:Sonnet 5 採用了新的 tokenizer。Anthropic 官方文件指出,對於相同的文字,它產生的 token 數比 Sonnet 4.6「約多 30%」,而 Simon Willison 的獨立測試發現,尤其是英文內容,最多可達約 1.4 倍的 token。Sonnet 5 較低的標價在我們的測試任務中並未完全抵消這個差異,而且在 2026 年 8 月 31 日之後——屆時 Sonnet 5 的優惠定價到期,兩個模型都會採用相同的 $3/$15 標價——僅憑 tokenizer 的差異就顯示,對於等量的英文工作,Sonnet 5 很可能比 Sonnet 4.6 花費更多,而不是相同,前提是沒有其他定價變動。(按語言的完整分析請見我們的 Sonnet 5 定價指南。)
除了成本之外,還有什麼改變
在官方基準測試中,Sonnet 5 取得了實質進步:在 Terminal-Bench 2.1 上為 80.4% 對 67.0%,在 SWE-bench Pro 上為 63.2% 對 58.1%,這兩項都來自 Anthropic 的 Claude Sonnet 5 system card(另請參閱 我們完整的基準測試表,其中也包含 Opus 4.8)。Anthropic 自己的 發表公告 圖表將 Sonnet 5 描述為相較於 Sonnet 4.6 的「嚴格改進」。
檢視我們自己的四個測試輸出時,有一個行為差異特別明顯,而基準測試表並未捕捉到:Sonnet 5 加入了我們沒有要求的內容。在兩種 effort level 下,它都在測試中使用了 monkeypatched 的假時鐘,以避免真正呼叫 time.sleep();而在 high effort 下,它還在未被要求的情況下為 rate limiter 增加了 thread-safety。Sonnet 4.6 在兩種 effort level 下都更貼近字面上的任務描述——在測試中使用真實的 time.sleep(),而在 medium effort 下,它為了提升可讀性加入了一個摘要表,但在實作上除了要求的內容之外沒有再多做任何事。
這與 Sonnet 5 上線首日內發表的真實用戶回饋相符:一篇 r/claude 討論串將其描述為「在推理方面相較於 Sonnet 4.6 是一項客觀升級……但它也讓人覺得比 4.6 緊繃得多。」我們的測試只是一個任務的樣本,但「更容易加入未要求的範圍」是對同一觀察更具體、明確的表述。
你應該升級嗎?
如果符合以下情況,建議升級:你的工作負載主要是中文內容(tokenizer 的變更幾乎不影響中文 token 數),或者你從事的是 agentic/工具密集型工作,而 Terminal-Bench 和 SWE-bench 的提升比溫和的成本增加更重要。
如果符合以下情況,建議暫緩:你的工作負載量大且以英文為主,而且 Sonnet 4.6 已經達到你的品質標準——請重新計算你自己的成本,而不要只看標價,尤其是在 2026 年 8 月 31 日的優惠定價期間結束之後。
無論如何,不要以為這個更新、看起來更便宜的模型就一定每個任務成本更低。在我們的測試中,並非如此。
常見問題
Sonnet 5 真的如 Anthropic 所說,是相較於 Sonnet 4.6 的「嚴格改進」嗎?
在 Anthropic 發布的能力基準測試中,是的——我們沒有找到一項是 Sonnet 4.6 領先的。至於每項任務的成本,我們的測試在將 tokenizer 變更納入後得出了相反結果,因此「嚴格提升」並不會延伸到每一種工作負載的成本效率。
為什麼 Sonnet 5 感覺比 Sonnet 4.6「更緊繃」?
Anthropic 尚未公布這方面的具體細節。根據我們自己的測試輸出,Sonnet 5 比 Sonnet 4.6 更願意加入未要求的範圍(執行緒安全性、較更具防禦性的測試時鐘設定),而 Sonnet 4.6 則更貼近字面上的請求。這與社群的描述一致——雖然範圍更小。
Sonnet 5 現在是預設模型嗎?我還能使用 Sonnet 4.6 嗎?
根據 Anthropic 的發布公告,Sonnet 5 已在 claude.ai 上取代 Sonnet 4.6,成為 Free 和 Pro 使用者的預設模型。Max、Team 和 Enterprise 使用者,以及 API 使用者,仍可直接選擇 Sonnet 4.6。
我應該將 Sonnet 5 與 Sonnet 4.6 比較,還是與 Opus 4.8 比較?
完全不同的決定。這個頁面是關於世代升級;如果你是在 Sonnet 5 和 Opus 4.8 之間做選擇,我們另外進行了一組一對一測試——請參見 Sonnet 5 vs Opus 4.8: real tests。
網路上有人貼文說的「較高努力等級比較便宜」這個說法是真的嗎?
在我們的測試中並非如此。我們將 Sonnet 5 以 medium 和 high 與 Sonnet 4.6 的 low 和 medium 進行比較,而 Sonnet 5 在每一組配對中的成本都更高。個別的非正式報告會因任務而異——在假設特定的努力等級交叉點之前,請先在您的實際工作負載上進行自己的比較。
附錄:精確提示詞與原始輸出
我們發送給兩個模型的任務:
實作一個 token-bucket rate limiter,使用 Python 類別 `RateLimiter(capacity: int,
refill_rate: float)`,並提供一個方法 `allow() -> bool`,用來回傳目前是否允許一個請求;
若允許,則消耗一個 token。請使用單調時鐘,不要依賴外部
套件。將它儲存為 limiter.py。
接著撰寫 test_limiter.py,至少包含 5 個測試案例,涵蓋:可一次突發至容量上限
後會被阻擋、token 會隨時間補充(使用 time.sleep 或可 mock 的時鐘)、
補充速率受到遵守(不是瞬間完全補滿)、容量永遠不會被超過,以及
零/負容量能被合理處理。
使用 pytest 執行測試,並確保全部通過。若有任何失敗,請修正程式碼並
重新執行直到全部通過。回報最終的 pytest 輸出。
Sonnet 5(medium)執行的實際 API 回應,已裁剪為與成本和時間相關的欄位:
{
"duration_ms": 31616,
"num_turns": 5,
"stop_reason": "end_turn",
"total_cost_usd": 0.3438645,
"usage": {
"input_tokens": 4302,
"cache_creation_input_tokens": 60894,
"cache_read_input_tokens": 233420,
"output_tokens": 2172
}
}