Claude Opus 5 vs Opus 4.8:切換後真正會出問題的地方

最近更新: 2026-07-25 05:19:22

同樣四個程式與推理小題、完全相同的提示詞、每個模型各跑一次,兩者全數答對。但 Opus 5 分別用了 81、94、407 與 600 個輸出 token;Opus 4.8 則是 36、35、103 與 206 個。在兩者輸出價格同為每百萬 token $25 的前提下,Claude Opus 5 vs Opus 4.8 的遷移重點就在這裡:換模型字串只要改一行,行為模式與帳單卻不會只改一行。

官方文件指出,問題不在能力差異,而是 Opus 5 預設會啟用 thinking;4.8 則預設關閉。因此,同一個請求現在可能得為以前不會產生的推理 token 付費。真正決定帳單變化的,往往不是模型選擇,而是 effort 設定。如果你目前已在正式環境使用 claude-opus-4-8,先記住以下幾點:

  • 有一項明確的 API 破壞性變更。 在 Opus 5 中,thinking: {"type": "disabled"} 若搭配 xhighmax effort,會回傳 400;Opus 4.8 接受這種組合。
  • 價格不是變數。 兩者都是每百萬 token 輸入 $5、輸出 $25,支出差異只會來自 token 用量。
  • thinking 已預設開啟。 max_tokens 仍同時限制 thinking 與可見回應的總輸出,因此原本為 4.8 調過的上限,現在可能讓答案被截斷。
  • 提示詞的風險可能高過程式碼。 原先要求 4.8 反覆檢查結果的指令,可能讓 Opus 5 過度驗證。
  • 兩個模型都還沒被淘汰。 目前兩者均列為 Active,因此在下一個發版週期前持續使用 4.8 是合理選擇。
單次測試的分組長條圖:bug fix、嚴格 JSON、推理與重構四項任務中,Claude Opus 5 的輸出 token 分別為 81、94、407、600;Claude Opus 4.8 則為 36、35、103、206

只換模型字串前,先盤點這五件事

Anthropic 在遷移指南中稱 Opus 5 是「與 Claude Opus 4.8 價格相同的直接升級選項」。API 表面上的改動確實很小:claude-opus-5 是沒有日期後綴的固定模型 ID,命名方式與 claude-opus-4-8 相近。不過,正式流量切換前仍有五項必查項目。

1. 使用 thinking: {"type": "disabled"} 時,effort 若設為 xhighmax,會收到 400。 官方的行為變更說明將此列為相對 4.8 的破壞性變更。4.8 中,是否關閉 thinking 與 effort 無關;Opus 5 則會在每次請求時驗證,即使前幾輪對話成功,只要中途把 effort 調高仍會被拒絕。2. max_tokens 現在必須預留 thinking 的空間。 它仍是總輸出的硬上限,涵蓋 thinking 與最終回應。因此,原本在 4.8 關閉 thinking、使用 max_tokens: 4096 的工作,遷移後上限不變,但推理會侵蝕可用回應長度。Anthropic 建議在 xhighmax 下從 64k 開始設定。3. 要求驗證的提示詞可能反而造成浪費。 Opus 5 會主動檢查自己的工作。官方提示工程指南指出,像「加入最終驗證步驟」這類指令會導致過度驗證;刪除後可「減少浪費的 token,且不影響品質」。搶先使用者 Allie K. Miller 也曾從 effort 設定觀察到這件事:「我常預設使用 'high' 推理 effort……後來必須把它降到 medium。」4. Skills 與 agent scaffolding 可能默默偏移,不一定出現 API 錯誤。 Anthropic 表示 Opus 5 對既有 Claude Opus 4.8 提示詞「開箱即有良好表現」,但 Every 的 Dan Shipper 在發布當天發文稱:「它破壞了向後相容性……常常提早停止,或漏掉你的指令」,他們因此從頭重建 skills。這只是一個團隊的經驗,但也正是需要重跑評測的理由:日誌不會主動告訴你這種問題。5. Anthropic 表示 Opus 5 的知識截止點是 2026 年 5 月,4.8 則是 2026 年 1 月。若系統提示詞硬寫「你的知識截至 2026 年 1 月,應以檢索內容為準」,那段描述現在已不符合模型,基於該日期字串進行的日期運算也會隨之改變。

第一點還藏著一個陷阱。關閉 thinking 時,Opus 5 偶爾會把工具呼叫直接寫進可見文字,而非輸出 tool_use 區塊,也可能洩漏內部 XML 標籤。在 agentic 迴圈中,這些文字會留在對話歷史裡,進一步污染後續回合。Anthropic 的建議是保持 thinking 開啟,改以較低 effort 控制成本。

Claude Platform Docs 官方頁面 What's new in Claude Opus 5 截圖,顯示 Behavior changes 區塊,以及 Thinking on by default 和 Disabling thinking requires effort high or below 標題

會觸發 400 的請求,以及兩種修正方式

以下用可直接對照請求 body 的 diff,呈現會失敗的設定組合:

# claude-opus-5 會以 HTTP 400 拒絕;claude-opus-4-8 可接受。
  {
    "model": "claude-opus-5",
    "max_tokens": 16000,
    "thinking": { "type": "disabled" },
    "output_config": { "effort": "xhigh" }
  }

# 修正 A:保留 xhigh effort,讓 thinking 執行。提高 max_tokens,因為 thinking 會占用額度。
  {
    "model": "claude-opus-5",
-   "max_tokens": 16000,
+   "max_tokens": 65536,
-   "thinking": { "type": "disabled" },
    "output_config": { "effort": "xhigh" }
  }

# 修正 B:維持關閉 thinking,但將 effort 限制在 high 或以下。
  {
    "model": "claude-opus-5",
    "max_tokens": 16000,
    "thinking": { "type": "disabled" },
-   "output_config": { "effort": "xhigh" }
+   "output_config": { "effort": "high" }
  }

處理 agentic、多檔案或大量工具呼叫的工作時,選修正 A 較合適,因為文字中洩漏工具呼叫是更昂貴的失敗模式。對延遲敏感的端點或嚴格格式擷取工作,則可選修正 B;將 effort 從 xhigh 降至 high,通常不會犧牲太多。

換到 Opus 5,實際多了什麼

Opus 5 於 2026-07-24 推出。在 Claude Opus 5 vs Opus 4.8 的比較中,大家最先看的兩個數字都沒變:每百萬 token $5/$25,以及 1M token context window。完整的Claude Opus 5 發布與價格詳情可另行參考;與遷移最直接相關的差異其實更有限。

規格確認日期:2026 年 7 月 25 日:

Claude Opus 4.8Claude Opus 5對你的影響
API 模型 IDclaude-opus-4-8claude-opus-5改一行即可
每 MTok 價格$5 / $25$5 / $25沒有差別
Context1M1M,預設也是最大值不需要額外選擇方案
Effort 級距最高至 xhigh,預設 highlowmax,預設 high重新跑一次 effort 測試
Thinking 預設未要求時關閉開啟,自適應重新檢視 max_tokens
關閉 thinking任何 effort 皆可effort 為 high 或以下高於 high 會回傳 400
可快取提示詞最小長度1,024 tokens512 tokens較短的提示詞也能快取
知識截止點2026 年 1 月2026 年 5 月更新截止日期措辭

除了表格內容外,還有兩項改變,其中只有一項涉及 benchmark:

  • 短提示詞現在也能使用快取。 最低門檻從 1,024 tokens 降至 512,因此原本在 4.8 無法快取的 600-token 系統前綴,在 Opus 5 的快取命中時可按每百萬 token $0.50 計費,相較標準輸入每百萬 token $5。若建立 5 分鐘快取條目的寫入價格是每百萬 token $6.25,這段前綴必須被重複使用到一定程度才會回本。
  • 能力表現目前只有廠商數據。 Anthropic 的公告提供的是未經獨立重現的相對數據:Frontier-Bench v0.1 的單任務成本低於 Opus 4.8,表現則「超過兩倍」;CursorBench 3.2 以一半成本達到距離 Fable 5 峰值 0.5% 以內的成績。更有參考價值的是公開弱項:在網路安全與生物學領域,Opus 5 落後於 Mythos 5。

我們的四個任務無法說明這類能力上限,因為兩個模型都全數通過。任務規模小到一定程度,能力升級看不出來,輸出 token 的增加卻很明顯。

成本關鍵不是單價,而是 token 用量

兩個模型的輸出價格都是每百萬 token $25,因此在同一個按牌價計費的管道裡,Claude Opus 5 vs Opus 4.8 的成本問題,永遠取決於同一份工作各自輸出了多少 token。我們四項任務合計,Opus 5 為 1,182 tokens,Opus 4.8 為 380 tokens,比例是 3.1 倍;費用約為 3.0 美分對 0.95 美分。

這個數字有三項限制:

  • 每個模型、每個任務只跑一次,測試日期為 2026-07-24。這是 smoke test,不是 benchmark。
  • 兩邊都是預設設定:沒有指定 effort、沒有 thinking 欄位、沒有系統提示詞。
  • 只統計輸出 token,因為 gateway 對部分模型家族回報的 prompt token 數量極不一致。絕對金額很小,只有比例具延展性。

而且趨勢並不一致。另有兩項任務透過 Claude Code 的第一方管道重跑,而不是 gateway:

測試Opus 5Opus 4.8
重構,第一方管道429 tok220 tok
Bug fix,第一方管道36 tok63 tok
Bug fix,gateway(上方圖表)81 tok36 tok

三次比較中,有一次 Opus 5 的 token 用量更低。Anthropic 在更高的推理級距則提出相反方向的案例,引用一家法律業合作夥伴稱,在 max reasoning 下平均少用 26% token,但沒有公開方法論。

這兩種現象可以同時成立。Thinking 預設執行,加上 Opus 5 回應較長,會在推理純屬額外負擔的情境中拉高輸出量;但在多檔案工作裡,這些推理也可能減少反覆重試,讓每個「完成任務」的 token 成本下降,即使單次呼叫的 token 成本上升。兩組資料都沒有直接衡量這件事,所以預算應以自己的「每個被接受任務成本」為準,而真正的控制桿是 effort,不是模型:

  • 先降低 effort,再考慮其他手段。 Anthropic 指出,Opus 5 的 lowmedium,在 token 用量只占一小部分的情況下,優於早期 Opus 模型相同設定的表現;但對 coding 與 agentic 工作,起始建議仍是 xhigh
  • 檢查沿用的預設值。 在分類端點保留 xhigh,卻沒有品質提升,可能就是帳單上最昂貴的一行。
  • 成本還是太高時,該檢討模型級別。 在相同預算下比較Opus 5 與 Sonnet 5,會是更便宜的分支。

這一季,哪些情況應繼續留在 Opus 4.8

以下四種情境,4.8 在本季仍是更好的選擇:

  • 你有 Priority Tier 承諾。 遷移指南說明,Priority Tier不支援 Claude Opus 5,但 Opus 4.8 仍支援。若你購買了保證延遲的保留容量,遷移就等於放棄它;這是採購決策,不只是工程決策。
  • 整合必須在高於 high 的 effort 下關閉 thinking。 如果你的評測同時需要 xhigh 推理與不含 thinking 的輸出,目前只有 4.8 能兼顧兩者。
  • 你有高度調校的 skills,且本週期無法重測。 固定使用 4.8 的路線,勝過半遷移狀態、卻仍在跑為另一個模型撰寫提示詞的 Opus 5 路線。
  • 成本壓力加上中繼服務。 第三方 OpenAI 相容 gateway 對舊模型提供大幅折扣:AIReiter 的 Anthropic 模型列表將 Opus 4.8 定價為每百萬 token $1.56/$7.76,約比牌價低 69%,而目前尚未加入 claude-opus-5。跨存取管道後,價格相同不再成立;只要 4.8 已能正確完成工作,最便宜的正確模型就值得選。最適合 coding 的 Claude 模型文章則逐項任務比較了完整產品線。

不必因為害怕即將退役而留在 4.8。Anthropic 的模型淘汰頁面在 2026 年 7 月 25 日將兩者都列為 Active 而非 Deprecated,表示均未排定退役;暫定最早日期分別是 4.8 的 2027 年 5 月 28 日,以及 Opus 5 的 2027 年 7 月 24 日。

保留退路的上線順序

1. 先凍結 4.8 基準。 對 20 到 50 筆真實請求記錄輸出 token、延遲與通過率,作為最低基準;高變異的 agentic 工作需要更多樣本,也應包含 4.8 現在會失敗的案例。沒有這份紀錄,回歸問題與模型差異看起來會完全一樣。2. 部署前先 grep。 搜尋 effort 附近的 "disabled"、低於 16k 的 max_tokens 值,以及系統提示詞中的「verify」、「double-check」與「January 2026」。四個搜尋就能涵蓋一項破壞性變更與三項無聲變更。3. 只開一條流量路線,不要全量切換。 將一部分流量導到 claude-opus-5,並把模型 ID 放在設定檔,而非散落在程式碼中。如此一來,回退只需改設定,不必重新部署。4. 路線上線前,先訂出數值升級門檻。 通過率不得低於 4.8 基準;schema 有效性與工具呼叫合規性也必須至少持平;每個被接受任務的成本要低於預先設定的上限;p95 延遲需符合 SLO;400 錯誤率必須為零。只要有一項未達標,就將設定切回 claude-opus-4-8。5. 分開記錄請求模型與實際回傳模型。 啟用伺服器端 fallback 後,Opus 5 的網路安全分類器可能將遭拒請求轉回 Opus 4.8,因此儀表板顯示為 Opus 5 的執行,實際上可能由 4.8 提供服務。

對多數團隊而言,Claude Opus 5 vs Opus 4.8 的結論仍是遷移,但要依照上述順序,在一個發版週期內進行,並且只有通過第 4 步、相對自身 4.8 基準達標的工作才升級。第一天就應移除沿用的驗證提示詞,這也是 Anthropic 自家指南的建議;token 增加真正轉化成帳單,往往就發生在這裡。

常見問題

Claude Opus 5 是 Opus 4.8 的直接替代品嗎?

Anthropic 的遷移指南稱它是價格相同的直接升級選項,就 API 層面而言確實如此:context window 相同、128k 輸出上限相同,只有一項必須檢查的破壞性變更。但在提示詞層面並非如此。為 4.8 調過的驗證指令、effort 預設、max_tokens 上限與 skill 定義都需要重新檢視,而且這些問題不會主動以錯誤訊息通知你。

為什麼我的 Opus 5 請求回傳 400 error?

最可能的原因是你同時傳送 thinking: {"type": "disabled"},以及 xhighmax effort。Opus 5 會在每次請求時拒絕這種組合。你可以移除 thinking 欄位並保留 effort 等級,或保留關閉 thinking,將 effort 降至 high 或以下。從 4.7 起,所有 Claude 模型若使用非預設的 temperaturetop_ptop_k 值,也都會在每次請求時回傳 400。

Claude Opus 4.8 要停用了嗎?

不會。Anthropic 的淘汰頁面將 claude-opus-4-8 列為 Active,暫定最早退役日期為 2027 年 5 月 28 日;其公開模型政策是至少提前 60 天通知。它也仍是 Opus 5 網路安全類別拒絕請求的 fallback 目標,並保有 Opus 5 沒有的 Priority Tier 支援。

目前哪一個 Claude Opus 模型最好?

依 Anthropic 提供的廠商數據與早期開發者回報,目前是 Claude Opus 5,最明顯的優勢在 agentic coding 與長週期任務。對需要 Priority Tier 的工作負載、必須在高於 high effort 時關閉 thinking 的整合,或尚無法重新建立提示詞基準的場景,Opus 4.8 仍是更好的選擇。

如何在 Claude Code 與 Claude apps 切換至 Opus 5?

Opus 5 是 Claude Max 的新預設模型,也是 Claude Pro 中最強的模型;它可在 Claude Code、Claude Cowork、claude.ai 中選取,也可透過 Amazon Bedrock 的 anthropic.claude-opus-5、Google Cloud 與 Microsoft Foundry 使用。

Claude Code 的預設 effort 是 high,推理深度現在透過 effort 設定,而不是手動切換 extended-thinking。這些介面上也仍可選 Opus 4.8,因此不必修改 API 程式碼就能回退。

Claude Opus 5 比 Opus 4.8 貴嗎?

單看 token 不會:兩者都是每百萬 token 輸入 $5、輸出 $25;Batch API 為 $2.50/$12.50,快取命中則是每百萬 token $0.50。但以任務計算,我們的單次測試中 Opus 5 輸出的 token 約為 3 倍,因此即使牌價相同,帳單仍可能更高。約 2.5 倍速度的 Fast mode 定價為 $10/$50,且僅適用於 Claude API。