這週要接進 agent 的模型,該選 claude-opus-5 還是 gpt-5.6?先釐清一件事:後者並不是單一模型名稱,而是指向三個 SKU 之一的別名;三者各自對應不同的價格表。
結論先講:輸入低於 272,000 tokens 時,兩家旗艦模型的價格差距不到 7%;一旦超過這條線,Claude Opus 5 的成本約為 GPT-5.6 Sol 的一半。我們在 2026 年 7 月 24 日以相同四項測試跑過四個模型,並依兩家官方文件逐項核對價格。
GPT-5.6 的 Sol、Terra、Luna:同一代模型的三種尺寸
OpenAI 於 2026 年 7 月 9 日推出三個版本。其模型文件將它們對應到舊有命名層級:Sol 對應「早期 GPT-5 系列中未加後綴的層級」、Terra 對應「mini 模型層級」、Luna 則對應「nano 模型層級」。它們是同一代模型的三個 SKU,不是三個世代。
單獨使用 gpt-5.6 是在使用別名。OpenAI 的變更日誌會將它導向 gpt-5.6-sol,因此設定檔若填入 gpt-5.6,計費會落在這個家族的最高級距。
| 版本 | 模型 ID | 對應層級 | 每 1M 輸入/輸出(≤272K) | 推理評級 |
|---|---|---|---|---|
| Sol | gpt-5.6-sol(別名為 gpt-5.6) | 未加後綴 | $5.00 / $30.00 | 最高 |
| Terra | gpt-5.6-terra | mini | $2.50 / $15.00 | 更高 |
| Luna | gpt-5.6-luna | nano | $1.00 / $6.00 | 高 |
三者的共通點比差異更多,三個模型頁面列出的規格完全一致:
- Context window 為 1,050,000 tokens,最大輸出 128,000 tokens
- 知識截止日為 2026 年 2 月 16 日
- 支援文字與圖片輸入、文字輸出;不支援 fine-tuning,也沒有附日期的快照版本
- 採用相同的 effort 階梯,速度評級同為「Fast」
官方文件列出的差異只有價格與推理評級。每個模型頁面都會在自己所屬級距標記「Default」,因此 Terra 頁面上的這個標籤,並不表示 Terra 是整個 GPT-5.6 家族的預設模型。
另一邊,Anthropic 只推出一個 SKU。Claude Opus 5 於 2026 年 7 月 24 日上市,模型 ID 為 claude-opus-5;它是沒有日期後綴的固定快照版本,定價為每百萬 tokens 輸入 $5、輸出 $25,1M 視窗同時也是其預設與最大值。
程式能力實測:四項可驗證任務全部通過
我們透過同一個相容於 OpenAI 的 gateway,將四項具備機器可驗證通過條件的任務送給每個模型,所有模型使用相同的使用者提示:
- 修 bug:修正
kth_smallest;原始函式透過原地sort()修改呼叫端 list,且存在 off-by-one 索引錯誤 - 嚴格 JSON:鍵名順序固定,count 與 checksum 必須彼此一致
- 推理:僅用 7 包與 12 包無法組成的最大總數,也就是 Frobenius number,7×12−7−12 = 65
- 重構:加入驗證邏輯,但不得變更函式簽名
四個模型全數拿到 4/4:使用 sorted() 或複製 list,並將索引改為 k-1;輸出可解析且鍵名順序符合要求的 JSON;回答 65;以及完成乾淨的重構。這是每個模型與任務組合各執行一次,不是 benchmark;在這個規模下,正確性沒有拉開差距。
較廣泛的能力宣稱則都來自廠商或第三方公布數字,我們沒有獨立重現。Anthropic 的發表資料指出,Opus 5 在最高 effort 下的 CursorBench 3.2 分數距離 Fable 5 峰值不到 0.5%,每項任務成本卻只要一半;這是其自行執行的相對比較。OpenAI 的 GPT-5.6 發表頁面會對自動抓取回傳 403,因此 Sol 的程式能力成績只能歸屬於發布它們的單位:
| 第三方 benchmark | Sol | Terra | Luna |
|---|---|---|---|
| Vellum,Terminal-Bench 2.1 | 88.8% | 87.4% | 84.7% |
| Artificial Analysis,Coding Agent Index | 80,搭配 Codex | 77 | 75 |
實際使用者的感受並不完全跟著排行榜走。一位開發者在 High effort 下比較兩者後,於 7 月 24 日發文表示:「GPT 5.6 Sol High 在程式開發上仍然優於 Claude Opus 5 High。」
Anthropic 的遷移指南還有一個值得直接採納的提醒:Opus 5 會自行驗證工作結果,因此舊提示若額外附加驗證步驟,反而會讓它過度驗證,應予以刪除。
指令遵循:差異出在輸出格式
其中兩項測試實際上也是指令遵循測驗:JSON 任務要求 items 以小寫英文字母順序排列、checksum 為 14,且不得多出任何鍵名;重構任務則要求拋出 ValueError、不得有註解或 docstring,而模型經常會因為想說明自己的工作而違反後者。四個模型皆通過兩項要求。
不過輸出外型確實不同。Sol 與 Luna 用 LaTeX 包住答案,回傳 \boxed{65};Opus 5 與 Terra 則直接回傳純數字。若以 regex 擷取最後一個整數,兩種格式都能處理;但期待裸數字或 JSON 欄位的 parser 就會失敗。當你將 claude-opus-5 替換為 gpt-5.6、其他設定完全不動時,繼承到的正是這些預設行為。
Token 效率:Opus 5 輸出 1,182 tokens,Sol 為 464
下方差距較合理的解釋,是兩項設定預設值,而非模型品質。Opus 5 預設開啟 thinking,且 API 和 Claude Code 的預設 effort 都是 high;因此直接發出請求,就已經是一個推理請求。GPT-5.6 的預設則是 medium。
以下是四項任務可見 completion tokens 總數,以及依官方輸出單價計算的成本。每組只送出一次請求、未重試,全部採預設設定:
| 模型 | 輸出 tokens | 重構任務 | 成本,僅計輸出 |
|---|---|---|---|
| Claude Opus 5 | 1,182 | 600 tok / 8.3s | $0.0296 |
| GPT-5.6 Sol | 464 | 321 tok / 12.0s | $0.0139 |
| GPT-5.6 Terra | 737 | 603 tok / 11.8s | $0.0111 |
| GPT-5.6 Luna | 612 | 380 tok / 8.7s | $0.0037 |
這些成本有兩個前提限制。對相同使用者提示,gateway 回報 GPT 模型的 prompt tokens 介於 62 至 4,471,Claude 則落在 592 至 640;表示實際送上線的請求並不相同。因此輸入端數字沒有比較意義,也無法乾淨地歸因於模型本身。
OpenAI 的 reasoning 指南也指出,除非主動 opt in,否則不會回傳推理摘要;但 GPT-5.6 仍會將這些隱藏 tokens 以輸出計費。因此三個 GPT 的成本低估了實際帳單。真正可比較的是正確性;tokens 與延遲僅具方向性參考價值。
圖中也包含同一次測試的 Claude 端基準:Opus 4.8 與 Sonnet 5。六個模型之中,Opus 5 的四項任務總耗時最長,為 24.6s;Sol 為 20.3s、Terra 為 22.7s、Luna 為 18.4s。Opus 4.8 預設關閉 thinking,僅用 11.8s 完成,這也說明差距主要源於設定,而非能力。
Artificial Analysis 在 Opus 5 發表當日評測時,形容其 effort 設定可涵蓋比其他實驗室模型更寬的 token 使用範圍;換句話說,它的成本可調性比價格表看起來更高。
價格關鍵:272K 門檻到底差多少美元
Claude Opus 5 與 GPT-5.6 的價格比較,關鍵取決於一條公開說明。以表面費率看,旗艦模型幾乎只差零頭:Opus 5 每百萬 tokens 為輸入 $5、輸出 $25;Sol 為輸入 $5、輸出 $30。因此 Opus 5 的輸出便宜 17%,輸入相同。但這只適用於 272,000 輸入 tokens 以內。
三個 GPT-5.6 模型頁面都列有同一句話:「Prompts with >272K input tokens are priced at 2x input and 1.5x output for the full request.」影響的是整筆請求,而不只是超過門檻的部分。只要比 272K 多 1 token,Sol 對整次呼叫就會改以輸入 $10、輸出 $45 計費;Opus 5 的 1M 視窗則從頭到尾維持 $5/$25。
以單次 agentic 請求為例,固定輸出 20,000 tokens、改變輸入長度;價格採用 OpenAI 公開費率與 Anthropic 標準費率,皆於 2026 年 7 月 25 日查閱:
| 輸入 tokens | Claude Opus 5 | GPT-5.6 Sol | GPT-5.6 Terra |
|---|---|---|---|
| 200,000 | $1.50 | $1.60 | $0.80 |
| 400,000 | $2.50 | $4.90 | $2.45 |
| 900,000 | $5.00 | $9.90 | $4.95 |
門檻以下,兩個旗艦模型只差 7%。門檻以上,400K 輸入時 Sol 成本為 Opus 5 的 1.96 倍;900K 時為 1.98 倍。若有 100 次符合 400K 形態的請求,總價就是 $250 對 $490。
更值得注意的是 Terra。超過 272K 後,它的輸入單價與 Opus 5 同為每百萬 $5,因此兩者差距完全來自輸出端每百萬 $2.50:在這個輸出 20k 的請求裡,無論輸入為 300K 或 900K,都只差五美分;差距隨輸出量而非輸入量放大。這個門檻是價格表中的離散跳點,不是等距座標軸畫出的平滑斜率。
Batch 方案、tokenizer 與採購管道都會影響成本
折扣級距在這個 400K 請求上仍維持相同比例:
- Anthropic Batch API:Opus 5 為 $2.50/$12.50,單次請求成本降至 $1.25
- OpenAI Batch 與 Flex:標準費率打五折,因此 Sol 的長 context 費率變為 $5/$22.50;相同請求成本為 $2.45
不同供應商的每 token 單價並不能直接橫比。Anthropic 的定價文件指出,Claude 4.7 之後的模型,包括 Opus 5,使用較新的 tokenizer;對相同文字通常會產生約多 30% 的 tokens,實際比例仍會依內容與語言而變。一份在 GPT-5.6 下計為 400,000 tokens 的文件,Opus 5 可能接近 520,000 tokens,該列輸入成本也會從 $2.00 變成 $2.60。這仍低於 Sol 的 $4.00,但正式選型前應先對自己的 prompts 做 tokenization。
採購位置同樣有差。AIReiter 以低於牌價的價格轉售 Claude,Opus 4.8 每百萬 tokens 為 $1.56/$7.76,較官方價格低約 69%;但其目錄最高只到 Fable 5 與 Opus 4.8,因此目前尚不能在該處呼叫 Opus 5。在 Anthropic 自家產品線內,Fable 5 的 $10/$50 對上 Opus 5 的 $5/$25,才是另一個需要算損益平衡的問題。
Context window:兩者都標 1M,但只有一方採固定費率
Opus 5 的 context window 為 1,000,000 tokens,這同時是預設值與最大值,因此不會誤選到較小 context 的版本。三個 GPT-5.6 版本皆為 1,050,000 tokens,容量多 5%。雙方最大輸出都是 128,000 tokens,但 Anthropic Batch API 有一項例外:加入 output-300k-2026-03-24 beta header 後,Opus 5 上限可提升至 300,000。
Sol 可接受 900K-token prompt,但整筆請求會按長 context 費率計價;這表示其宣稱視窗中約 74% 的容量位於低價級距之外。長 context 下的能力則是另一回事:Vellum 的分析顯示,Luna 在 MRCR 為 41.3%,遠低於 Sol 的 91.5% 與 Terra 的 89.6%。不論成本如何,nano 級距都不適合長 context 任務。Anthropic 另將 Opus 5 的知識截止日設為 2026 年 5 月,而三個 GPT-5.6 模型頁面均標示 2026 年 2 月 16 日。
推理控制:同一條 effort 階梯,兩種操作方式
Opus 5 的所有 effort 級別都不需要 beta header,且 thinking 預設啟用。關閉 thinking 有明確限制:thinking: {"type": "disabled"} 只接受 high 或更低 effort;在 xhigh 或 max 下會回傳 400。Anthropic 將此列為相較舊模型的 breaking change。
| 控制項目 | Claude Opus 5 | GPT-5.6 |
|---|---|---|
| Effort 階梯 | low → medium → high → xhigh → max | none → low → medium → high → xhigh → max |
| 預設 effort | API 與 Claude Code 均為 high | medium |
| 第二個控制鈕 | 無 | reasoning.mode:standard(預設)或 pro |
| 關閉推理 | 不能在高於 high 的 effort 使用 | effort: none |
OpenAI 的 reasoning 指南只記載這兩個 mode 值。API 沒有 ultra 值,也沒有說明 Pro mode 背後的機制。7 月 9 日的變更日誌則將 persisted reasoning、max effort 與 Pro mode 列為隨此家族推出的新增功能。
實務上的不對稱在於:GPT-5.6 可以為低延遲需求完全停止推理;Opus 5 則無法在高於 high effort 時這麼做。相對地,Opus 5 在推理模式內提供更大的動態範圍。一位同時追蹤兩邊模型的開發者,整理出一條跨供應商的單一階梯:Luna high、Sol medium,接著是 Opus medium、high 與 xhigh。
可用平台、rate limit 與 fine-tuning
Opus 5 可透過 Claude API、Amazon Bedrock 的 anthropic.claude-opus-5、Google Cloud、Microsoft Foundry、claude.ai、Claude Code 與 Claude Cowork 呼叫,且已成為 Claude Max 的新預設模型。Anthropic 的 fast mode 約提供 2.5 倍吞吐量,價格為 $10/$50,但僅限 Claude API 提供。
三個 GPT-5.6 版本都是 OpenAI API 產品,免費 API tier 不提供 Sol 或 Terra。Sol 文件列出的限制從 Tier 1 的 500 RPM 提升至 Tier 5 的 15,000 RPM,Terra 的上限相同。三者都不支援 fine-tuning,也不提供帶日期的快照版本;要固定版本,只能固定使用原始 ID,同時接受原地更新。
該把哪種工作交給哪個模型?
第一步先看輸入長度,因為這是唯一存在公開計費斷點的維度。之後,cache、是否符合 batch 資格與輸出量才會改變總成本。
低於 272K 時,兩個旗艦模型價格接近到足以由其他條件決定;高於門檻時,牌價經濟性明顯偏向 Opus 5,相比 Sol 約低一半。不過這個優勢不適用於整個 GPT-5.6 家族:相同請求中,門檻以上的 Terra 為 $2.45,Opus 5 為 $2.50。因此長 context 節省的是 Sol 對比,不是 GPT-5.6 對比。
- Claude Opus 5:大型 prompts、希望在完整 1M 視窗內維持單一費率、需要截至 2026 年 5 月的知識,或推理必須部署在 Bedrock、Google Cloud 或 Foundry。
- GPT-5.6 Terra:適合作為大量工作負載的預設,因為無論在區間兩端都比 Opus 5 便宜。
- GPT-5.6 Sol:需要
promode 或noneeffort 時才選它。它的溢價來自控制能力,而不是我們能測出的正確性優勢。 - GPT-5.6 Luna:適合淺層、高吞吐量工作,但不要用於長 context 任務。
Claude Opus 5 與 GPT-5.6 的選擇,最終可依輸入長度區間拆解;兩家供應商也都公開了這條分界線的位置。
FAQ
Claude Opus 5 寫程式比 GPT-5.6 好嗎?
在我們的四項機械式測試中,Opus 5、Sol、Terra 與 Luna 都拿到 4/4,因此在這個規模下,正確性沒有區隔出勝負;同時以 High effort 使用兩者的開發者意見也不一致。成本差異則更明確:輸入超過 272K tokens 後,Opus 5 的價格約是 Sol 的一半。
GPT-5.6 Sol、Terra 與 Luna 有何差異?
官方文件列出的差異是價格與定性的推理評級。OpenAI 將 Sol 對應舊有未加後綴層級、Terra 對應 mini、Luna 對應 nano;在輸入低於 272K tokens 時,每百萬 tokens 分別為 $5/$30、$2.50/$15 與 $1/$6。三者的 context window、最大輸出、知識截止日、模態與 effort 階梯均相同。
GPT 和 Claude 哪個 AI 較好?
答案取決於比較軸線,而公開資料中差距最大的一項並非任一廠商主打的指標。benchlm.ai 記錄的 AA-Omniscience 幻覺率,Claude Opus 4.8 為 35.9%,GPT-5.6 Sol 則為 88.8%;但 Sol 在數學、知識與 agentic 類別得分較高。這是目前最接近的公開配對,尚無聚合平台收錄 Opus 5 或 Terra 資料。若錯誤回答的代價高於漏答,這項排序的重要性會超過任何程式能力分數。
我該用 GPT-5.6 Terra 取代 Sol 嗎?
對多數大量工作負載來說,是。根據 r/codex 上依任務深度路由的實務使用者回報,約有 75% 工作會落在 Terra、15% 使用 Luna、10% 使用 Sol。Artificial Analysis 則認為中間級距可能被兩端模型壓過:某個 Luna 或 Sol 設定往往能以相同或更低成本達成相近結果,因此別先假定中間選項最穩妥,應先與兩側版本一併測試。
GPT-5.6 有 ultra 推理模式嗎?
API 提供 reasoning.mode,文件化的值只有 standard 與 pro;另有從 none 至 max 的 reasoning.effort。Pro mode 在 2026 年 7 月 9 日的變更日誌中加入。OpenAI 的 reasoning 指南與模型頁面都沒有出現 ultra 值。
