AIREITER

Claude Opus 5 vs GPT-5.6:Sol、Terra、Luna 實測與價格比較

最近更新: 2026-07-29 12:56:01

2026 年 7 月 29 日,我們把四道相同題目交給 Claude Opus 5、GPT-5.6 Sol、Terra 與 Luna。結果收到的 16 份回答全部正確。至少在這四項小型驗證裡,準確度並不足以讓你在它們之間做出取捨。

真正拉開差距的,是兩項會直接反映在帳單上的因素:Opus 5 計費了 1,642 個輸出 token,Sol 則是 480 個;而當輸入超過 272,000 個 token,GPT-5.6 會切換至更高的長上下文費率,Claude Opus 5則在完整 1M 上下文視窗內維持固定單價。以 200K 輸入、20K 輸出的請求型態來看,兩款旗艦模型的定價相差不到 7%;但輸出量提高、或跨過 272K 門檻後,差距就會擴大。因此,選擇關鍵在於你的請求結構與模型行為。

四款模型在同一組任務下實測

四個模型都收到完全相同的使用者提示,涵蓋四項可機械驗證答案的測試:修正有 bug 的 Python median 函式、計算固定字串中的字母出現次數、算出時鐘在 3:15 時呈現的 7.5 度夾角,以及重構一個刻意寫得雜亂、但行為不可改變的 JavaScript 函式。程式碼題目不是憑肉眼判斷,而是實際執行並以邊界案例驗證。

四個模型全數過關。Python 修正版本都能正確處理偶數長度的串列;字母計數與時鐘夾角題,全都答出正確的 9 和 7.5;所有重構結果也都通過行為差異比對,其中包含 falsy 欄位與 null 類別篩選條件。

依任務分組的可見輸出 token 長條圖:Claude Opus 5 在每項任務的用量都最高,重構任務達 1,308 個 token;GPT-5.6 Sol 為 293 個、Terra 為 150 個、Luna 為 310 個

引用這些數字前,有三點限制要先說明。第一,這是每個模型、每項任務各跑一次,屬於冒煙測試而非完整 benchmark。第二,請求是經由會注入自有系統提示的 gateway 發送,因此不同請求的輸入 token 在 35 至 4,415 之間跳動,我們完全不採計這項數據。第三,兩家供應商都將隱藏的推理 token 視為輸出計費,因此本文的「輸出 token」是你付費的 token,不等於你實際讀到的文字。

雖然結果同分,仍有一項質化差異值得一提:Opus 5 交出了四者中最好的重構版本。它把原本兩個迴圈合併為單次處理、將 1.2 倍乘數抽成具名常數,還留下註解,說明為了維持原有行為而刻意保留寬鬆相等比較。Sol、Terra 與 Luna 的結果同樣正確,但都較接近原始兩迴圈寫法的直譯版本。

差別不在答對與否,而在 token 與速度

既然 16 次執行的正確性完全一致,接下來要比較的就是每份答案的成本。Opus 5 完成四項任務共花 32.4 秒,計費 1,642 個 completion token。Sol 花了 19.7 秒、480 個 token;Terra 為 11.7 秒、308 個;Luna 則是 15.3 秒、537 個。

單次執行,2026 年 7 月 29 日正確輸出 token總耗時僅輸出成本
Claude Opus 54/41,64232.4s$0.0411
GPT-5.6 Sol4/448019.7s$0.0144
GPT-5.6 Terra4/430811.7s$0.0046
GPT-5.6 Luna4/453715.3s$0.0032

差距來自推理量,而不是最終回答的篇幅。Opus 5 的重構題,最終答案只有 492 bytes,卻計費了 1,308 個 token;回答「7.5」時,它花了 64 個 token,Sol 則只用了 7 個。Anthropic 文件指出,Opus 5 在 API 中預設採用 high effort,因此部分差異來自預設設定,而非模型不可改變的特性;我們量測的是預設行為,不是它的最低用量。

社群數據也呈現相同趨勢。我們在 7 月 29 日查詢時,Google 搜尋此主題的第一個結果是 r/Anthropic 的圖表貼文:兩者的程式能力分數幾乎打平,但 Opus 花得更久、消耗的 token 也明顯更多。一位 r/ClaudeCode 使用者的說法更不客氣:

GPT 5.6 Sol 就是直接去做你要它做的事。Opus 5 會先寫出 12 卷本的《戰爭與和平》,然後才去做你要它做的事。

不過,調整 effort 設定可能會翻轉成本結論。一位閱讀 Artificial Analysis 數據的 Hacker News 留言者指出,Opus 5 在 high effort 下,每次 intelligence-index 執行的成本約為 $1.06;Sol 設為 max 時則為 $1.04。當兩個模型都全力推理時,成本幾乎持平。

GPT-5.6 不只一款:Sol、Terra、Luna 的定位

GPT-5.6 並不是單一模型。OpenAI 提供三個 SKU,而未加後綴的 gpt-5.6,文件明確標示為 gpt-5.6-sol 的別名,也就是三者中最昂貴的版本。若設定檔只寫 gpt-5.6,會按該系列的最高費率計費;在做成本比較前,這點值得先確認。

OpenAI 的模型文件將 Sol 定位為「適合複雜專業工作的 frontier model」、Terra 為「在智慧與成本之間取得平衡」的級距,Luna 則「針對成本敏感型工作負載最佳化」。三者都提供 1.05M-token 上下文視窗、128K 最大輸出、2026 年 2 月 16 日知識截止日期,以及從 none 到 max 的六種可選推理強度。

規格,於 2026 年 7 月 29 日確認Claude Opus 5GPT-5.6(三款皆同)
上下文視窗1M tokens1.05M tokens
最大輸出128K(Batch API beta 可達 300K)128K
可靠知識截止日期2026 年 5 月2026 年 2 月 16 日
推理控制Adaptive thinking,effort 預設為 highnone / low / medium / high / xhigh / max
API IDclaude-opus-5gpt-5.6-sol / -terra / -luna

其中兩項規格會直接影響選型。Opus 5 的知識截止日期是 2026 年 5 月,比整個 GPT-5.6 系列新約三個月;凡是涉及 2026 年春季發布內容的工作,這項差異就很重要。兩者的推理控制也不只是選項數量不同:GPT-5.6 可透過 none 完全關閉推理,Opus 5 則會自適應管理自己的思考預算,並額外提供 effort 等級。

價格分水嶺:固定 1M 視窗對上 272K 級距

兩家供應商公布的 token 單價都很清楚,而且在 272K 輸入以下相當接近:兩款旗艦模型的輸入都是每百萬 token $5;Opus 5 的輸出為 $25,Sol 為 $30;快取輸入皆為 $0.50;Batch 也都提供 50% 折扣。依此計價,一筆 200K 輸入、20K 輸出的請求,Opus 5 成本為 $1.50,Sol 為 $1.60。

每 1M tokens,2026 年 7 月 29 日牌價輸入快取輸入輸出Batch
Claude Opus 5$5.00$0.50$25.00$2.50 / $12.50
GPT-5.6 Sol$5.00$0.50$30.00$2.50 / $15.00
GPT-5.6 Terra$2.50$0.25$15.00$1.25 / $7.50
GPT-5.6 Luna$1.00$0.10$6.00$0.50 / $3.00
OpenAI API 定價頁面,顯示 gpt-5.6-sol、terra 與 luna 分列短上下文及長上下文費率

結構性的差異就在 272K 輸入 token 這個門檻。OpenAI 定價頁將每款 GPT-5.6 的費率拆成短上下文與長上下文兩欄:輸入超過 272K 後,輸入價格變為 2 倍、輸出變為 1.5 倍,Sol 因此升至 $10 與 $45。Anthropic 的定價文件則用一句話說明相反的設計:「900k-token request 與 9k-token request 的每 token 計費相同。」

Anthropic 定價文件列出 Claude Opus 5 每百萬 token 的輸入價格為 $5、輸出價格為 $25

換算成金額,在每個情境都輸出 20K token 的前提下:300K 輸入時,Opus 5 為 $2.00,Sol 為 $3.90;500K 時是 $3.00 對 $5.90;900K 時則為 $5.00 對 $9.90。跨過這個級距後,同樣請求結構下,Opus 5 的價格約為 Sol 的一半。

依輸入規模呈現請求成本的折線圖:Sol 的曲線在 272K 處向上折升,Opus 5、Terra 與 Luna 則線性上升;跨過級距後,Terra 略低於 Opus 5

不過,圖表裡有一個不利於 Anthropic 完勝的意外結果。超過 272K 後,Terra 加倍後的輸入費率是 $5,正好等於 Opus 5;其長上下文輸出費率 $22.50 也低於 Opus 5 的 $25。若輸出為 20K token,Terra 在 300K、500K、700K 與 900K 輸入時,每次請求都固定比 Opus 5 少 $0.05。這 $0.05 是隨輸出量而非輸入量縮放:每百萬輸出 token 的差額為 $2.50。

做預算規劃時,還有三個註記。Anthropic 為 Opus 5 提供研究預覽中的 fast mode,價格為輸入 $10、輸出 $50;OpenAI 也有 priority 層級,但僅適用短上下文,費率為標準價格的 2 倍。美國區域資料落地在兩家供應商都約增加 10%。此外,依Anthropic 自身說明,Claude 目前的 tokenizer 處理相同文字時,產生的 token 約比 4.7 之前的模型多 30%;因此,最誠實的做法是在套用費率前,先用兩家的 tokenizer 跑一次具代表性的提示。

依工作負載選模型

正確性打平後,路由策略就取決於請求型態與工作方式。r/ClaudeCode 的開發者會將 Sol 設為 high effort,作為審查與 QA agent,理由是它夠徹底、也擅長搭配瀏覽器工作;另一些 r/codex 使用者則把大部分工作分派給採用 medium reasoning 的低價 GPT 級距,並認為那是成本效益最好的選擇。

請求型態建議呼叫原因
輸入低於 272K、輸出密集的 agent 迴圈Claude Opus 5輸出 $25 對 $30;本次測試的重構判斷最佳
低於 272K、重視延遲或高請求量GPT-5.6 Terra我們測到最快、也最便宜的過關模型
輸入高於 272KClaude Opus 5 或 TerraSol 的長上下文費率翻倍;Terra 比 Opus 5 固定低 $0.05
審查、QA 與瀏覽器驅動的驗證GPT-5.6 Sol六種 effort 等級可調整審查深度;應以自家 QA 集驗證
一次性的分類與擷取GPT-5.6 Luna$1/$6,且四項測試全部通過

並非所有人都認為 Sol 適合擔任 QA 主力。一篇 r/codex 討論串認為 Sol 相較 GPT-5.5 是退步,同時肯定 Opus 5 每份計畫能完成更多任務。預設值的測試成本很低:四個模型都在 AIReiter 目錄中(Opus 5、Sol),你可以並排重跑自己的任務。

若這篇比較只帶走一個數字,那就是 272,000 個輸入 token。低於此門檻,請依行為、延遲與 $5 的輸出費率差額來選;高於此門檻,對上 Sol 時價格優勢在 Anthropic 一方,但 Terra 仍比 Opus 5 低 $0.05,而 Luna 則遠低於兩者。

常見問題

gpt-5.6 和 GPT-5.6 Sol 是同一個模型嗎?

是。OpenAI 的模型文件將未加後綴的 gpt-5.6 列為解析至 gpt-5.6-sol 的別名,因此會依 Sol 的費率計費:輸入低於 272K 時,每百萬 token 輸入 $5、輸出 $30;高於該門檻則為 $10 與 $45。

Claude Opus 5 的長上下文請求會更貴嗎?

不會。在一般 API 中,Anthropic 對完整 1M 視窗採用標準費率,並表示 900K-token 請求與 9K-token 請求的每 token 成本相同。只有選用 fast mode 才需支付溢價,輸入 $10、輸出 $50。

Claude Opus 5 與 GPT-5.6,哪個比較便宜?

要看級距。輸入低於 272K 時,Opus 5 的每百萬輸出 token 比 Sol 少 $5,其他費率則相同;Terra 和 Luna 都遠比兩者便宜。超過 272K 後,Opus 5 每次請求的成本約為 Sol 的一半,而 Terra 仍略低於 Opus 5。

Claude Opus 5 寫程式比 GPT-5.6 好嗎?

在我們 7 月 29 日的測試中,兩者都正確完成修正、計數與重構;當天 Google 對此查詢排名第一的 r/Anthropic 圖表貼文,也顯示兩者的程式分數幾乎持平。Opus 5 展現出最好的重構判斷,但在預設設定下,輸出 token 計費量是 Sol 的 3.4 倍,因此程式開發時的選擇更像是成本與回答冗長度的取捨。

Opus 5 與 GPT-5.6 的知識截止日期是什麼?

Anthropic 將 Claude Opus 5 的可靠知識截止日期訂為 2026 年 5 月。三款 GPT-5.6 模型則都採用 2026 年 2 月 16 日,約早三個月。

延伸閱讀