GPT-5.6 Luna 一口氣便宜了 80%,Terra 也降了 20%。不過,這不代表所有 GPT-5.6 用戶的帳單都會等比例下降:Sol 的標準費率完全沒變,而多輪 Agent 若頻繁觸發快取寫入費用,折扣很可能還沒反映到帳單上就被吃掉了。
2026 年 7 月 30 日這波調價改了什麼
新價格自 2026 年 7 月 30 日生效,既有的 model ID 不需要變更。OpenAI 表示,這次下調兩個層級的價格,是因為承載模型的系統效率有所提升;GPT-5.6 Sol 的標準費率則維持原樣。
| 模型 | Model ID | 原輸入價格 | 現行輸入價格 | 原輸出價格 | 現行輸出價格 |
|---|---|---|---|---|---|
| GPT-5.6 Luna | gpt-5.6-luna | $1.00 | $0.20 | $6.00 | $1.20 |
| GPT-5.6 Terra | gpt-5.6-terra | $2.50 | $2.00 | $15.00 | $12.00 |
| GPT-5.6 Sol | gpt-5.6-sol | $5.00 | $5.00 | $30.00 | $30.00 |
以上為每 1M tokens 的標準層級、短上下文價格,資料來自 OpenAI API pricing docs,查核日期為 2026-07-31。
所以,若把這件事概括成「GPT-5.6 全系列變便宜」,其實只說對了三分之二。同一天,OpenAI 也替 Sol 新增 Fast mode:輸入 $10.00、輸出 $60.00,是標準價格的兩倍,但底層模型不變,吞吐量最高可提升至 2.5×。定價文件也註明,Fast mode 就是過去稱為 priority processing 的功能。換句話說,兩個較便宜的層級降價之際,旗艦層級也同步多了一個更昂貴的選項。
程式中應明確指定 model ID,不要只寫系列名稱。OpenAI 的模型目錄把 gpt-5.6 列為 gpt-5.6-sol 的別名;若以為短名稱會路由到低價層級,實際上會按旗艦價格計費。部分轉售商甚至不提供這個別名:AIReiter 的端點上,gpt-5.6 會回傳 Model 'gpt-5.6' not found(測試日期 2026-07-31)。
開發者討論的焦點,也不完全在降幅有多大,而是這個價格能否長期維持:
OpenAI 的 5.6 模型實際運行成本不可能這麼低 — r/Anthropic 討論串標題
Luna 比 GPT-5.4 nano 還便宜,現在該怎麼選?
GPT-5.6 Luna 現在每 1M tokens 的輸入為 $0.20、輸出為 $1.20;單看輸出 token,已比 gpt-5.4-nano 的 $0.20 / $1.25 更便宜,也遠低於 gpt-5.4-mini 的 $0.75 / $4.50。如果你保留舊 nano 或 mini 呼叫純粹是為了壓低成本,這個理由如今已不成立。
低價層是否仍有實戰價值?我在 2026-07-31 透過 AIReiter 的 OpenAI 相容端點,對三個 GPT-5.6 模型各跑了兩項任務:一項是嚴格 schema 的客服工單轉 JSON 擷取,另一項是只有唯一正解($23.71)的 token 計費算術題。每個任務各執行兩次,設定 max_tokens: 4000、不重試,並依預期輸出以通過/失敗判定。
| 任務 | 模型 | 輸入 tokens | 輸出 tokens | 延遲(第 1 次/第 2 次) | 正確 |
|---|---|---|---|---|---|
| 工單 → JSON | Luna | 135 | 77–78 | 4.0s / 3.5s | 是 |
| Terra | 135 | 46 | 2.1s / 2.1s | 是 | |
| Sol | 135 | 46 | 2.3s / 2.2s | 是 | |
| 計費算術 | Luna | 119 | 111–122 | 3.1s / 4.3s | 是 |
| Terra | 119 | 87–89 | 3.8s / 2.8s | 是 | |
| Sol | 4,488 | 84–87 | 3.5s / 3.2s | 是 |
這裡有兩個值得特別拉出來看的結果。
Luna 在擷取任務中反而是三者最慢的一個。它的延遲為 3.5–4.0s,Terra 則是 2.1s。便宜的層級不必然也是低延遲選項。
同一段提示詞,Terra 與 Luna 都計為 119 個輸入 tokens,Sol 卻回報 4,488 個。其中有 3,840 個被標記為 cached_tokens,而且兩次執行結果完全一致。改用極簡提示詞「Reply with only the word OK.」後,三者都回報相同的 24 tokens,表示膨脹現象與提示詞有關,而非模型本身。我只能看到 token 計數,看不到成因;因此應將其視為單一端點上量測到的計費行為,而不是模型的文件化特性。
以官方標準費率計算,三者回答同一個正確答案的成本如下:
每 1,000 次執行:Luna 為 $0.16、Terra 為 $1.29、Sol 為 $7.73。為了回傳同一個三位數答案,Sol 的收費約是 Terra 的 6×、Luna 的 47×。
這只是兩個簡單任務、每項兩次執行的小樣本,不是 benchmark,也沒有衡量推理能力。但它足以支持一條實用原則:先從 Luna 開始,只有在自己的流量上量測到失敗時才往上升級。在這次測試裡,Terra 已經答對的任務改用 Sol,沒有換來任何額外價值。完整的工作負載分配建議見文末表格。
為什麼降價 80%,帳單不一定少 80%
新聞裡的降價指的是新輸入與輸出 tokens 的費率;多輪 Agent 流量往往受第三個數字主導,那就是快取寫入。在三個 GPT-5.6 層級中,快取寫入的費率都是快取讀取的 12.5×。
| 模型 | 快取輸入(讀取) | 快取寫入 | 倍率 |
|---|---|---|---|
| GPT-5.6 Luna | $0.02 | $0.25 | 12.5× |
| GPT-5.6 Terra | $0.20 | $2.50 | 12.5× |
| GPT-5.6 Sol | $0.50 | $6.25 | 12.5× |
OpenAI developer community 在 2026-07-11 發布的一項受控測試,很清楚地說明這件事有多重要。透過 previous_response_id 串接六輪連續 Responses API 對話,Luna 的輸入 tokens 比 gpt-5.4-mini 少 3%,輸出 tokens 少 29%,但每段對話的成本反而高出 96%($0.0651 對 $0.0332)。Luna 約 70% 的輸入是按快取寫入計費。這些數字出現在降價前,但背後的機制並沒有改變。
值得注意的是,該實作的原因可以修正。GPT-5.6 的快取不會計算部分匹配;只要快取前綴有任何變動,就必須完整重寫。原作者把不斷增長的對話快照重建在 instructions 裡,於是每輪都讓快取前綴失效。
診斷結果很鮮明:穩定的 instructions 在後續 15 輪使用者輸入中,15 輪都命中快取;可變動的 instructions 則是 15 輪全數未命中。將這些上下文移到 developer input item 後,Luna 的溢價從 96% 降至 16.7%,而且在作者的盲測評估中,Luna 後來跑得更快、得分也高於 mini。無論是 prompt_cache_key 或明確設定快取斷點,都沒有幫上忙。
在認定折扣已經落到自己帳單前,先做兩件事:
- 不要讓任何可變內容出現在快取前綴中。系統文字、工具定義與 persona 應放在最前面,並維持位元組完全一致;對話狀態則放入 input items。
- 從 API 回傳資料確認拆分比例。
usage.prompt_tokens_details.cached_tokens與usage.prompt_tokens的比值,可告訴你每次呼叫的快取讀取占比。對長時間運作的 Agent 而言,這個比例過低,是本系列中最值得優先修正的成本問題。
GPT-5.6 有三種價格在流傳,到底該看哪一種?
搜尋 GPT-5.6 Luna 的價格,至少會看到三組不同數字;每一組在特定層級下都可能正確。先確認報價對應哪個層級,通常就能解開大多數矛盾。
| 你看到的價格 | Luna 輸入/輸出 | 代表意義 |
|---|---|---|
| $0.20 / $1.20 | 標準層級、短上下文 | 一般 API 呼叫的預設價格 |
| $0.10 / $0.60 | Batch 與 Flex 層級 | 標準價格的一半,適用非同步與較低優先級工作 |
| $0.40 / $2.40 | Fast mode | 標準價格的兩倍 |
| $1.00 / $6.00 | 7 月 30 日前的標準費率 | 降價前是正確價格 |
同一份定價文件還有兩項調整因子:長上下文的輸入費率是短上下文的 2×,輸出則為 1.5×,因此 Luna 的長上下文價格是 $0.40 / $1.80,而非 $0.40 / $2.40;此外,文件列出對於 2026-03-05 或之後發布的模型,符合條件的資料落地端點須加收 10%,GPT-5.6 全系列都在適用範圍內。
當價格頁面與你的帳單對不上時,兩個步驟就能釐清:先看頁面的驗證日期,再依實際呼叫的特定層級,對照官方 pricing docs。價格彙整站與轉售商也會公布自己的費率,這又是另一種情況:不是資料過時,而是價格本來就不同。
AIReiter 上的 GPT-5.6 三個層級,價格皆為 OpenAI 定價的 50%,並且跟進了 7 月 30 日的降價:GPT-5.6 Luna 為 $0.10 / $0.60、Terra 為 $1.00 / $6.00、Sol 為 $2.50 / $15.00;快取輸入與快取寫入同樣套用減半。
以每天處理 1M 輸入與 200K 輸出 tokens 的 Terra Agent 為例,官方定價每天是 $4.40,AIReiter 則是 $2.20;呼叫內容與 model ID 都完全相同。
至於 Luna 在整體市場的定位,則是另一個問題。根據 VentureBeat 7 月 30 日對 30 個模型的比較,Luna 合計 $1.40 的費率低於 Gemini 3.5 Flash-Lite($2.80)與 Gemini 3.1 Flash-Lite($1.75),但仍高於 DeepSeek v4-flash($0.42)。若成本是你唯一的判斷標準,最便宜的 LLM API並不在 OpenAI。
常見問題
GPT-5.6 Sol 也降價了嗎?
沒有。Sol 的標準費率維持每 1M tokens 輸入 $5.00、輸出 $30.00。它新增了價格加倍的 Fast mode,吞吐量最高可達 2.5×。
GPT-5.6 Luna 現在是最便宜的 API 模型嗎?
不是。它每 1M tokens 合計 $1.40,在前沿系列模型中確實屬於較便宜的一群;但 VentureBeat 7 月 30 日的表格顯示,DeepSeek v4-flash($0.42)、Xiaomi 的 MiMo-V2.5 Flash($0.40)與 DeepSeek v4-pro($1.305)都比它便宜。
為什麼有些頁面上的 GPT-5.6 Luna 還是 $1 / $6?
那是 2026 年 7 月 30 日以前的標準費率。先確認頁面標示的驗證日期,再依你實際呼叫的層級,對照官方定價文件。
Batch 和 Flex 也適用這次降價嗎?
是。Batch 與 Flex 設定為標準費率的一半,因此這兩個層級的 Luna 是 $0.10 / $0.60,Terra 是 $1.00 / $6.00;快取輸入與快取寫入也包含在內。
要拿到新價格,需要改程式嗎?
不需要。既有的 gpt-5.6-luna 與 gpt-5.6-terra model ID 直接適用新價格,無須遷移。唯一值得優先調整的是檢查快取讀取比例,因為折扣最常在這裡流失。
各類工作負載該選哪個層級
| 工作負載 | 建議層級 | 理由 |
|---|---|---|
| 高量擷取、標記、摘要 | Luna | 兩項測試任務皆通過;每 1M 合計 $1.40,現已低於 gpt-5.4-nano |
| 對延遲敏感的面向使用者呼叫 | Terra | 擷取任務實測快於 Luna(2.1s 對 3.5–4.0s) |
| Luna 未達品質門檻時的第一級升級 | Terra | 合計 $14,Sol 則是 $35 |
| 在你的流量上量測到 Terra 明顯表現不足的任務 | Sol | 這才是支付 Terra 實測單次任務成本 6× 的唯一理由 |
| 任何層級的多輪 Agent | 先修正快取 | 快取寫入費用是讀取的 12.5×;錯誤的前綴設計比層級選擇更影響成本 |