AIREITER

GPT-5.6 Luna vs DeepSeek V4 Pro:兩款 API 實測比較

最近更新: 2026-08-10 10:54:21

若你正在 GPT-5.6 Luna 與 DeepSeek V4 Pro 之間做 API 選型,模型能力本身可能不是最後的分水嶺。我們以完全相同的提示詞測試,兩者都是 3 題全對;真正拉開差距的,是延遲表現與計價方式。尤其 DeepSeek 官方定價頁已明確提醒,API 價格近期將有顯著調漲。以下是我們在 2026 年 8 月 10 日實測與核對到的結果,以及各種工作負載的選擇建議。

相同提示詞實測:兩款 API 都答對,但速度差很大

我們在 2026 年 8 月 10 日,透過同一套 API 管線,以預設設定向 GPT-5.6 Luna 與 DeepSeek V4 Pro 各送出三項相同任務:一個刻意要求極簡回覆的 Python 除錯題,指示為「只回傳修正後的函式」;一道只有一個正確答案(10:10)的三月台卡車排程題;以及包含可為 null 欄位的嚴格 JSON 擷取題。兩款模型全數答對。

任務GPT-5.6 LunaDeepSeek V4 Pro
Python merge_intervals 除錯正確(修正 max()),10.7 秒正確(修正 max()),16.1 秒
月台排程推理正確(10:10),8.0 秒正確(10:10),27.2 秒
嚴格 JSON 擷取有效,完全符合 schema,3.0 秒有效,完全符合 schema,7.6 秒
GPT-5.6 Luna 與 DeepSeek V4 Pro 在三組相同提示詞下的延遲比較

這份測試有兩點前提,也有兩個值得留意的細節。首先,這只是三項任務的抽測,不是完整基準測試。其次,V4 Pro 預設啟用 thinking mode,這大致解釋了本次 2~3 倍的延遲差距;每次請求都能關閉此模式,但較難的推理任務可能因此受影響。至於指令遵循,Luna 如要求般只回傳函式本身,V4 Pro 則額外加上 Markdown 程式碼區塊。在聊天視窗裡這無傷大雅,放進自動化管線則多了一道解析程序。我們也額外重跑一次排程題確認穩定性,兩者依然都回答 10:10。

官方價格核對:DeepSeek 已預告即將調漲

我們在 2026 年 8 月 10 日核對兩家官方頁面後確認:GPT-5.6 Luna 的價格為每百萬 input tokens $0.20、快取 input $0.02、output $1.20(OpenAI model page);DeepSeek V4 Pro 的 cache miss input 為 $0.435、cache hit input 為 $0.003625、output 為 $0.87(DeepSeek pricing page)。

GPT-5.6 Luna 與 DeepSeek V4 Pro 官方 API 每百萬 tokens 定價比較

因此,很難直接說哪一款「全面更便宜」。Luna 的未快取輸入便宜 54%;V4 Pro 的輸出便宜 27%;而 V4 Pro 的快取命中成本則是 Luna 的 1/5.5。實際花費取決於你的 token 組成:

  • 互動式聊天(每次呼叫 1K input + 500 output):Luna 為 $0.0008,V4 Pro 為 $0.00087,幾乎可視為平手。
  • 程式庫審查(50K 全新 input + 3K output):Luna 為 $0.0136,V4 Pro 為 $0.0244,Luna 便宜 44%。
  • Agent 迴圈(每輪 200K 快取 input + 20K 全新 input + 10K output):Luna 為 $0.020,V4 Pro 為 $0.018。這類情境下 V4 Pro 領先,而且快取輪次越多,優勢越明顯。
顯示定價與 context window 的 GPT-5.6 Luna 官方模型頁面

不過,還有一項資訊會影響這筆成本計算能維持多久。DeepSeek 定價頁的註腳 2 寫道:「We plan to raise the overall pricing for DeepSeek API services in the near future, with a significant increase expected.」目前沒有日期,也沒有漲幅數字;但若選擇 V4 Pro 的主要理由是價格,官方已經給出了有效期限警訊。Luna 的定價趨勢則剛好相反:它是在 OpenAI's August GPT-5.6 price cut 同期推出。

包含價格調漲註腳的 DeepSeek V4 Pro 官方定價表

快取成本是 V4 Pro 的主場

DeepSeek V4 Pro 的快取 input 為每百萬 tokens $0.003625,Luna 則是 $0.02,兩者相差 5.5 倍。對 Agent 類工作負載來說,這個差距尤其關鍵,因為每一輪通常都會重新讀取一大段未變動的長前綴內容。已有開發者注意到這點:

DeepSeek v4 Pro & MiMo v2.5 Pro ... are insanely cheap for agent-driven work due to their super low cached-input prices ($0.0036/mtok). For Luna, the cached-input price ... the pricing page puts it at $0.02/mtok, & that's 5x more expensive. — Hacker News commenter, 在 GPT-5.6 發表討論串中

另外也別忽略 Luna 的 cache write 加價:cache write 會以未快取 input 單價的 1.25 倍計費(OpenAI model page);若提示詞 input 超過 272K tokens,整筆請求的 input 會以 2 倍、output 以 1.5 倍計費。若你的 Agent context 經常超過 272K tokens,Luna 的實際成本大致會翻倍,而這正是 V4 Pro 快取優勢最顯著的場景。

成本試算前,先回到官方文件確認價格

研究這次比較時,我們發現第三方網站列出的 V4 Pro input 價格,從每百萬 tokens $0.435 到 $1.74 都有;Luna 的 context window 也被標成從 400K 到 1.05M 不等。要避免算錯,花不到一分鐘做三件事:只以本文上方連結的兩個官方頁面確認定價;核對模型版本字串,目前 API 提供的是 DeepSeek-V4-Pro,Flash 則固定為 -0731;最後確認你看到的「input price」是 cache hit 還是 cache miss,V4 Pro 的兩者相差 120 倍。

真正影響選型的規格差異

除了價格,還有四項規格會直接影響適用情境:最大輸出量、多模態能力、開放權重,以及 API 介面。兩者都標示約 1M 的 context window,Luna 為 1,050,000 tokens,V4 Pro 為 1M,因此 context 長度本身不是主要分界點。

規格(2026 年 8 月 10 日核對)GPT-5.6 LunaDeepSeek V4 Pro
Context window1,050,0001M
最大 output tokens128K384K
輸入模態文字 + 圖片僅文字
推理控制Effort levels(low→max)Thinking 開啟(預設)/關閉
開放權重否是(可自行部署)
Responses API有尚未提供(官方資訊:2026 年 8 月初)
併發限制依 usage tier 而定500
知識截止日期2026 年 2 月 16 日定價頁未說明

V4 Pro 的最大輸出量為 384K,是 Luna 128K 的 3 倍。對單次生成整個程式碼庫、長篇翻譯,或大量結構化資料擷取等工作而言,這可減少分段處理所帶來的失敗風險。Luna 的圖片輸入則在另一類場景更重要,DeepSeek 使用者也會主動提到這個限制:

My only real complaint is that they can't do images, which limits their ability to autonomously debug some kinds of issues. — Hacker News commenter, 談到以 DeepSeek 處理個人專案時

開放權重則讓情勢反轉。V4 Pro 可下載並自行部署,若有資料落地要求,這是兩者之中唯一可選的方案;但也要認清,部署這種規模的模型需要嚴肅的多 GPU 硬體配置,並不是一個週末能完成的專案。

Benchmark 的差異,往往比模型本身更受 effort mode 影響

公開的 GPT-5.6 Luna 與 DeepSeek V4 Pro 分數,勝負可能因雙方採用的 effort mode 而對調。例如,某個追蹤網站以 Luna 的 low effort 對上 V4 Pro 的 max effort,結果為 33.3 比 44.3,由 V4 Pro 勝出;Artificial Analysis則讓兩者都以 max 測試,結果為 52 比 45,Luna 領先。兩者都沒有錯,只是在測不同設定。

延遲數字也有相同陷阱。Artificial Analysis 報告 Luna 在 max effort 下的首個答案 token 時間為 132 秒;這代表在 max effort 時,Luna 會先思考約兩分鐘才開始回答。我們以預設設定測試時,Luna 則在 3~10.7 秒內回覆。兩組數字都是真的,但只有其中一組接近你的正式環境設定。進入輸出階段後,Luna 的吞吐量明顯更高:202 tokens/s,對上 78(Artificial Analysis)。

Effort mode 對單一模型的分數影響也很大:V4 Pro 在 max thinking 下,GPQA Diamond 得分為 90.1%,關閉 thinking 後則為 72.9%。在雙方都使用 max effort 的共享 benchmark 中,Luna 在 SWE-Bench Pro 以 62.7% 領先 V4 Pro 的 55.4%;BrowseComp 則近乎平手,為 83.3 對 83.4。看任何排行榜前,先問三件事:測試跑的是哪個 effort mode、延遲是否包含 thinking 時間,以及 benchmark 版本是否相同。例如某追蹤網站列出的 Terminal-Bench 84.7 對 67.9,其實比較的是 v2.1 與 v2.0。

該選 GPT-5.6 Luna 還是 DeepSeek V4 Pro?

做面向使用者的產品,選 GPT-5.6 Luna:在我們的預設設定測試中,它在三項任務都快了 2~3 倍,未快取 input 成本約是 V4 Pro 的一半,也支援圖片輸入。若是高度依賴快取的 Agent 迴圈、需要超過 128K tokens 的輸出,或必須部署在自家硬體,則選 DeepSeek V4 Pro;但若是長期承諾,務必把官方的漲價警告算進成本。兩者只差一次 endpoint 切換,你可以透過 GPT-5.6 Luna 與 DeepSeek V4 Pro,先拿本文三項提示詞在自己的工作負載上重跑,再做決定。

你的工作負載建議選擇關鍵依據
聊天機器人、面向使用者的應用Luna本次測試延遲為 3.0~10.7 秒,對上 7.6~27.2 秒;吞吐量為 202 對 78 tok/s
高量全新 input 處理Luna每 1M 未快取 input 為 $0.20,對上 $0.435
在穩定 context 上反覆運作的 Agent 迴圈V4 Pro每 1M 快取 input 為 $0.003625,對上 $0.02
單次長篇輸出V4 Pro最大 output 為 384K,對上 128K
視覺輸入(截圖、以圖片形式處理的 PDF)LunaV4 Pro 僅支援文字
自行部署/資料落地V4 Pro開放權重;Luna 僅提供 API
延續至 2027 年的預算確定性LunaDeepSeek 官方已發布價格調漲通知

常見問題

GPT-5.6 Luna 和 DeepSeek V4 Pro,哪一款比較便宜?

沒有一款在所有情況下都更便宜。Luna 的未快取 input 便宜 54%(每 1M tokens 為 $0.20,對上 $0.435);V4 Pro 的快取 input 便宜 5.5 倍($0.003625,對上 $0.02),output 也便宜 27%($0.87,對上 $1.20)。高快取比例的 Agent 使用 V4 Pro 較省;以全新 input 為主的工作負載則是 Luna 較省。

兩款模型都支援 1M-token context window 嗎?

是。Luna 提供 1,050,000 tokens,V4 Pro 提供 1M。但請注意,Luna 的 input 超過 272K tokens 時,整筆請求會以 2 倍 input 與 1.5 倍 output 計費。

DeepSeek V4 Pro 是開源模型嗎?可以自行部署嗎?

可以。V4 Pro 提供開放權重,可自行部署;不同於僅有 API 的 Luna。不過,請規畫多 GPU 的推論硬體,而非預期以單一工作站就能順利部署。

GPT-5.6 Luna 支援圖片輸入嗎?

支援。Luna 可接受文字與圖片輸入;DeepSeek V4 Pro 僅支援文字。DeepSeek 使用者也將缺乏視覺支援視為自主除錯工作流程中的主要限制。

兩款模型各自的最大 output tokens 是多少?

DeepSeek V4 Pro 單次回覆最高可輸出 384K tokens;GPT-5.6 Luna 上限則是 128K。若要單次生成長文件或大型程式碼檔,V4 Pro 的上限高出 3 倍。

延伸閱讀