AIREITER

DeepSeek V4 Pro GA API 指南:定價、跑分與遷移重點

最近更新: 2026-08-13 13:44:03

DeepSeek 在 2026 年 8 月 13 日正式推出 V4 Pro GA,公開了完整基準測試成績、採 MIT 授權的開放模型權重,並加入三種推理強度設定。對 API 使用者來說,最需要留意的是官方定價頁面已確認:自 2026 年 8 月 16 日 16:00 UTC 起,將改採尖峰/離峰計費。V4 Pro 的輸出 token 單價,將從每百萬 $0.87,上調至離峰 $1.98、尖峰 $3.96。

DeepSeek 官方 API 定價頁面,顯示尖峰與離峰費率

V4-Pro-0813 正式版上線:規格、跑分與開放權重一次到位

deepseek-v4-pro API 別名目前對應的模型已更新為 DeepSeek-V4-Pro-0813,可透過 DeepSeek App、網頁版及 API 使用。DeepSeek 於 8 月 13 日宣布推出此版本,並表示相較於 4 月 24 日的預覽版,其 Agent 能力已有顯著提升。

架構與核心規格:

項目DeepSeek-V4-Pro-0813
公開模型規模1.7T 參數(模型卡;預覽版為 1.6T)
上下文長度100 萬 token
最大輸出長度384K token
思考模式非思考與思考模式,預設為思考模式
推理強度low、high、max
新增解碼模組DSpark speculative decoding(7 個 speculative token)
API 相容性OpenAI ChatCompletions、Responses API、Anthropic API、Codex
並發限制500
授權條款MIT

模型卡建議 Agent 類場景採用 temperature = 1.0 與 top_p = 0.95。在 high 及 max 推理強度下,最大輸出長度可達 384K token。

官方公布的 GA 基準測試

DeepSeek 在模型卡中公開了 10 項基準測試比較。程式碼 Agent 任務使用 DeepSeek Harness minimal mode,推理強度設為 max。最後兩列 DSBench 為 DeepSeek 內部測試集;以下分數皆取自該模型卡。

DeepSeek V4-Pro-0813 GA 與 Kimi K3、Opus 4.8、Fable 5 在五項 Agent 基準測試的分數比較
基準測試Pro-0813Flash-0731Pro PreviewKimi K3Opus 4.8Fable 5
HLE(無工具/有工具)42.7 / 60.037.8 / 51.537.7 / 48.243.5 / 56.049.8 / 57.953.3 / 63.0
Terminal Bench 2.187.982.772.188.385.088.0
DeepSWE62.754.412.867.558.070.0
Toolathlon-Verified74.170.355.976.576.277.9
Cybergym83.376.752.780.078.383.1
NL2Repo61.554.238.5—69.7—
Agents' Last Exam25.725.216.527.625.7—
AutomationBench(公開)31.825.112.830.827.229.1
DSBench-FullStack(內部)71.168.741.873.771.677.2
DSBench-Hard(內部)67.259.631.163.071.768.3

相較於預覽版,GA 版進步幅度相當明顯:DeepSWE 從 12.8 升至 62.7,AutomationBench 則從 12.8 提升到 31.8。與競品相比,Pro-0813 在有工具的 HLE 項目拿下 60.0,高於 Kimi K3 的 56.0 與 Opus 4.8 的 57.9;但在 DeepSWE、Terminal Bench 及 Toolathlon-Verified,仍落後 Kimi K3 和 Fable 5。DSBench 兩項則是廠商內部基準,不宜與獨立維護的測試同等看待。

MIT 授權開放權重

0813 權重已在 Hugging Face 上線,採 MIT 授權,可透過 vLLM 與 SGLang 部署。模型卡也提供 vLLM 服務範例,使用 DSpark speculative decoding、FP8 KV cache,以及單一 4x GB300 節點。

「與目前最強的專有模型整體上具備廣泛競爭力。」—— DeepSeek V4-Pro 模型卡,Hugging Face

8 月 16 日起的完整費率:目前價格與尖離峰價格差多少?

定價頁面同時列出目前統一費率,以及自 2026 年 8 月 16 日 16:00 UTC 生效的尖峰/離峰費率。尖峰時段為 01:00–04:00 UTC 與 06:00–10:00 UTC,即北京時間 09:00–12:00 與 14:00–18:00;其餘時間均為離峰。離峰價格正好是尖峰的一半。

DeepSeek V4 Pro(DeepSeek-V4-Pro-0813)

計費項目目前統一費率離峰(8 月 16 日起)尖峰(8 月 16 日起)尖峰漲幅
輸入,快取命中$0.003625/M$0.022/M$0.044/M+1,114%
輸入,快取未命中$0.435/M$0.66/M$1.32/M+203%
輸出$0.87/M$1.98/M$3.96/M+355%
DeepSeek V4 Pro 每百萬 token 的目前統一費率與預定尖峰、離峰費率比較

尖峰時段的輸出價格上漲至原本的 4.6 倍。對正式環境中的 Agent 工作流而言,更具影響的是快取命中費率:原先的 $0.003625/M 約比快取未命中便宜 120 倍;8 月 16 日後,兩種時段的價差都縮小為 30 倍,離峰為 0.022 對 0.66,尖峰則是 0.044 對 1.32,而快取命中的絕對成本也上升 6 至 12 倍。

DeepSeek V4 Flash(DeepSeek-V4-Flash-0731)

計費項目目前統一費率離峰(8 月 16 日起)尖峰(8 月 16 日起)尖峰漲幅
輸入,快取命中$0.0028/M$0.007/M$0.014/M+400%
輸入,快取未命中$0.14/M$0.22/M$0.44/M+214%
輸出$0.28/M$0.66/M$1.32/M+371%

並發限制為2,500 個並發請求,是 Pro 配額的五倍。

各地時區的尖峰時段

時區尖峰區間 1尖峰區間 2
北京(UTC+8)09:00–12:0014:00–18:00
倫敦(UTC+1)02:00–05:0007:00–11:00
紐約(UTC-4)21:00–00:00(前一天)02:00–06:00
舊金山(UTC-7)18:00–21:0023:00–03:00

對美國團隊而言,尖峰多半落在夜間與傍晚;中國及東亞團隊則會直接碰上一般上班時段。

每天 10,000 次呼叫,V4 Pro 要花多少錢?

假設一個正式環境 Agent 每次呼叫都送出 50K token 的快取前綴,並產生 2K token 回覆。

成本項目目前統一費率離峰尖峰
快取命中輸入(500M token)$1.81$11.00$22.00
輸出(20M token)$17.40$39.60$79.20
每日合計$19.21$50.60$101.20
30 日合計$576$1,518$3,036

實際工作負載通常會混合尖峰與離峰呼叫,因此成本會落在兩者之間。同樣的負載若改用 Flash,目前統一費率下為每日 $7.00,離峰約 $16.70,尖峰約 $33.40。Flash 尖峰成本 $33.40/日高於 Pro 目前的統一費率 $19.21/日,但 Flash 離峰的 $16.70/日仍低於後者。

遷移重點:模型 ID、推理控制與版本鎖定

舊端點退役與替代模型 ID

4 月 24 日的預覽公告指出,deepseek-chat 與 deepseek-reasoner 會在「2026 年 7 月 24 日 15:59(UTC)後完全退役且無法存取」。程式碼中若仍使用這些字串,應盡快更新。

舊端點實際路由模型替代方案
deepseek-chatV4 Flash,非思考模式deepseek-v4-flash
deepseek-reasonerV4 Flash,思考模式deepseek-v4-flash(思考模式)或 deepseek-v4-pro

不少團隊以為 deepseek-reasoner 提供的是 Pro 等級推理能力,但它實際上路由至思考模式的 Flash。改遷移至 deepseek-v4-pro 後,輸出品質與帳單金額都會有所不同。

// Before (retired — fails)
{"model": "deepseek-reasoner", "messages": [...]}

// After
{"model": "deepseek-v4-pro", "messages": [...]}

Base URL 維持 https://api.deepseek.com 不變,請求結構也無須其他調整。

推理強度怎麼選

V4-Pro-0813 新增三種推理強度:low 適合簡單任務,high 適合日常 Agent 工作,max 則面向複雜問題。思考模式預設開啟,且思考 token 也會計入輸出費用。假如一段提示先產生 3,000 個思考 token,最後才輸出 200 token 答案,尖峰價格下會按 3,200 個輸出 token 計費,每次為 $0.0127;若只計最終答案,則僅為 $0.0008。DeepSeek 將 low 定位為簡單任務的設定,適合避免延伸思考徒增成本卻無實際效益。

版本鎖定

deepseek-v4-pro 是指向目前版本的別名,DeepSeek 日後推出新版時可能更新其指向。若正式環境需要可重現的行為,應確認所用供應商是否支援帶日期的模型識別碼。部分第三方閘道提供固定版本路由;在正式採用前,請先查閱供應商文件,確認各路由實際服務的模型版本。

API 協定相容性

兩款模型皆支援 OpenAI ChatCompletions 與 Anthropic API 格式。Anthropic 端點為 https://api.deepseek.com/anthropic。Responses API 與 Codex 相容性則是 GA 版本新增項目;如果遷移後遇到錯誤,建議兩種協定路徑都進行測試。

漲價後該選 Pro 還是 Flash?

V4-Pro-0813 在 10 項公開指標上均優於 V4-Flash-0731,但優勢幅度會隨任務複雜度而異:

基準測試Pro 0813Flash 0731差距
Terminal Bench 2.187.982.75.2 分
DeepSWE62.754.48.3 分
AutomationBench31.825.16.7 分
Cybergym83.376.76.6 分

適合選 V4 Pro 的情況:

  • Agent 迴圈會重複傳送固定且大型的前綴內容;雖然基礎費率提高,快取命中節省仍然有效
  • 複雜推理、多步工具使用或大規模程式碼生成,需要 Pro 較大的參數規模
  • 工作負載可接受 500 個並發請求的限制

適合選 V4 Flash 的情況:

  • 任務較簡單、請求量高,或對延遲敏感
  • 扇出型工作負載需要 2,500 個並發請求的上限
  • 品質差距不足以合理化高出 3 倍的輸出價格

想進一步比較兩款模型,可參考我們的 DeepSeek V4 Flash vs Pro comparison。若想先試用模型而不管理 API 金鑰,V4 Pro chat page 與 V4 Flash chat page都可立即使用。

常見問題

V4-Pro-0813 權重可自行部署嗎?

可以。模型採 MIT 授權,已在 Hugging Face 提供下載,並支援 vLLM 與 SGLang 部署路徑;部署細節可參考上方的開放權重段落。

GA 版推出後,該從 V4 Flash 改用 V4 Pro 嗎?

對多數重視成本的工作負載來說,Flash 依然更划算。各項基準中,它與 Pro 的落差從 Agents' Last Exam 的 0.5 分,到有工具 HLE 的 8.5 分不等,但輸出價格僅為後者的三分之一。只有在複雜多步推理或大規模程式碼生成確實需要完整參數規模時,才建議改用 Pro。

如何降低漲價帶來的影響?

可從三個方向著手:將批次作業與可延後執行的 Agent 排到尖峰外,也就是 01:00–04:00 與 06:00–10:00 UTC;盡量保持提示前綴穩定以提高快取命中率;簡單任務則改路由到 Flash,或在 Pro 使用 low 推理強度。

尖峰/離峰計費也適用於 DeepSeek App 與網站嗎?

官方定價頁面記載的是 API token 計費。列出的時段適用於直接 API 呼叫;閘道供應商可能會照轉、加價,或採用不同費率。最新資訊請查看定價頁面。