DeepSeek 的 V4 Pro 現在在官方 API 上的價格為每百萬 input tokens $0.435,output 每百萬為 $0.87。同一模型在 Azure AI Foundry 上仍標示為 $1.74 和 $3.48,正好是調降前的價格。這個 4 倍價差已於 2026 年 7 月 14 日核實,是目前關於 DeepSeek 企業 AI 成本動態最重要的單一事實:你的公司付多少錢,與其說取決於模型,不如說取決於你是透過哪扇門進入它。
本文為 direct API 和 Azure 的數字加上日期標記,測試一條經銷商路徑,讓相同工作負載經過兩個 V4 模型,並以一個決策框架作結,同時提醒一個截止日期:舊的 deepseek-chat 和 deepseek-reasoner 別名將於 2026 年 7 月 24 日退役。
DeepSeek V4 今日定價:關鍵數字
以下是來自 DeepSeek 的 API 文件 的官方價格表,已於 2026 年 7 月 14 日查核:
| 模型 | 輸入(快取命中) | 輸入(快取未命中) | 輸出 | 上下文 | 並發上限 |
|---|---|---|---|---|---|
| deepseek-v4-flash | $0.0028/M | $0.14/M | $0.28/M | 1M tokens | 2,500 |
| deepseek-v4-pro | $0.003625/M | $0.435/M | $0.87/M | 1M tokens | 500 |
那張表中的三個細節比標題利率更重要:
- 快取命中價格才是代理工作負載的真正價格。 V4 Pro 的快取命中每百萬 tokens 僅需 $0.003625,比快取未命中便宜 120 倍。每次呼叫都重送相同系統提示與工具定義的代理系統,幾乎完全運作在快取區域,而 DeepSeek 會自動套用快取,無需任何設定。
- 沒有促銷星號註記。 最初作為上市促銷而開始的 75% 降價,如今就是標示價格。定價頁面沒有任何到期日。InfoWorld 的報導將這種永久性歸因於 V4 Pro 的工程設計:在長上下文下,其每個 token 的運算量約為前代的四分之一,因此這次降價是結構性的,而非補貼。
- 別名截止日期是確定的。 模型名稱
deepseek-chat與deepseek-reasoner將於 2026 年 7 月 24 日 15:59 UTC 停用。仍在生產環境中呼叫這些名稱的程式碼,需要一行遷移到deepseek-v4-flash或deepseek-v4-pro。由於新預設會以 thinking mode 執行,如果你沒有明確設定 mode,輸出 token 數量(以及帳單)都會改變。
這兩個模型都提供 1M-token 上下文視窗,並且最多可輸出 384K tokens,而 API 現在除了 OpenAI 格式之外,也在 api.deepseek.com/anthropic 提供 Anthropic 相容格式;如果你的團隊想把 DeepSeek 替換進為 Claude 建置的工具中,這點就很重要。
75% 的削減並未涵蓋每個渠道
Azure AI Foundry 以每百萬個 tokens 輸入 $1.74、輸出 $3.48 的價格販售相同的 DeepSeek-V4 Pro(全球部署、Central US,已於 2026 年 7 月 14 日驗證)。這是裁價前的價格,未變動。Azure 上的 V4 Flash 為 $0.19/$0.51:相較於直接 API 的快取未命中費率,輸入溢價 36%,輸出溢價 82%。
在我們檢查的 Azure 定價頁面(全球部署、Central US、2026 年 7 月 14 日)上,任何 DeepSeek 模型都沒有出現 cached-input 的費率項目;請與您的 Microsoft 帳戶團隊確認,因為 marketplace 定價可能會落後於供應商定價。在 direct API 上,具有大量 prefix 重用的 agent 工作負載,每一百萬個 input tokens 只需支付幾分之一美分;而在 Azure 上,這些 tokens 會按全額費率計費。對於 cache-heavy 的工作負載,實際差距並不是 4 倍;在 input 端甚至可能超過 100 倍。
公平地說,對 Azure 而言,你買到的並不是同一樣東西。Foundry hosting 會將流量保留在 Microsoft 的雲端內,受 Microsoft 的資料處理條款約束,享有 Azure SLA,且不會讓資料流向由中國公司營運的伺服器;對許多合規團隊來說,這正是其全部意義所在。Microsoft 在將 DeepSeek 接入 Copilot 的多模型路由時,也正是以這種方式來定位。但如今,這項治理溢價已可量化:以以下的參考工作負載而言,每個工作負載每月的成本差異是 31 美元與 209 美元,而採購團隊應將其視為一項列支項目,而不是將其當作看不見的預設值吸收掉。
聚合器和 API 轉售商則介於兩者之間。像 OpenRouter 這類平台以接近官方費率的價格轉售,而社群回報指出,DeepSeek 的全球快取在透過它們使用時仍然適用。問題在於可見性;下文會進一步說明,因為我們實際測試過。
真正企業級工作負載的成本
紙面費率只有在與工作負載相乘後才會變成決策。以一個中型企業助理為例:每月 1 億 input tokens(50% cache hit,這對於會不斷重送 system prompts 的 agent traffic 來說是保守的比例)加上 1,000 萬 output tokens。以下是在 2026 年 7 月 14 日經驗證的費率下,將這一相同工作負載分別套用到六個 channel 的結果:
| 管道 | 每月成本 |
|---|---|
| DeepSeek V4 Flash,直接 API | $9.94 |
| Azure V4 Flash 全球版 | $24.10 |
| DeepSeek V4 Pro,直接 API | $30.63 |
| GPT-5.6-Luna (OpenAI) | $115.00 |
| Azure V4 Pro 全球版 | $208.80 |
| GPT-5.6-Sol (OpenAI) | $575.00 |
表格背後的數學公式是可重複使用的:每月成本 = miss_tokens x miss_rate + hit_tokens x hit_rate + output_tokens x output_rate。快取佔比主導了它。同樣的 100M 輸入工作負載在 V4 Pro 直連時,於 0% cache hit 的月費為 $52.20、50% 時為 $30.63、90% 時為 $13.38——而在 Azure 上,這三種情況都維持在 $208.80,因為沒有公布快取折扣。
對那張表有兩種解讀。第一,最便宜的 DeepSeek 通道與最昂貴的 frontier 通道,在相同流量下相差 58 倍。第二點較不明顯:Azure 的 DeepSeek V4 Pro 比 OpenAI 的 GPT-5.6-Luna 還貴。如果你的採購摘要寫著「我們標準化採用 DeepSeek 以節省成本」,但部署環境是 Azure Global,那麼實際節省的金額可能比使用一個中階 OpenAI 模型所帶來的節省還要少。
打破預算的倍增因素是 agentic amplification。單輪聊天機器人大致上每個使用者問題只會計費一次呼叫;而生產環境中的 agent 會串接規劃、檢索、工具呼叫與驗證,輸入與計費之間的比例可高達 1:700,VentureBeat 在 2026 年 7 月對 agent 經濟學的分析將此稱為「100x problem」。在這個比例下,我們 1 億 token 的參考工作負載,等同於一個中度繁忙的 agent 功能所產生的量,而不是整間公司的流量。便宜的每 token 定價並不是讓你跳過成本控制的理由;它只是讓 agent 產品在你把它們做出來的過程中仍能存活下來。
我們在 V4 Flash 和 V4 Pro 上執行了相同的工作
價格頁面無法回答您的工程師會問的問題:單次請求要花多少,以及需要多久?在 2026 年 7 月 14 日,我們透過一個相容於 OpenAI 的轉售商端點,將相同的程式設計任務——「撰寫一個 Python 函式,將 ISO 8601 持續時間字串解析為總秒數,並提供 3 個測試案例」——以預設設定(啟用 thinking mode,最多 4,000 個輸出 token)發送給兩個 V4 模型。我們不公開該轉售商的名稱,因為重點在於這一類別的行為,而非某一家供應商;原始回應包含 DeepSeek 的 reasoning_content 欄位,而這正是我們確認底層模型的方法:
| V4 Flash | V4 Pro | |
|---|---|---|
| 實際耗時 | 15.5s | 35.1s |
| 完成 token 數(含推理) | 1,690 | 1,902 |
| 有效輸出速度 | ~109 tok/s | ~54 tok/s |
| 官方費率成本 | ~$0.0005 | ~$0.0017 |
需明確說明的注意事項:這只是單一樣本,而且延遲包含中轉開銷,因此請將這些實際耗時數字視為上限,而不是直接 API 的基準測試。兩個回應都返回了 DeepSeek 的標誌性 reasoning_content 欄位:兩個模型預設都以 thinking mode 執行,而這些 reasoning tokens 會按輸出計費。Flash 在回答前花了 2,703 個字元思考一個解析函式。如果你的工作負載不需要 chain-of-thought,關閉 thinking 是目前最便宜的最佳化之一。至於在什麼情況下 Pro 額外的品質值得 3 倍價格,我們將兩個模型做了完整對比,請參閱 DeepSeek V4 Flash vs V4 Pro。
這項測試揭露了一個我們在其他地方未見記錄的發現:中繼通道的使用報告中沒有快取細分。我們連續兩次送出相同的 824-token 前綴——如果轉售商保留了 DeepSeek 的前綴快取,這就是標準的快取命中——而 API 回應只回報了 prompt_tokens、completion_tokens 和 total_tokens,沒有 prompt_cache_hit_tokens 的拆分。在直接使用 API 時,這個欄位正是用來稽核 120 倍快取折扣是否反映在你的帳單上。透過中介商,你可能會拿到折扣卻無法驗證,或者根本拿不到。若你透過任何轉售商購買 DeepSeek,請特別詢問快取命中定價是否會轉嫁,以及它會如何顯示在你的發票上。
直接 API、Azure,或聚合平台:如何選擇
頻道決策可簡化為一個簡短的表格:
| Direct API | Azure AI Foundry | Aggregator/reseller | |
|---|---|---|---|
| V4 Pro price (in/out per M) | $0.435 / $0.87 | $1.74 / $3.48 | 有差異;通常接近官方價格 |
| Cache-hit discount | 是,自動,可稽核 | 未列出 | 有時有;但通常不可稽核 |
| Data residency | DeepSeek's servers | Microsoft cloud, your tenant | 轉售商的基礎設施 |
| Contract/compliance | Chinese entity | 既有 Azure 協議 | 轉售商的條款 |
| Concurrency | 500 (Pro) / 2,500 (Flash) | 可提供 PTU 配置 | 共享池,視情況而定 |
| Multi-model consolidation | DeepSeek only | Foundry catalog | 廣泛的目錄,單一帳單 |
實務上:直接 API 在純經濟性上勝出:沒有任何管道能匹配每百萬 $0.003625 的 cache-hit 計價,而且這也是唯一能稽核該折扣的管道。當你的法務團隊不願放行流量到 DeepSeek 自有基礎架構時,Azure 會勝出;為了治理你大約要支付 7 倍的有效費率,而如果你是有意識地做出這個取捨,這筆交易完全合理。當 DeepSeek 只是位於 router 後方的多個模型之一,而且整合計費值得你接受較薄的 margin 時,Aggregators 會勝出;在承諾流量之前,先確認 cache pass-through。
無論你選擇哪個管道,讓 DeepSeek 帳單維持平穩的路由規則都不花俏:將預設分類、擷取與摘要交給 Flash;保留 Pro 給多檔案程式碼生成與長上下文推理;針對可確定性的任務關閉思考模式(那些推理 tokens 會被計入輸出);並為每個工作流程限制 agent 迴圈深度。調校良好的路由器,比 Flash 與 Pro 之間 3 倍的價差更重要。
為什麼 DeepSeek 能把價格定得這麼低——以及這是否可持續
這些價格並不是虧本促銷的噱頭。V4 的架構採用專家混合(mixture-of-experts)設計,總參數達 1.6 兆,但每次前向傳播實際啟用的只有約 490 億:你以中型模型的運算成本進行 inference,卻能獲得前沿級能力(根據 DeepSeek 公布的結果,在 SWE-bench Verified 上達到 80.6%)。V4 Pro 版本特別針對長上下文成本進行了優化,這就是為什麼公司把原本 75% 的促銷折扣直接轉為常態價格,而不是讓它到期失效。
發展方向有利於買方。根據大多數業界估計,前沿推理單位成本每年大約下降 3 倍,而 DeepSeek 在一年內的降幅,儘管上下文長度已增至 1M tokens,仍然超越了這條曲線。OpenAI 在同一時期則朝相反方向移動,透過 GPT-5.6-Sol 將其旗艦等級上調至 $5/$30。
反向力量是傑文斯定律:更便宜的推理會可靠地帶來更多推理。New Street Research 的觀察——自 V3 時代以來一直被引用——即競爭加劇很少會降低總支出,這一點在整個 AI 建構浪潮中始終成立。Agent 的採用讓每位使用者的呼叫次數成長得比每 token 價格下跌更快,這就是為什麼能把預算維持不變的企業,往往是把 routing、caching 和 prompt discipline 視為一級工程重點的企業,而不是那些只挑選最便宜模型的企業。理解這些成本動態,而不只是標價,才是讓一個 DeepSeek 部署持續便宜,與一個悄然膨脹的部署之間的分水嶺。
常見問題
DeepSeek V4 為什麼這麼便宜?
Mixture-of-experts 架構:總參數 1.6T,每個 token 約 49B 啟用參數。每個 token 的計算成本看起來像是一個小得多的模型,而 V4 Pro 的長上下文工程將每個 token 的計算量降至其前代的約四分之一。這個定價是結構性的,不是促銷性的。
DeepSeek V4 Pro 的價格降幅是多少?
75%:從每百萬 tokens(輸入/輸出)$1.74/$3.48 降至 $0.435/$0.87。它最初是一項限時促銷,後來成為永久標價。
75% 的價格降幅適用於 Azure 嗎?
不是。截至 2026 年 7 月 14 日,Azure AI Foundry 將 DeepSeek-V4 Pro Global 列為 $1.74/$3.48,也就是降價前的費率,且未公布快取輸入定價。對於高度依賴快取的工作負載,相較於直接 API 的實際價差可能超過 4 倍;請向 Microsoft 查詢最新費率,因為市場定價可能會落後於供應商的降價。
DeepSeek 可免費用於企業用途嗎?
API 是按 token 計費,但模型權重採用 MIT 授權,因此自行託管在商業用途上是合法的。以 V4 的規模來看,你需要相當強大的 GPU 基礎設施;對大多數團隊而言,API 的按 token 價格會大幅低於自行託管的總擁有成本(TCO)。
DeepSeek 的成本與 ChatGPT 相比如何?
在 API 定價方面,DeepSeek V4 Pro($0.435/$0.87)的輸入成本大約比 GPT-5.6-Sol($5/$30)便宜 11 倍,輸出成本則便宜 34 倍。ChatGPT 訂閱方案(每席位每月 $20–$200)則是不同的產品;對於程式化工作負載,API 對 API 的比較才是有意義的。
7月24日之前要做什麼
三項行動,按緊急程度排序:
1. 立即遷移模型別名。 deepseek-chat 和 deepseek-reasoner 將於 2026 年 7 月 24 日 15:59 UTC 停止解析。請明確固定為 deepseek-v4-flash 或 deepseek-v4-pro,並有意設定思考模式;預設值已變更,而推理 tokens 會計入輸出費用。 2. 重新定價你的通路。 如果你是基於治理原因使用 Azure,請確認在 4 倍列表價格且沒有快取折扣的情況下,這仍然是經過深思熟慮的取捨。如果你使用的是轉售商,請以書面方式取得快取轉嫁。 3. 審核你的快取命中率。 在直接 API 上,請在使用資料中查看 prompt_cache_hit_tokens。如果你的代理流量快取命中率低於 50%,請重新調整提示詞,讓靜態內容優先:在 120 倍命中/未命中差距下,提示詞排序就是一項預算決策。
模型變便宜了。誰能捕捉到這種便宜(供應商、雲端、轉售商,還是你)背後的動態,正是今年企業資金贏與輸的關鍵。
相關閱讀: DeepSeek V4 Flash vs V4 Pro · GLM 5.2 vs DeepSeek V4 Pro · OpenRouter 定價指南
