DeepSeek 企业 AI 成本动态:谁拿到了 75% 的降幅?

最后更新: 2026-07-15 02:20:34

DeepSeek 的 V4 Pro 现在在官方 API 上的价格是每百万输入 token $0.435、每百万输出 token $0.87。同一模型在 Azure AI Foundry 上仍标价 $1.74 和 $3.48,恰好是降价前的价格。这个 4 倍差价已于 2026 年 7 月 14 日核实,是当前关于 DeepSeek 企业 AI 成本动态最重要的事实:贵公司支付多少,取决于的不是模型本身,而是您通过哪扇门进入并使用它。

本文为直接 API 和 Azure 的数字加上了日期标记,测试了一条经销商路径,通过两个 V4 模型运行相同工作负载,并以一个决策框架作结,另外还有一个截止日期:旧的 deepseek-chatdeepseek-reasoner 别名将于 2026 年 7 月 24 日停用。

DeepSeek V4 今日定价:关键数字

以下是来自 DeepSeek 的 API 文档 的官方价格表,已于 2026 年 7 月 14 日核实:

模型输入(缓存命中)输入(缓存未命中)输出上下文并发上限
deepseek-v4-flash$0.0028/M$0.14/M$0.28/M1M tokens2,500
deepseek-v4-pro$0.003625/M$0.435/M$0.87/M1M tokens500
DeepSeek official API pricing table showing V4 Flash and V4 Pro rates per million tokens

该表中的三个细节比标题费率更重要:

  • 缓存命中价格才是 agent 工作负载的真实价格。 V4 Pro 上的缓存命中价格为每百万 tokens 0.003625 美元,比缓存未命中便宜 120 倍。每次调用都重新发送相同 system prompt 和 tool definitions 的 agent 系统,几乎完全处于缓存命中区域,而 DeepSeek 会自动应用缓存,无需配置。
  • 没有促销星号。 作为上线促销开始的 75% 降价,现在就是标准价格。定价页面没有到期日期。InfoWorld 的报道将这一永久性归因于 V4 Pro 的工程设计:在长上下文下,其每个 token 的计算量约为前代的四分之一,因此这次降价是结构性的,而非补贴。
  • 别名截止日期是真实的。 模型名称 deepseek-chatdeepseek-reasoner 将于 2026 年 7 月 24 日 15:59 UTC 停用。仍在生产代码中调用这些名称的地方,需要一行迁移到 deepseek-v4-flashdeepseek-v4-pro。由于新默认值以 thinking 模式运行,如果你不显式设置模式,输出 token 数(以及账单)将会变化。

这两个模型都提供 1M-token 的上下文窗口和最多 384K 输出 tokens,API 现在还在 api.deepseek.com/anthropic 提供 Anthropic 兼容格式,此外还有 OpenAI 格式;如果你的团队希望将 DeepSeek 替换到为 Claude 构建的工具中,这一点很重要。

75%的削减并未覆盖所有渠道

Azure AI Foundry 以每百万 tokens 输入 $1.74、输出 $3.48 的价格销售相同的 DeepSeek-V4 Pro(全球部署,美国中部,已于 2026 年 7 月 14 日验证)。这就是未降价前的价格,未变。Azure 上的 V4 Flash 运行价格为 $0.19/$0.51:与直接 API 的缓存未命中费率相比,输入溢价 36%,输出溢价 82%。

Azure AI Foundry pricing table listing DeepSeek V4 Pro Global at $1.74 input and $3.48 output per million tokens

在我们查看的 Azure 定价页面(Global deployment,Central US,2026年7月14日)上,任何 DeepSeek 模型都没有出现 cached-input 行项目;请与您的 Microsoft 客户团队确认,因为 marketplace 定价可能会滞后于供应商定价。在 direct API 上,具有大量前缀复用的 agent 工作负载,每百万 input tokens 只需支付几分之一美分;而在 Azure 上,这些 tokens 中的每一个都会按全额费率计费。对于缓存密集型工作负载,实际差距并不是 4 倍;在输入侧可能超过 100 倍。

公平地说,对于 Azure,你买到的并不是同样的东西。Foundry 托管将流量保留在 Microsoft 的云内,受 Microsoft 的数据处理条款约束,享有 Azure SLA,并且不会有数据离开到由中国公司运营的服务器;对许多合规团队来说,这正是全部意义所在。Microsoft 正是以这种方式定位的:它正在将 DeepSeek 接入 Copilot 的多模型路由。但这种治理溢价如今已经可以量化:对于下面的参考工作负载,每个工作负载每月的成本差异是 31 美元和 209 美元,而采购团队应将其作为一项单独的费用来定价,而不是将其作为一个看不见的默认项默默吸收。

聚合平台和 API 转售商则位于中间位置。像 OpenRouter 这样的平台以接近官方费率的价格转售,社区报告指出 DeepSeek 的全球缓存仍然适用于它们。问题在于可见性;下文会详细说明,因为我们已经进行了测试。

真实企业工作负载的成本

纸面价格只有在与工作负载相乘时才会变成决策。以一个中型企业助手为例:每月 1 亿输入 token(50% 缓存命中率,这对不断重发 system prompts 的 agent 流量来说是一个保守的比例)加上 1000 万输出 token。以下是按 2026 年 7 月 14 日核实的费率,将这一完全相同的工作负载在六个渠道上的定价:

Bar chart comparing monthly cost of the same workload across six channels, from $9.94 on DeepSeek V4 Flash direct to $575 on GPT-5.6-Sol
渠道月度成本
DeepSeek V4 Flash,直接 API$9.94
Azure V4 Flash Global$24.10
DeepSeek V4 Pro,直接 API$30.63
GPT-5.6-Luna (OpenAI)$115.00
Azure V4 Pro Global$208.80
GPT-5.6-Sol (OpenAI)$575.00

表格背后的数学公式是可复用的:月度成本 = miss_tokens x miss_rate + hit_tokens x hit_rate + output_tokens x output_rate。缓存占比决定了成本的主导因素。同样是 100M 输入的工作负载,在 V4 Pro 上,直连在 0% 缓存命中率时每月直接成本为 $52.20,50% 时为 $30.63,90% 时为 $13.38;而在 Azure 上,这三种情况下都保持在 $208.80,因为没有公布缓存折扣。

对该表有两种解读。首先,最便宜的 DeepSeek 渠道与最昂贵的 frontier 渠道,在相同流量下相差 58 倍。其次,也是更不明显的一点:Azure 的 DeepSeek V4 Pro 费用比 OpenAI 的 GPT-5.6-Luna 还高。如果你的采购摘要写着“我们已标准化采用 DeepSeek 以节省成本”,但部署环境是 Azure Global,那么实际节省的金额可能还不如一个中阶 OpenAI 模型带来的收益。

突破预算的倍增因素是 agentic amplification。单轮聊天机器人每个用户问题大约只计一次调用;而生产级 agent 会串联规划、检索、工具调用和验证,输入与计费的比例可能达到 1:700,VentureBeat 对 2026 年 7 月 agent economics 的分析将这一现象称为“100x problem”。在这个比例下,我们的 1 亿 token 参考工作负载,相当于一个中等繁忙的 agent 功能所产生的流量,而不是一家公司的全部流量。便宜的按 token 定价并不是跳过成本控制的理由;它只是让你在构建 agent 产品时,它们仍然能够存活下去的条件。

我们在 V4 Flash 和 V4 Pro 上运行了相同的任务

定价页面并不能回答你们工程师会问的问题:一次请求到底要花多少钱,以及要多久?在 2026 年 7 月 14 日,我们通过一个兼容 OpenAI 的转售商端点,以默认设置(开启思考模式,最多 4,000 个输出 token)向两个 V4 模型发送了相同的编码任务——“编写一个 Python 函数,将 ISO 8601 持续时间字符串解析为总秒数,并提供 3 个测试用例”。我们不点名该转售商,是因为重点在于这一类别的行为,而不是某一家供应商;原始响应包含 DeepSeek 的 reasoning_content 字段,我们正是通过它确认了底层模型:

V4 FlashV4 Pro
实际耗时15.5s35.1s
完成 token 数(含推理)1,6901,902
有效输出速度~109 tok/s~54 tok/s
按官方费率计算的成本~$0.0005~$0.0017

明确说明注意事项:这只是单个样本,而且延迟包含中继开销,因此请将这些墙上时钟数字视为上限,而不是直接 API 的基准。两个响应都返回了 DeepSeek 的标志性 reasoning_content 字段:两种模型默认都运行思考模式,而这些推理 token 会计入输出费用。Flash 在回答前花费了 2,703 个字符来推理一个解析函数。如果你的工作负载不需要 chain-of-thought,关闭 thinking 是最便宜的优化之一。关于 Pro 的额外质量在何时足以证明 3 倍价格合理,我们将两种模型进行了完整对比,详见 DeepSeek V4 Flash vs V4 Pro

测试暴露出一个我们在其他地方未见记载的问题:中继通道的使用报告中没有缓存明细。我们连续两次发送了相同的 824 词元前缀——如果转售商保留了 DeepSeek 的前缀缓存机制,这本应是教科书式的缓存命中——而 API 响应只报告了 prompt_tokenscompletion_tokenstotal_tokens,没有 prompt_cache_hit_tokens 的拆分。在直接 API 中,这个字段是你用来核实 120x 缓存折扣是否体现在账单上的方式。通过中介渠道,你可能会在无法验证的情况下获得折扣,也可能根本没有获得。如果你通过任何转售商购买 DeepSeek,请务必具体询问缓存命中定价是否会传递下去,以及它会如何显示在你的发票上。

直接 API、Azure,还是聚合器:如何选择

频道决策可简化为一个简短的表格:

直接 APIAzure AI Foundry聚合商/经销商
V4 Pro price (in/out per M)$0.435 / $0.87$1.74 / $3.48价格不同;通常接近官方价格
Cache-hit discount有,自动,可审计未列出有时有;通常不可审计
Data residencyDeepSeek's serversMicrosoft cloud, your tenant经销商的基础设施
Contract/complianceChinese entityExisting Azure agreement经销商条款
Concurrency500 (Pro) / 2,500 (Flash)可提供 PTU 配置共享池,视情况而定
Multi-model consolidationDeepSeek onlyFoundry catalog广泛目录,一张账单

在实践中:直接 API 在纯经济性上胜出:没有任何渠道能匹配每百万 $0.003625 的缓存命中定价,而且只有这个渠道你才能审计到这项折扣。Azure 在你的法务团队不愿批准流量进入 DeepSeek 自有基础设施时胜出;你为治理支付的有效费率大约高出 7 倍,如果这是你有意识做出的选择,这种权衡完全是合理的。聚合器 则在 DeepSeek 只是路由器后面的多个模型之一、且统一计费值得接受微薄利润率时胜出;在承诺流量之前,请先核实缓存传递机制。

无论你选择哪个渠道,让 DeepSeek 账单保持平稳的路由规则都不花哨:将默认的分类、提取和摘要交给 Flash;将 Pro 保留给多文件代码生成和长上下文推理;对确定性任务关闭 thinking mode(这些推理 token 会按输出计费);并按工作流限制 agent loop 深度。一个调校良好的路由器,比 Flash 和 Pro 之间 3 倍的价差更重要。

DeepSeek 为什么能把价格定得这么低——以及这是否能持续

这些价格并不是亏本引流的噱头。V4 的架构采用 mixture-of-experts 设计,总参数量达 1.6 万亿,但每次前向传递只有约 490 亿个参数处于激活状态:你只需消耗中型模型级别的计算量,却能获得一线水平的能力(根据 DeepSeek 公开的结果,在 SWE-bench Verified 上达到 80.6%)。V4 Pro 版本专门针对长上下文成本进行了优化,这也是公司把原本 75% 的促销折扣直接转为常规定价,而不是让它过期失效的原因。

趋势对买方有利。根据大多数行业估计,前沿推理的单位成本每年大约下降 3 倍,而 DeepSeek 在一年内的降幅,尽管上下文长度增长到 1M tokens,仍然超过了这一曲线。OpenAI 在同一时期则朝着相反方向发展,借助 GPT-5.6-Sol 将其旗舰层级上调至 $5/$30。

反向力量是杰文斯悖论:更便宜的推理会可靠地带来更多推理。自 V3 时代以来一直被引用的 New Street Research 的观察——竞争加剧很少会降低总支出——在整个 AI 建设过程中始终成立。Agent 采用使每个用户的调用次数增长得比每 token 价格下降得更快,这就是为什么能够保持预算持平的企业,是那些把路由、缓存和 prompt 规范视为一等工程实践的企业,而不是那些选择最便宜模型的企业。理解这些成本动态,而不只是标价,才是区分一个始终保持低成本的 DeepSeek 部署与一个悄然膨胀的部署的关键。

常见问题

DeepSeek V4 为什么这么便宜?

专家混合架构:总参数量 1.6T,每个 token 约有 49B 激活参数。每个 token 的计算成本类似于更小得多的模型,而 V4 Pro 的长上下文工程将每个 token 的计算量降至其前代的约四分之一。定价是结构性的,而非促销性的。

DeepSeek V4 Pro 降价了多少?

75%:每百万 tokens(输入/输出)从 $1.74/$3.48 降至 $0.435/$0.87。它最初是作为限时促销推出的,后来成为永久标价。

75% 的价格下调适用于 Azure 吗?

不会。截至 2026 年 7 月 14 日,Azure AI Foundry 将 DeepSeek-V4 Pro Global 标价为 $1.74/$3.48,即降价前的费率,且未公布缓存输入定价。对于高度依赖缓存的工作负载,与直接 API 相比的实际差距可能超过 4 倍;请向 Microsoft 核实当前费率,因为市场定价可能会滞后于厂商降价。

DeepSeek 是否可免费用于企业用途?

API 按 token 计费,但模型权重采用 MIT 许可证,因此自托管用于商业用途是合法的。以 V4 的规模,你需要相当强大的 GPU 基础设施;对于大多数团队来说,API 的按 token 价格在总拥有成本(TCO)上远低于自托管,优势非常明显。

DeepSeek 的成本与 ChatGPT 相比如何?

在 API 定价方面,DeepSeek V4 Pro($0.435/$0.87)在输入上大约比 GPT-5.6-Sol($5/$30)便宜 11 倍,在输出上便宜 34 倍。ChatGPT 订阅(每席位每月 $20–$200)是不同的产品;对于程序化工作负载,API 对 API 的比较才更有意义。

7月24日之前该做什么

按紧急程度排序的三个操作:

1. 立即迁移模型别名。 deepseek-chatdeepseek-reasoner 将于 2026 年 7 月 24 日 15:59 UTC 停止解析。请明确固定为 deepseek-v4-flashdeepseek-v4-pro,并有意设置 thinking mode;默认值已更改,reasoning tokens 按输出计费。2. 重新评估你的渠道定价。 如果你出于治理原因使用 Azure,请确认在 4 倍标价且没有 cache 折扣的情况下,这仍然是经过深思熟虑的选择。如果你通过 reseller 购买,请以书面形式确认 cache 透传。3. 审计你的 cache 命中率。 在 direct API 上,请在 usage data 中检查 prompt_cache_hit_tokens。如果你的 agent 流量 cache 命中率低于 50%,请重构 prompts,使静态内容优先:在 120 倍的命中/未命中差距下,prompt 排序就是预算决策。

模型变便宜了。谁能捕获这份低成本(供应商、云服务商、经销商,还是你)所带来的收益,正是今年企业资金成败的关键。

相关阅读: DeepSeek V4 Flash vs V4 Pro · GLM 5.2 vs DeepSeek V4 Pro · OpenRouter 价格指南