AIREITER

GPT-5.6 Luna vs DeepSeek V4 Pro:两款 API 实测对比

最后更新: 2026-08-10 10:52:49

同一组提示词下,GPT-5.6 Luna 和 DeepSeek V4 Pro 在我们的 API 测试中都拿到了 3/3 的正确结果,单看能力很可能不足以帮你做决定。真正拉开差距的是价格结构和延迟;而且 DeepSeek 官方定价页已经明确提示,API 服务价格近期将有显著上涨。以下是我们于 2026 年 8 月 10 日测得的数据,以及不同场景下的选择建议。

相同提示词实测:两款 API 都答对了什么

2026 年 8 月 10 日,我们通过同一套 API 流程,分别以默认设置向 GPT-5.6 Luna 和 DeepSeek V4 Pro 发送了三项完全相同的任务:一道故意要求极简回复的 Python 修复题(“只回复修正后的函数”)、一道答案唯一的三月台卡车调度推理题(答案为 10:10),以及一项包含可空字段的严格 JSON 提取任务。两款模型全部答对。

任务GPT-5.6 LunaDeepSeek V4 Pro
Python merge_intervals 缺陷修复正确(修复 max()),10.7 秒正确(修复 max()),16.1 秒
月台调度推理正确(10:10),8.0 秒正确(10:10),27.2 秒
严格 JSON 提取合法,完全符合 schema,3.0 秒合法,完全符合 schema,7.6 秒
GPT-5.6 Luna 与 DeepSeek V4 Pro 在三组相同提示词下的延迟对比

这里有两点限制和两项细节值得注意。这只是三项任务的抽样测试,不是完整基准测试。V4 Pro 默认开启思考模式,这基本解释了它在本轮测试中 2–3 倍的延迟差距;每次请求都可以关闭该模式,但高难度推理能力会有所损失。指令遵循方面,Luna 按要求只返回了函数本身,V4 Pro 则额外套了一层 Markdown 代码围栏。在聊天窗口里这无伤大雅,但在自动化流程中会多出一步解析。为检查稳定性,我们把调度题又跑了一次,两款模型仍都回答 10:10。

官方价格核验:DeepSeek 已预告涨价

我们于 2026 年 8 月 10 日核对了两家厂商的官方页面:GPT-5.6 Luna 的价格为每百万输入 token $0.20、缓存输入 $0.02、输出 $1.20(OpenAI 模型页面);DeepSeek V4 Pro 的缓存未命中输入为每百万 token $0.435、缓存命中输入 $0.003625、输出 $0.87(DeepSeek 定价页面)。

GPT-5.6 Luna 与 DeepSeek V4 Pro 的官方 API 每百万 token 定价对比

因此,不能简单说哪一款“更便宜”:Luna 的非缓存输入便宜 54%;V4 Pro 的输出便宜 27%;而 V4 Pro 的缓存命中价格比 Luna 低 5.5 倍。最终成本取决于你的 token 构成:

  • 交互式聊天(每次调用 1K 输入 + 500 输出):Luna 为 $0.0008,V4 Pro 为 $0.00087,基本可以视为持平。
  • 代码仓库审查(50K 全新输入 + 3K 输出):Luna 为 $0.0136,V4 Pro 为 $0.0244,Luna 便宜 44%。
  • Agent 循环(每轮 200K 缓存输入 + 20K 全新输入 + 10K 输出):Luna 为 $0.020,V4 Pro 为 $0.018。此时 V4 Pro 更划算,而且缓存轮次越多,优势越明显。
展示定价和上下文窗口的 GPT-5.6 Luna 官方模型页面

还有一项事实会影响这套成本计算的有效期。DeepSeek 定价页的脚注 2 写道:“我们计划在近期上调 DeepSeek API 服务的整体定价,预计涨幅较大。”目前没有给出日期或具体幅度。但如果你选择 V4 Pro 的核心理由是价格,这条官方预告意味着它存在明确的价格不确定性。Luna 的定价走势则相反:它伴随着 OpenAI 在 8 月下调 GPT-5.6 价格一同推出。

带有涨价脚注的 DeepSeek V4 Pro 官方价格表

缓存成本:V4 Pro 的主场

DeepSeek V4 Pro 的缓存输入为每百万 token $0.003625,Luna 则是 $0.02,二者相差 5.5 倍。对于每一轮都要重复读取一大段不变前缀的 Agent 工作负载,这一差距会成为总成本的决定因素。已有开发者注意到了这一点:

DeepSeek v4 Pro & MiMo v2.5 Pro ... 对于 Agent 驱动的工作来说便宜得惊人,因为它们的缓存输入价格极低($0.0036/mtok)。Luna 的缓存输入价格……定价页写的是 $0.02/mtok,贵了 5 倍。— Hacker News 评论者,发表于 GPT-5.6 发布讨论帖

还要把 Luna 的缓存写入附加费算进去:缓存写入按非缓存输入价格的 1.25 倍计费(见 OpenAI 模型页面);输入超过 272K token 的请求,整次请求都会按 2 倍输入、1.5 倍输出计费。如果你的 Agent 上下文经常超过 272K token,Luna 的实际价格大致会翻倍,而这恰好也是 V4 Pro 缓存优势最强的场景。

建模成本前,先查官方文档

调研过程中,我们发现第三方发布的两款模型数据并不一致:V4 Pro 的每百万输入 token 价格从 $0.435 到 $1.74 不等,Luna 的上下文窗口也被写成过 400K 到 1.05M 的各种版本。核查只需不到一分钟:定价只看上方链接的两份官方页面;确认模型版本字符串是否正确(当前 API 提供的是 DeepSeek-V4-Pro,Flash 固定为 -0731);再确认所谓“输入价格”指的是缓存命中还是缓存未命中。对 V4 Pro 来说,两者相差 120 倍。

决定适配场景的关键规格

除了价格,还有四项规格差异会直接影响选型:输出上限、模态能力、开放性和 API 能力。两款模型都宣称拥有约 1M 的上下文窗口(Luna 为 1,050,000 token,V4 Pro 为 1M),因此上下文本身并不能区分二者。

规格(核验于 2026 年 8 月 10 日)GPT-5.6 LunaDeepSeek V4 Pro
上下文窗口1,050,0001M
最大输出 token128K384K
输入模态文本 + 图片仅文本
推理控制Effort 档位(low→max)思考开启(默认)/ 关闭
开放权重否是(可自行托管)
Responses API是尚未支持(官方信息:2026 年 8 月初)
并发限制取决于使用层级500
知识截止日期2026 年 2 月 16 日定价页未说明

V4 Pro 的 384K 输出上限是 Luna 128K 的 3 倍。这对单次生成整套代码库、长篇翻译或批量结构化提取尤其重要,因为分块处理会引入额外的失败点。Luna 的图片输入则解决了另一类问题,DeepSeek 用户也会主动提到这一短板:

我唯一真正的抱怨是它们不能处理图片,这限制了它们自主调试某些问题的能力。— Hacker News 评论者,谈及用 DeepSeek 做个人项目

开放权重则让结论倒向另一边:V4 Pro 可以下载并自行托管,因此面对数据驻留要求时,它是这里唯一的选择。不过,这种规模的模型需要严肃的多 GPU 服务硬件,不是一个周末拿单台工作站就能完成的项目。

基准成绩更受推理档位影响,而非模型本身

公开的 GPT-5.6 Luna 与 DeepSeek V4 Pro 跑分,胜负可能会随着双方使用的 Effort 档位而反转。同一对模型在某个追踪站上得到 33.3 对 44.3,V4 Pro 胜出,但该测试让 Luna 使用 low effort、V4 Pro 使用 max;在让两者都运行 max 的 Artificial Analysis 中,则是 52 对 45,Luna 胜出。两份数据都没错,测量的只是不同配置。

延迟数据也有同样的陷阱。Artificial Analysis 给出的 Luna max effort 首个回答 token 时间是 132 秒:在 max effort 下,Luna 会先思考大约两分钟再开始回答。我们的默认设置测试中,Luna 在 3–10.7 秒内完成响应。两个数字都是真实的,但只有其中一个接近你的生产配置。开始输出之后,Luna 的吞吐量明显更高:202 token/s,对比 78 token/s(Artificial Analysis)。

推理模式甚至能显著改变同一模型的单项分数:V4 Pro 在 max thinking 下的 GPQA Diamond 得分为 90.1%,关闭思考后则为 72.9%。在共同使用 max effort 的基准中,Luna 在 SWE-Bench Pro 上以 62.7% 对 55.4% 领先,两者在 BrowseComp 上接近打平(83.3 对 83.4)。在相信任何榜单前,先问三个问题:使用了什么 Effort 档位?延迟是否包含思考时间?基准版本是否一致?例如,某追踪站给出的 Terminal-Bench 84.7 对 67.9 差距,比较的是 v2.1 和 v2.0。

到底该选哪一个?

面向用户的产品,选择 GPT-5.6 Luna:在我们的默认设置测试中,它三项任务都快了 2–3 倍,非缓存输入价格约为 V4 Pro 的一半,并且支持图片输入。缓存占比高的 Agent 循环、需要超过 128K token 输出的任务,或必须部署在自有硬件上的场景,则选择 DeepSeek V4 Pro;但做长期承诺时,应把官方涨价预告纳入成本测算。通过 GPT-5.6 Luna 和 DeepSeek V4 Pro,两者只需切换一个 endpoint 就能调用,因此在正式押注前,最好先用自己的业务负载复跑这三组提示词。

你的工作负载推荐选择决定性因素
聊天机器人、面向用户的应用Luna我们的测试延迟为 3.0–10.7 秒,对比 7.6–27.2 秒;202 对 78 tok/s
高量级全新输入处理Luna每 1M 非缓存输入为 $0.20,对比 $0.435
基于稳定上下文的 Agent 循环V4 Pro每 1M 缓存输入为 $0.003625,对比 $0.02
单次超长输出V4 Pro最大输出 384K,对比 128K
视觉任务(截图、作为图片的 PDF)LunaV4 Pro 仅支持文本
自行托管 / 数据驻留V4 Pro开放权重;Luna 仅提供 API
延续至 2027 年的预算确定性LunaDeepSeek 官方已发布涨价通知

常见问题

GPT-5.6 Luna 和 DeepSeek V4 Pro 哪个更便宜?

没有绝对答案。Luna 的非缓存输入便宜 54%(每 1M token 为 $0.20,对比 $0.435);V4 Pro 的缓存输入便宜 5.5 倍($0.003625,对比 $0.02),输出也便宜 27%($0.87,对比 $1.20)。重缓存的 Agent 使用 V4 Pro 成本更低;以全新输入为主的工作负载则是 Luna 更划算。

两款模型都支持 1M token 上下文窗口吗?

是。Luna 提供 1,050,000 token,V4 Pro 提供 1M。需要注意的是,Luna 输入超过 272K token 的请求,整次请求会按 2 倍输入和 1.5 倍输出计费。

DeepSeek V4 Pro 是开源的吗?可以自行托管吗?

可以。V4 Pro 提供开放权重,可以自行托管;不同于仅提供 API 的 Luna。但应按多 GPU 推理服务来规划硬件,而不是指望单台工作站即可运行。

GPT-5.6 Luna 支持图片输入吗?

支持,Luna 接受文本和图片输入。DeepSeek V4 Pro 仅支持文本。其用户也将缺少视觉支持视为自主调试工作流中的主要限制。

两款模型的最大输出 token 分别是多少?

DeepSeek V4 Pro 单次响应最多可输出 384K token;GPT-5.6 Luna 上限为 128K。对于一次性生成长文档或大型代码文件,V4 Pro 的上限高出 3 倍。

延伸阅读