MiniMax M3 vs DeepSeek V4 Pro:成本、规格与结论

最后更新: 2026-07-13 05:59:19

MiniMax M3 和 DeepSeek V4 Pro 在质量上足够接近,对大多数团队来说,决定性因素是成本——而成本会根据你的工作负载在输入和输出 token 之间的分配方式而变化。M3 的输入更便宜,DeepSeek V4 Pro 的输出更便宜,所以“更便宜”的模型会随着你的使用模式而改变。M3 还可以读取图像和视频;V4 Pro 仅支持文本。这篇对比先从价格计算入手,因为这是大多数一对一对比都会跳过的部分,然后再说明在能力和速度上如何打破平局。

没人计算的成本盈亏平衡点

两者都是具有 1M-token 上下文的开放权重 Mixture-of-Experts 模型,按每百万 token 计价。标价(已于 2026 年 7 月 13 日核实)在交易双方讲述了截然相反的故事:

MiniMax M3

DeepSeek V4 Pro

输入 / 1M

$0.30

$0.43

输出 / 1M

$1.20(促销;标准价 $2.40)

$0.87

缓存输入 / 1M

~$0.06

~$0.0036

M3 在输入上更划算,V4 Pro 在输出上更划算。因此,哪个更便宜取决于你的输出占比——即在总 token 中,由生成而非输入传入的那一部分所占的比例。

Cost break-even between MiniMax M3 and DeepSeek V4 Pro as output share of total tokens changes

这个数学算起来很简单,你可以自己验证。对于输出占比 x(0 到 1),每百万总 token 的成本为 M3 = 0.30(1 − x) + 1.20x,而 V4 Pro = 0.43(1 − x) + 0.87x;令它们相等后,两条线在 x ≈ 0.28 处相交。低于这个值——也就是输入占比较高的工作负载——M3 更便宜。高于这个值,则 V4 Pro 更便宜。实际上:

  • 输入占主导(M3 胜出):检索增强生成、长文档分析、将大量上下文塞入以获取简短答案的 agent 循环。这些场景的输出通常只占 10–20%。M3 是更便宜的调用。

  • 输出占主导(V4 Pro 胜出):内容生成、长篇起草、冗长的推理过程。一旦生成部分超过总 token 的大约四分之一,V4 Pro 就会占优。

价格计算发生变化的地方

有两个注意事项会影响盈亏平衡点:

Prompt 缓存强烈偏向 DeepSeek。其缓存输入成本约为每百万 $0.0036,而 M3 约为 $0.06——大约便宜 16 倍。如果你在多次调用中复用相同的长上下文(固定的 system prompt、缓存的代码库、RAG 语料库),DeepSeek 的缓存定价可能会让原本更偏向 M3 的输入密集型工作负载重新向它倾斜。具体来说:一个 RAG 服务每次返回 2K-token 的答案时都会发送一段已缓存的 100K-token 上下文,那么 DeepSeek 的费用大约是 $0.0036 × 0.1 + $0.87 × 0.002 ≈ $0.0021/次,而 M3 则是 $0.06 × 0.1 + $1.20 × 0.002 ≈ $0.0084/次——在 M3 上大约贵 4 倍,完全是因为缓存费率。缓存占比很高的 RAG 是输入密集型场景中唯一一个 V4 Pro 更便宜的调用。

M3 的输出价格是促销价。 $1.20 的输出费率是促销活动;标准费率是 $2.40,这会把盈亏平衡点大幅降低,并使 V4 Pro 对于几乎任何有实际生成需求的工作负载都更便宜。请按你实际会被计费的费率来计算,而不是按促销价。

速度带来了相反的影响。M3 的生成速度约为 45 tokens/sec,而 V4 Pro 约为 21,接近快 2×。对于交互式或对延迟敏感的产品,这样的吞吐量可能比按 token 计费的折扣更有价值,而且它还能降低你需要配置的并发量。

超越价格:能力、速度、模态

只有当两个模型都达到你的质量标准时,成本才有意义。在这里,它们在价格表所掩盖的方面存在差异。

编码基准测试。 M3 在 SWE-Bench Pro 上报告了 59.0%,在 LiveCodeBench 上报告了 93.5%;V4 Pro 在 SWE-Bench Pro 上大约为 52–55%。有一个注意事项对信任很重要:M3 的数据由供应商报告,而 V4 Pro 的数据往往经过独立验证。M3 在纸面上看起来更强,但“供应商报告 vs 独立验证”正是你在投入使用前最希望针对自己的任务进行测试的差距。

规模 vs 效率。 V4 Pro 要大得多——总参数量为 1.6T(激活 49B),而 M3 为总参数量 428B(激活 23B)。M3 在编码方面得分更高,同时只激活一半的参数,这更能体现效率,也正是其按 token 定价能够降得如此之低的部分原因。

模态。 M3 原生支持多模态:它可以在文本之外接收图像和视频输入。V4 Pro 仅支持文本。如果你的流程会处理截图、图像形式的文档或视频帧,这不是一个决定胜负的附加条件——这才是整个决策的核心。

生态系统。 DeepSeek 是更成熟的部署选项,可通过大约 14 家推理提供商获得;M3 上线时可选范围要小得多。如果你重视提供商冗余或寻找最便宜的主机,那么 V4 Pro 目前更占优势。两者都发布了开放权重——M3 的权重在 Hugging Face 上,而 DeepSeek 则通过其官方渠道和合作主机分发 V4 Pro——不过无论是哪一个,若要进行大规模自托管,都需要多 GPU 硬件。

按工作负载选择哪个

  • 如果你的工作负载是输入密集型(RAG、长上下文分析、agent 编排),如果你需要图像或视频输入,或者如果生成速度很重要,请选择 MiniMax M3。若你想要一个强大的模型,而不是在各个提供商之间挑选,这也是更简单的选择。

  • 如果你的工作负载是输出密集型,如果你依赖 prompt caching 来处理重复上下文,如果你想要经过独立验证的 benchmark 分数,或者如果你重视成熟的多提供商生态系统,请选择 DeepSeek V4 Pro。若你希望在更简单的任务上获得 DeepSeek 的性价比,它更轻量的 V4 Flash 层级(总计 284B,激活 13B)也值得一看。

对于大多数团队,诚实的答案是按任务路由:输入密集型和多模态任务走 M3,输出密集型和缓存密集型任务走 V4 Pro。两者都不是放之四海而皆准的赢家。

接下来是什么

MiniMax 并没有停下脚步:报道显示其后继产品将大得多,据传 MiniMax M3 Pro 参数规模将达到 2.7 万亿,并瞄准 2026 年第三季度。如果它以开放权重发布,上面的比较就要重新定义——2.7T 的 M3 Pro 将面向与 V4 Pro 不同的层级。就目前而言,M3 和 V4 Pro 都是你今天就能调用的已发布模型。

常见问题

MiniMax M3 比 DeepSeek V4 Pro 更便宜吗?

这取决于你的输出占比。M3 的输入更便宜(每 100 万为 $0.30,对比 $0.43),而 DeepSeek 的输出更便宜($0.87 对比 $1.20)。它们在输出占比约 28% 时持平;低于这个比例时 M3 更便宜,高于这个比例时则是 V4 Pro 更便宜。

哪一个更适合编程?

M3 报告的编码基准更高(59.0% SWE-Bench Pro,而约为 52–55%),但其分数由供应商报告,而 V4 Pro 的分数经过独立验证。在做出决定之前,请先在您自己的代码仓库上测试两者。

DeepSeek V4 Pro 有多少参数?

总计 1.6 万亿,每个 token 激活 490 亿,而 M3 总计 4280 亿,激活 230 亿。V4 Pro 规模大得多;M3 的参数效率更高。

DeepSeek V4 Pro 是否支持图像或视频?

不。V4 Pro 仅支持文本。MiniMax M3 原生支持多模态,并接受图像和视频输入。

这两个模型都是免费且开源的吗?

M3 和 M2.7 都发布了可下载的开放权重,但它们的许可证不同——M3 遵循 MiniMax 的 M2.7 条款,默认仅限非商业用途,因此在商业部署前请检查每个模型的许可证。“开放权重”意味着可下载,并不自动代表无限制使用。