MiniMax M3 和 DeepSeek V4 Pro 在质量上足够接近,对大多数团队来说,决定性因素是成本——而成本会根据你的工作负载在输入和输出 token 之间的分配方式而变化。M3 的输入更便宜,DeepSeek V4 Pro 的输出更便宜,所以“更便宜”的模型会随着你的使用模式而改变。M3 还可以读取图像和视频;V4 Pro 仅支持文本。这篇对比先从价格计算入手,因为这是大多数一对一对比都会跳过的部分,然后再说明在能力和速度上如何打破平局。
没人计算的成本盈亏平衡点
两者都是具有 1M-token 上下文的开放权重 Mixture-of-Experts 模型,按每百万 token 计价。标价(已于 2026 年 7 月 13 日核实)在交易双方讲述了截然相反的故事:
MiniMax M3 | DeepSeek V4 Pro | |
|---|---|---|
输入 / 1M | $0.30 | $0.43 |
输出 / 1M | $1.20(促销;标准价 $2.40) | $0.87 |
缓存输入 / 1M | ~$0.06 | ~$0.0036 |
M3 在输入上更划算,V4 Pro 在输出上更划算。因此,哪个更便宜取决于你的输出占比——即在总 token 中,由生成而非输入传入的那一部分所占的比例。

这个数学算起来很简单,你可以自己验证。对于输出占比 x(0 到 1),每百万总 token 的成本为 M3 = 0.30(1 − x) + 1.20x,而 V4 Pro = 0.43(1 − x) + 0.87x;令它们相等后,两条线在 x ≈ 0.28 处相交。低于这个值——也就是输入占比较高的工作负载——M3 更便宜。高于这个值,则 V4 Pro 更便宜。实际上:
输入占主导(M3 胜出):检索增强生成、长文档分析、将大量上下文塞入以获取简短答案的 agent 循环。这些场景的输出通常只占 10–20%。M3 是更便宜的调用。
输出占主导(V4 Pro 胜出):内容生成、长篇起草、冗长的推理过程。一旦生成部分超过总 token 的大约四分之一,V4 Pro 就会占优。
价格计算发生变化的地方
有两个注意事项会影响盈亏平衡点:
Prompt 缓存强烈偏向 DeepSeek。其缓存输入成本约为每百万 $0.0036,而 M3 约为 $0.06——大约便宜 16 倍。如果你在多次调用中复用相同的长上下文(固定的 system prompt、缓存的代码库、RAG 语料库),DeepSeek 的缓存定价可能会让原本更偏向 M3 的输入密集型工作负载重新向它倾斜。具体来说:一个 RAG 服务每次返回 2K-token 的答案时都会发送一段已缓存的 100K-token 上下文,那么 DeepSeek 的费用大约是 $0.0036 × 0.1 + $0.87 × 0.002 ≈ $0.0021/次,而 M3 则是 $0.06 × 0.1 + $1.20 × 0.002 ≈ $0.0084/次——在 M3 上大约贵 4 倍,完全是因为缓存费率。缓存占比很高的 RAG 是输入密集型场景中唯一一个 V4 Pro 更便宜的调用。
M3 的输出价格是促销价。 $1.20 的输出费率是促销活动;标准费率是 $2.40,这会把盈亏平衡点大幅降低,并使 V4 Pro 对于几乎任何有实际生成需求的工作负载都更便宜。请按你实际会被计费的费率来计算,而不是按促销价。
速度带来了相反的影响。M3 的生成速度约为 45 tokens/sec,而 V4 Pro 约为 21,接近快 2×。对于交互式或对延迟敏感的产品,这样的吞吐量可能比按 token 计费的折扣更有价值,而且它还能降低你需要配置的并发量。
超越价格:能力、速度、模态
只有当两个模型都达到你的质量标准时,成本才有意义。在这里,它们在价格表所掩盖的方面存在差异。
编码基准测试。 M3 在 SWE-Bench Pro 上报告了 59.0%,在 LiveCodeBench 上报告了 93.5%;V4 Pro 在 SWE-Bench Pro 上大约为 52–55%。有一个注意事项对信任很重要:M3 的数据由供应商报告,而 V4 Pro 的数据往往经过独立验证。M3 在纸面上看起来更强,但“供应商报告 vs 独立验证”正是你在投入使用前最希望针对自己的任务进行测试的差距。
规模 vs 效率。 V4 Pro 要大得多——总参数量为 1.6T(激活 49B),而 M3 为总参数量 428B(激活 23B)。M3 在编码方面得分更高,同时只激活一半的参数,这更能体现效率,也正是其按 token 定价能够降得如此之低的部分原因。
模态。 M3 原生支持多模态:它可以在文本之外接收图像和视频输入。V4 Pro 仅支持文本。如果你的流程会处理截图、图像形式的文档或视频帧,这不是一个决定胜负的附加条件——这才是整个决策的核心。
生态系统。 DeepSeek 是更成熟的部署选项,可通过大约 14 家推理提供商获得;M3 上线时可选范围要小得多。如果你重视提供商冗余或寻找最便宜的主机,那么 V4 Pro 目前更占优势。两者都发布了开放权重——M3 的权重在 Hugging Face 上,而 DeepSeek 则通过其官方渠道和合作主机分发 V4 Pro——不过无论是哪一个,若要进行大规模自托管,都需要多 GPU 硬件。
按工作负载选择哪个
如果你的工作负载是输入密集型(RAG、长上下文分析、agent 编排),如果你需要图像或视频输入,或者如果生成速度很重要,请选择 MiniMax M3。若你想要一个强大的模型,而不是在各个提供商之间挑选,这也是更简单的选择。
如果你的工作负载是输出密集型,如果你依赖 prompt caching 来处理重复上下文,如果你想要经过独立验证的 benchmark 分数,或者如果你重视成熟的多提供商生态系统,请选择 DeepSeek V4 Pro。若你希望在更简单的任务上获得 DeepSeek 的性价比,它更轻量的 V4 Flash 层级(总计 284B,激活 13B)也值得一看。
对于大多数团队,诚实的答案是按任务路由:输入密集型和多模态任务走 M3,输出密集型和缓存密集型任务走 V4 Pro。两者都不是放之四海而皆准的赢家。
接下来是什么
MiniMax 并没有停下脚步:报道显示其后继产品将大得多,据传 MiniMax M3 Pro 参数规模将达到 2.7 万亿,并瞄准 2026 年第三季度。如果它以开放权重发布,上面的比较就要重新定义——2.7T 的 M3 Pro 将面向与 V4 Pro 不同的层级。就目前而言,M3 和 V4 Pro 都是你今天就能调用的已发布模型。
常见问题
MiniMax M3 比 DeepSeek V4 Pro 更便宜吗?
这取决于你的输出占比。M3 的输入更便宜(每 100 万为 $0.30,对比 $0.43),而 DeepSeek 的输出更便宜($0.87 对比 $1.20)。它们在输出占比约 28% 时持平;低于这个比例时 M3 更便宜,高于这个比例时则是 V4 Pro 更便宜。
哪一个更适合编程?
M3 报告的编码基准更高(59.0% SWE-Bench Pro,而约为 52–55%),但其分数由供应商报告,而 V4 Pro 的分数经过独立验证。在做出决定之前,请先在您自己的代码仓库上测试两者。
DeepSeek V4 Pro 有多少参数?
总计 1.6 万亿,每个 token 激活 490 亿,而 M3 总计 4280 亿,激活 230 亿。V4 Pro 规模大得多;M3 的参数效率更高。
DeepSeek V4 Pro 是否支持图像或视频?
不。V4 Pro 仅支持文本。MiniMax M3 原生支持多模态,并接受图像和视频输入。
这两个模型都是免费且开源的吗?
M3 和 M2.7 都发布了可下载的开放权重,但它们的许可证不同——M3 遵循 MiniMax 的 M2.7 条款,默认仅限非商业用途,因此在商业部署前请检查每个模型的许可证。“开放权重”意味着可下载,并不自动代表无限制使用。
