最便宜的编程 LLM API:实测 4 款模型(2026)

最后更新: 2026-07-30 10:58:38

单看 Token 单价,DeepSeek V4 Flash是这次测试里最便宜的编程 LLM API;但它并没有交出最干净的回答。Kimi K2.7 Code 满足了全部要求,GPT-5.4 mini 则快了约四倍。更关键的是:一旦错误补丁导致重试,最低单价未必等于最低总成本。

同一道 TypeScript 并发题,四款低价 API 的表现

2026 年 7 月 30 日,我们向四个当前具备编程能力的 API 提交了同一个 TypeScript 并发 Bug。题目规模不大,但约束很严格:修复 mapLimit,使其保持输出顺序;在调用用户代码前验证并发上限为正整数;绝不超过这个上限;并在首次拒绝后停止继续调度任务。每份回答还必须恰好附带三个测试。

这只是一次单任务的指令遵循测试,并非编程基准评测。每次直接调用均只发送一条用户消息,不使用工具,输出上限为 8,000 Token,温度采用服务商默认设置,并根据上述四项要求进行人工审查。耗时包含共享网关以及服务商和网络带来的开销。

模型核验后的每 1M 输入 / 输出价格耗时实现情况测试结论
DeepSeek V4 Flash$0.14 / $0.2859.4s最终版本满足全部四项要求覆盖了要求验证的行为最便宜的可用回答;输出较杂乱
MiniMax M3$0.30 / $1.20 promotional60.7s顺序和并发控制正确;拒绝状态晚了一个 Promise 层级才设置三个相关测试在严格的停止调度规则上接近通过
Kimi K2.7 Code$0.95 / $4.0064.3s调度器干净,结果有序,完成状态立即更新覆盖顺序/并发、拒绝和无效上限回答最完整
GPT-5.4 mini$0.75 / $4.5013.6s正确的工作线程池实现三个测试,但没有测试无效上限最快的干净实现;测试存在缺口

DeepSeek V4 Flash:价格最低,但需要更多清理

DeepSeek V4 Flash 最终给出了正确实现:预先分配结果数组,按输入索引写入结果,验证 limit,并通过共享的拒绝标志让工作线程停止。问题出在回答呈现方式上。它在最终函数之前先输出了一版废弃实现,其中有一条未解决的 Promise 路径,随后才解释这份草稿为何有问题。

如果开发者会逐行审查,这尚可接受;但对会提取第一个代码块并自动应用的 Agent 来说并不合适。只有在测试和类型检查是强制关卡时,我才会把 DeepSeek 作为低成本的首次尝试。

MiniMax M3:价格很有吸引力,但并发边界有瑕疵

MiniMax M3 的代码简洁,并通过 out[i] 保持了结果顺序。不过,它是在外层 Promise.all 的 catch 中设置拒绝标志,而不是由观察到回调失败的工作线程立即设置。多出的这一次 Promise 反应会留下一个虽小但本可避免的调度窗口,其他工作线程可能在看到停止标志前继续调度。

它的价格尤其有竞争力。MiniMax 官方页面显示,M3 在输入 Token 不超过 512K 时享有永久 50% 折扣,即输入 $0.30/M、输出 $1.20/M。超过 512K 后,折扣价格升至 $0.60/$2.40。

MiniMax M3 官方按量付费价格,显示永久 50% 折扣

Kimi K2.7 Code:本次样本中最完整的回答

Kimi K2.7 Code 直接给出了一份完整实现,而不是先给草稿再修正。它在调度前验证上限,维护按索引存放结果的数组,限制活跃 Promise 数量,并在拒绝处理器中设置 settled。它的三个测试也覆盖了这个函数最常出问题的三处:完成顺序、失败后的继续调度,以及无效上限。

Kimi 是本轮测试中最慢的,同时每 Token 成本也高于 DeepSeek 和享受折扣的 MiniMax。但对于无人值守的 Agent 工作流,如果漏掉一个边界条件的代价高于多花几美分 API 费用,我会愿意支付这部分差价。

GPT-5.4 mini:代码最快,测试选择不完整

在澄清后的调用中,GPT-5.4 mini 以 13.6 秒给出了最快的正确实现。其代码满足四项要求,包括在调度任何回调前验证并发上限。三个测试检查了顺序、并发峰值和拒绝行为,但模型没有测试自己实现的上限校验。

第一次尝试时,即使完整函数已经写在提示中,它仍要求提供仓库路径。这一次失误不足以构成全模型可靠性评分,但它再次说明了编程 Agent 的原则:验证产物,而不是迷信模型名。

100 次编程调用,实际要花多少钱

把 Token 价格放进具体的编程工作负载里会更容易比较。假设每次请求发送 8,000 个新的输入 Token,内容包括指令和仓库上下文;接收 2,000 个 Token 的补丁及说明。按以上核验价格计算,未计入缓存时,100 次调用成本介于$0.168 和 $1.56之间。

每次调用使用 8K 输入和 2K 输出 Token 时,100 次编程 API 调用的成本
模型100 次调用成本计算公式
DeepSeek V4 Flash$0.168100 × (0.008 × $0.14 + 0.002 × $0.28)
MiniMax M3$0.48100 × (0.008 × $0.30 + 0.002 × $1.20)
GPT-5.4 mini$1.50100 × (0.008 × $0.75 + 0.002 × $4.50)
Kimi K2.7 Code$1.56100 × (0.008 × $0.95 + 0.002 × $4.00)

如果验收检查不够严,一次失败后的重试就可能抹平单次调用的价差;一个进入代码审查甚至生产环境的错误补丁,其代价远高于任意一次 API 调用。

仓库 Agent 可以复用稳定的提示词和代码前缀。官方缓存输入价格分别为:DeepSeek V4 Flash $0.0028/MMiniMax M3 $0.06/MKimi K2.7 Code $0.19/M,以及GPT-5.4 mini $0.075/M;发生变化的文件和工具轨迹仍按新输入计费。

聊天、分类等非编程任务对能力下限的要求不同;更广泛的标准价格可参考这份最便宜 LLM API 对比

“Groq 和 Cerebras 的推理速度非常快,但并发量达到中等规模后,限流会很严重。”——一位开发者在 r/ArtificialInteligence 上的报告

这条反馈应当被当作一个测试案例,而不是针对服务商整体的结论:请用计划运行的并发工作线程数,实测入选 API 的表现。

不同编程工作流,该选哪款低价模型

最便宜的编程 LLM API 取决于你如何捕获失败。若每个补丁都会经过确定性检查,DeepSeek 是成本最低的默认选择;而在本次样本中,若模型需要自行覆盖边界条件,Kimi 是更稳妥的选择。

工作流推荐原因不适合的情况
带测试和类型检查的原型开发DeepSeek V4 Flash$0.14/$0.28,且最终实现正确自动化流程可能不经审查就应用第一个代码块
无人值守的编程 Agent 循环Kimi K2.7 Code本次样本中实现和测试选择最完整延迟或最低 Token 账单是硬约束
交互式编辑器操作GPT-5.4 mini13.6s,本轮远快于另外三款希望生成的测试覆盖每一项已声明的不变量
大上下文预算型任务MiniMax M3在永久折扣下,512K 以内为 $0.30/$1.20任务核心是严格的并发/错误语义

我不会仅因为某个小型通用聊天模型的输出价格是 $0.08/M,就拿它来做编程任务。便宜的编程 API,前提是它能生成能通过你工作流中检查的补丁。如果没有自动化检查,就应优先看模型首轮回答的完整性,而不是最低的标价。

比起固定用一个模型,低价优先再升级更合理

双层路由能利用最低 Token 价格,又不必盲目信任低价模型。模型选择应由确定性检查结果决定,而不是提示词长度或主观置信度评分。

  1. 首次尝试发送给 DeepSeek V4 Flash。
  2. 运行仓库的格式化工具、类型检查器、单元测试,以及任何任务专用的隐藏测试。
  3. 全部检查通过后,再接受该补丁。
  4. 若失败,将原始任务、失败补丁和精简的测试输出发送给 Kimi K2.7 Code;如果交互延迟更重要,则改用 GPT-5.4 mini。
  5. 限制升级尝试次数,避免 Agent 在单个问题上无限消耗费用。

这条路线让简单任务保留 DeepSeek 的亚美分成本,只在已测得的失败场景中支付更高价格。通过一个 OpenAI 兼容的模型层,切换只需改模型名,无须维护四套独立集成;AIReiter LLM API directory 通过一个端点提供这些模型。

常见问题

最便宜的编程 LLM API 是什么?

本次测试中,DeepSeek V4 Flash 是价格最低的具备编程能力 API,输入为 $0.14/M,输出为 $0.28/M。它最终生成了正确实现,但回答中也包含一份有问题的废弃草稿,因此应配合自动化检查使用。

DeepSeek 够不够用于编程 Agent?

如果 Agent 接受补丁前必须通过测试、类型检查和格式化,DeepSeek V4 Flash 足以作为低成本的首次尝试。对于缺少强检查的无人值守任务,在这次单任务样本中,Kimi K2.7 Code 给出了更完整的回答。

API 按量付费和编程订阅,哪个更便宜?

应根据实测输入和输出 Token,按表中的费率计算每月 API 成本,再与订阅价格、请求上限,以及是否包含 API 或 Agent 访问权限进行比较。两种计费模式没有天然谁更便宜。

一句话路由建议

编程任务先用DeepSeek V4 Flash,只接受通过确定性检查的补丁;失败后升级至Kimi K2.7 Code,对延迟敏感的工作则用GPT-5.4 mini。价格已经核验;质量排序仅来自一项受限任务,仍应在你自己的仓库中重新测试。