单看 Token 单价,DeepSeek V4 Flash是这次测试里最便宜的编程 LLM API;但它并没有交出最干净的回答。Kimi K2.7 Code 满足了全部要求,GPT-5.4 mini 则快了约四倍。更关键的是:一旦错误补丁导致重试,最低单价未必等于最低总成本。
同一道 TypeScript 并发题,四款低价 API 的表现
2026 年 7 月 30 日,我们向四个当前具备编程能力的 API 提交了同一个 TypeScript 并发 Bug。题目规模不大,但约束很严格:修复 mapLimit,使其保持输出顺序;在调用用户代码前验证并发上限为正整数;绝不超过这个上限;并在首次拒绝后停止继续调度任务。每份回答还必须恰好附带三个测试。
这只是一次单任务的指令遵循测试,并非编程基准评测。每次直接调用均只发送一条用户消息,不使用工具,输出上限为 8,000 Token,温度采用服务商默认设置,并根据上述四项要求进行人工审查。耗时包含共享网关以及服务商和网络带来的开销。
| 模型 | 核验后的每 1M 输入 / 输出价格 | 耗时 | 实现情况 | 测试 | 结论 |
|---|---|---|---|---|---|
| DeepSeek V4 Flash | $0.14 / $0.28 | 59.4s | 最终版本满足全部四项要求 | 覆盖了要求验证的行为 | 最便宜的可用回答;输出较杂乱 |
| MiniMax M3 | $0.30 / $1.20 promotional | 60.7s | 顺序和并发控制正确;拒绝状态晚了一个 Promise 层级才设置 | 三个相关测试 | 在严格的停止调度规则上接近通过 |
| Kimi K2.7 Code | $0.95 / $4.00 | 64.3s | 调度器干净,结果有序,完成状态立即更新 | 覆盖顺序/并发、拒绝和无效上限 | 回答最完整 |
| GPT-5.4 mini | $0.75 / $4.50 | 13.6s | 正确的工作线程池实现 | 三个测试,但没有测试无效上限 | 最快的干净实现;测试存在缺口 |
DeepSeek V4 Flash:价格最低,但需要更多清理
DeepSeek V4 Flash 最终给出了正确实现:预先分配结果数组,按输入索引写入结果,验证 limit,并通过共享的拒绝标志让工作线程停止。问题出在回答呈现方式上。它在最终函数之前先输出了一版废弃实现,其中有一条未解决的 Promise 路径,随后才解释这份草稿为何有问题。
如果开发者会逐行审查,这尚可接受;但对会提取第一个代码块并自动应用的 Agent 来说并不合适。只有在测试和类型检查是强制关卡时,我才会把 DeepSeek 作为低成本的首次尝试。
MiniMax M3:价格很有吸引力,但并发边界有瑕疵
MiniMax M3 的代码简洁,并通过 out[i] 保持了结果顺序。不过,它是在外层 Promise.all 的 catch 中设置拒绝标志,而不是由观察到回调失败的工作线程立即设置。多出的这一次 Promise 反应会留下一个虽小但本可避免的调度窗口,其他工作线程可能在看到停止标志前继续调度。
它的价格尤其有竞争力。MiniMax 官方页面显示,M3 在输入 Token 不超过 512K 时享有永久 50% 折扣,即输入 $0.30/M、输出 $1.20/M。超过 512K 后,折扣价格升至 $0.60/$2.40。
Kimi K2.7 Code:本次样本中最完整的回答
Kimi K2.7 Code 直接给出了一份完整实现,而不是先给草稿再修正。它在调度前验证上限,维护按索引存放结果的数组,限制活跃 Promise 数量,并在拒绝处理器中设置 settled。它的三个测试也覆盖了这个函数最常出问题的三处:完成顺序、失败后的继续调度,以及无效上限。
Kimi 是本轮测试中最慢的,同时每 Token 成本也高于 DeepSeek 和享受折扣的 MiniMax。但对于无人值守的 Agent 工作流,如果漏掉一个边界条件的代价高于多花几美分 API 费用,我会愿意支付这部分差价。
GPT-5.4 mini:代码最快,测试选择不完整
在澄清后的调用中,GPT-5.4 mini 以 13.6 秒给出了最快的正确实现。其代码满足四项要求,包括在调度任何回调前验证并发上限。三个测试检查了顺序、并发峰值和拒绝行为,但模型没有测试自己实现的上限校验。
第一次尝试时,即使完整函数已经写在提示中,它仍要求提供仓库路径。这一次失误不足以构成全模型可靠性评分,但它再次说明了编程 Agent 的原则:验证产物,而不是迷信模型名。
100 次编程调用,实际要花多少钱
把 Token 价格放进具体的编程工作负载里会更容易比较。假设每次请求发送 8,000 个新的输入 Token,内容包括指令和仓库上下文;接收 2,000 个 Token 的补丁及说明。按以上核验价格计算,未计入缓存时,100 次调用成本介于$0.168 和 $1.56之间。
| 模型 | 100 次调用成本 | 计算公式 |
|---|---|---|
| DeepSeek V4 Flash | $0.168 | 100 × (0.008 × $0.14 + 0.002 × $0.28) |
| MiniMax M3 | $0.48 | 100 × (0.008 × $0.30 + 0.002 × $1.20) |
| GPT-5.4 mini | $1.50 | 100 × (0.008 × $0.75 + 0.002 × $4.50) |
| Kimi K2.7 Code | $1.56 | 100 × (0.008 × $0.95 + 0.002 × $4.00) |
如果验收检查不够严,一次失败后的重试就可能抹平单次调用的价差;一个进入代码审查甚至生产环境的错误补丁,其代价远高于任意一次 API 调用。
仓库 Agent 可以复用稳定的提示词和代码前缀。官方缓存输入价格分别为:DeepSeek V4 Flash $0.0028/M、MiniMax M3 $0.06/M、Kimi K2.7 Code $0.19/M,以及GPT-5.4 mini $0.075/M;发生变化的文件和工具轨迹仍按新输入计费。
聊天、分类等非编程任务对能力下限的要求不同;更广泛的标准价格可参考这份最便宜 LLM API 对比。
“Groq 和 Cerebras 的推理速度非常快,但并发量达到中等规模后,限流会很严重。”——一位开发者在 r/ArtificialInteligence 上的报告
这条反馈应当被当作一个测试案例,而不是针对服务商整体的结论:请用计划运行的并发工作线程数,实测入选 API 的表现。
不同编程工作流,该选哪款低价模型
最便宜的编程 LLM API 取决于你如何捕获失败。若每个补丁都会经过确定性检查,DeepSeek 是成本最低的默认选择;而在本次样本中,若模型需要自行覆盖边界条件,Kimi 是更稳妥的选择。
| 工作流 | 推荐 | 原因 | 不适合的情况 |
|---|---|---|---|
| 带测试和类型检查的原型开发 | DeepSeek V4 Flash | $0.14/$0.28,且最终实现正确 | 自动化流程可能不经审查就应用第一个代码块 |
| 无人值守的编程 Agent 循环 | Kimi K2.7 Code | 本次样本中实现和测试选择最完整 | 延迟或最低 Token 账单是硬约束 |
| 交互式编辑器操作 | GPT-5.4 mini | 13.6s,本轮远快于另外三款 | 希望生成的测试覆盖每一项已声明的不变量 |
| 大上下文预算型任务 | MiniMax M3 | 在永久折扣下,512K 以内为 $0.30/$1.20 | 任务核心是严格的并发/错误语义 |
我不会仅因为某个小型通用聊天模型的输出价格是 $0.08/M,就拿它来做编程任务。便宜的编程 API,前提是它能生成能通过你工作流中检查的补丁。如果没有自动化检查,就应优先看模型首轮回答的完整性,而不是最低的标价。
比起固定用一个模型,低价优先再升级更合理
双层路由能利用最低 Token 价格,又不必盲目信任低价模型。模型选择应由确定性检查结果决定,而不是提示词长度或主观置信度评分。
- 首次尝试发送给 DeepSeek V4 Flash。
- 运行仓库的格式化工具、类型检查器、单元测试,以及任何任务专用的隐藏测试。
- 全部检查通过后,再接受该补丁。
- 若失败,将原始任务、失败补丁和精简的测试输出发送给 Kimi K2.7 Code;如果交互延迟更重要,则改用 GPT-5.4 mini。
- 限制升级尝试次数,避免 Agent 在单个问题上无限消耗费用。
这条路线让简单任务保留 DeepSeek 的亚美分成本,只在已测得的失败场景中支付更高价格。通过一个 OpenAI 兼容的模型层,切换只需改模型名,无须维护四套独立集成;AIReiter LLM API directory 通过一个端点提供这些模型。
常见问题
最便宜的编程 LLM API 是什么?
本次测试中,DeepSeek V4 Flash 是价格最低的具备编程能力 API,输入为 $0.14/M,输出为 $0.28/M。它最终生成了正确实现,但回答中也包含一份有问题的废弃草稿,因此应配合自动化检查使用。
DeepSeek 够不够用于编程 Agent?
如果 Agent 接受补丁前必须通过测试、类型检查和格式化,DeepSeek V4 Flash 足以作为低成本的首次尝试。对于缺少强检查的无人值守任务,在这次单任务样本中,Kimi K2.7 Code 给出了更完整的回答。
API 按量付费和编程订阅,哪个更便宜?
应根据实测输入和输出 Token,按表中的费率计算每月 API 成本,再与订阅价格、请求上限,以及是否包含 API 或 Agent 访问权限进行比较。两种计费模式没有天然谁更便宜。
一句话路由建议
编程任务先用DeepSeek V4 Flash,只接受通过确定性检查的补丁;失败后升级至Kimi K2.7 Code,对延迟敏感的工作则用GPT-5.4 mini。价格已经核验;质量排序仅来自一项受限任务,仍应在你自己的仓库中重新测试。
