最佳开源编码 LLM:我们的测试中成本差距达 48 倍

最后更新: 2026-07-17 10:10:28

简短回答:GLM-5.2 目前是最强的开源 LLM,用于编码时——在长时间使用中,其输出质量接近 Claude Sonnet 级别,而且也是我们会拿来处理最难问题的模型。它也很慢且很吃 token,所以如果是追求快速的 API 编码代理,选择 Kimi K2.7 Code;如果追求最低成本,选择 DeepSeek V4 Flash;如果你自己的 24GB GPU,则选择 Qwen3.6-27B

这是将相同的两个编码任务交给五个开源旗舰模型,并以 Claude Opus 4.8 作为闭源参考后得出的结论。它们都生成了正确的代码。真正拉开差距的是它们为此消耗了多少 token,而这方面的差异在成本上最大可达 48 倍。

关于措辞说明:这些模型几乎全部从技术上来说都是 open-weight 模型:权重是免费的,但训练数据不是。我们之所以说“开源”,是因为这是大家搜索的词。这个区别只会影响下面一个 FAQ 答案。

我们如何测试

两个任务,每个模型使用相同提示,于 2026 年 7 月 17 日在默认设置下发送:

  • 任务 1:编写一个持续时间解析函数,处理棘手的边界情况(12 个测试用例)
  • 任务 2:修复一个有 bug 的区间合并函数(6 个测试用例)

我们在本地对代码进行了评分,并为每次运行记录了三个数值:通过率、输出 token 数量和墙钟时间。成本是 token 数量乘以各供应商的标价,我们在当天进行了核实。两个任务只是一次探测,而不是基准测试,但这类常规请求你会发送数百次。

结果

每个模型都通过了每个测试用例。因此,下面的表格只关注一件事:效率:

模型输出 tokens(两个任务)任务 1 时间成本
Kimi K2.7 Code2,18345.2s$0.0090
DeepSeek V4 Flash2,23116.7s$0.00066
DeepSeek V4 Pro2,52737.3s$0.0023
MiniMax M35,40936.7s$0.0067
GLM-5.27,13099.3s$0.0318
Claude Opus 4.8 (baseline)5398.1s
Output tokens used by each model to solve the same two coding tasks

token 列就是故事的核心。GLM-5.2 和 MiniMax M3 是“思考”模型:默认情况下,它们在回答前会进行长时间推理。这些推理会按输出计费。对于同样正确的函数,GLM-5.2 生成的 token 数是 Kimi K2.7 Code 的 3 倍。

当 token 上限受限时,情况会更糟。我们将响应限制为 2,048 个 token 时,这两个思考型模型都把全部预算花在推理上,结果完全没有返回代码。你付了钱,却什么也得不到。GLM-5.2 需要把上限提高到 16,384 个 token 才能完成,而且它那两次失败的尝试本身就花了大约 0.045 美元。如果你在编码 agent 中使用思考型模型,请提高 max_tokens,或者在常规编辑时关闭 thinking。

Cost to complete both test tasks at official API prices

作为对比,Claude Opus 4.8 仅用 539 个 token 就完成了这两项任务。开源模型在正确性上已经追上;但在简洁性方面,闭源基线仍然领先 4 倍。

按部署层级划分的最佳开源编码模型

按模型将运行的位置选择。价格按每 100 万 tokens 计,已于 2026-07-17 核实。

如果你能等得起的话,最强模型:GLM-5.2

在高难度、多步骤的编码工作中,GLM-5.2 的输出质量是当前开源模型中最接近 Claude 级别的——它在 agentic 基准测试(SWE-Bench Pro、Terminal-Bench 2.1)中领先,而且在我们自己的长期使用中,它是我们会放心交给那些其他模型处理不好的问题的那个。更多内容请见我们的 GLM-5.2 API 指南

这种质量的代价是耐心。它是我们测试中最慢、最“吃资源”的模型(Task 1 上耗时 99.3 秒,消耗 5,695 个 token),而且缓慢的服务表现更多反映的是供应商一侧受限的 GPU 容量,而非模型本身。输入 $1.40 / 输出 $4.40,1M 上下文,标准 MIT 许可。把难题和充足的 token 预算交给它;快速修改则交给别处。

最适合快速 API 编码代理:Kimi K2.7 Code

我们测试过的最省 token 的开源模型:它的 bug 修复只用了 259 个 token,简洁程度类似 Claude。它还以 60.7% 领先于 Kilo 的任务完成基准

价格:输入 $0.95 / 输出 $4.00,缓存命中时 $0.19。唯一真正的限制是上下文:262K tokens,而本列表中的其他产品提供 1M。关于它与最接近的竞争对手相比表现如何,请参见 Kimi K2.7 Code vs GLM-5.2

Kimi K2.7 Code official pricing page showing $0.95 input and $4.00 output per million tokens

最佳价值:DeepSeek V4 Flash

$0.14 输入 / $0.28 输出,到目前为止这里最便宜的模型,而且它仍然通过了我们抛给它的一切测试,在开源模型中速度最快。其公布的分数(79.0% SWE-Bench Verified,91.6% LiveCodeBench)与它的“大哥”只差两个百分点。上下文为 1M tokens,许可证为标准 MIT。

从这里开始。只有当多文件工作开始暴露差距时,才升级到 V4 Pro

DeepSeek official pricing docs showing V4 Flash and V4 Pro with OpenAI and Anthropic format endpoints

最适合 24GB 消费级 GPU:Qwen3.6-27B

一个稠密的 27B 模型,在 SWE-Bench Verified 上达到 77.2%,来自一个能装进一张消费级显卡的模型的接近旗舰级成绩,这也是为什么它会在那些以“I have 24GB of VRAM.”开头的 r/LocalLLaMA 讨论串里反复成为答案。

其更快的同门兄弟 Qwen3-Coder-Next(总计 80B,每个 token 仅激活 3B,Apache 2.0)是社区里的速度之选:有用户 在完整 262K 上下文下,单张 RX 9070 XT 上以约 20 tokens/s 运行它。如果你更愿意通过 API 调用,它在 Alibaba Cloud 上的起价为 $0.30/$1.50。

最佳单 GPU 自托管:Gemma 4 31B

根据 Google 的模型卡,31B 版本可在一张 80GB H100 上运行,支持 256K 上下文,采用 Apache 2.0 许可证。12B 版本可在 16GB VRAM 中运行。

一个尺寸陷阱:MoE 模型宣传较小的“active”参数量,但你仍然必须存储全部权重。DeepSeek V4 Flash 每个 token 激活 13B 参数,但总参数量为 284B,即使是 4-bit 也大约需要 142GB。这是一个多 GPU 项目,不是一张卡能搞定的。

长时间自主运行的最佳经济之选:MiniMax M3

1M 上下文,价格为 $0.30/$1.20,专为多小时 agent 会话打造——MiniMax 已展示了 12 小时无人值守的研究运行。它具有你在结果表中看到的 thinking-model 详细程度,因此请相应预留 token 预算。当在长时间运行中质量比成本更重要时,上面的 GLM-5.2 是升级之选。

排行榜不会告诉你的事

基准分数现在已经很接近了:斯坦福的 AI Index 发现,第一名和第十名模型之间的差距在一年内从 11.9% 缩小到了 5.4%。分数表仍然隐藏着三件事:

按任务计费比按 token 计费更重要。GLM-5.2 的 $4.40 输出价格看起来接近 Kimi 的 $4.00。按实际 token 数计算后,同样的任务成本要高出 3.5 倍。Kilo 的实时统计显示了极端情况:DeepSeek V4 Pro 在标价 $0.87 的情况下,每次完成基准测试尝试的平均成本为 $15.91。

同一个模型,不同的运行框架,不同的结果。 一个模型在设计良好的 agent 循环中(结构化工具、重试、合理的 token 限制)的表现,和在原始 chat 调用中的表现完全不同。我们的 GLM 零代码失败是配置交互问题,而不是能力差距。

每个基准测试衡量的任务都不同。LiveCodeBench 是算法生成;DeepSeek V4 Pro 以 93.5% 的成绩在该项中胜出,超过了闭源模型已公布的分数。SWE-Bench Verified 是仓库级 bug 修复;Claude Mythos 5 仍以 95.5% 领先,而开源模型大约在 80% 左右。在相信排名之前,请先将基准测试与你的实际工作对应起来。

更换 Claude 订阅

推动转向开源的一个常见触发点:在工作日中途碰到 Claude 的订阅限制。算下来很划算。我们的双任务探测在 DeepSeek V4 Flash 上花费了 $0.00066;每天即使调用几百次,也仍然不到一美元。

切换也比以前更少需要繁琐配置。DeepSeek 提供了一个与 Anthropic 兼容的端点(api.deepseek.com/anthropic),因此 Claude Code 只需通过修改环境变量就能调用它;同样的设置也适用于 GLM-5.2。如果你想让 Claude 处理棘手问题,同时将日常工作路由到开放模型,那么像 AIReiter 这样的平台会通过同一个与 Anthropic 兼容的接口,以标价的 20% 提供 Claude 服务。

Kimi K3:值得关注的那一款

Moonshot 于 2026 年 7 月 16 日发布了 Kimi K3,在前端工作方面,它已经超越了最强的闭源模型:在 Frontend Code 排行榜上以 1,679 分位居第 1,超过了 Claude Fable 5 的 1,631 分,早期上手报告也指向同样的方向。

它之所以没有在这里排名,原因只有一个:权重将于 7 月 27 日开放。在此之前,它是一个封闭 API,价格为 $3/$15。一旦它们发布,K3 将成为迄今为止发布的最大开源权重模型,而上面的前端数据表明,它将有望争夺这个榜单的榜首。我们正单独跟踪 K3 open-weights 发布

如何选择

1. 它将在哪里运行? 16GB VRAM 以下:使用 API(Gemma 4 12B 可本地运行,但预计质量会明显下降)。24GB:Qwen3.6-27B。一张 H100:Gemma 4 31B。API:先用 DeepSeek V4 Flash,直到证明它不够用为止。2. 什么类型的工作? 快速编辑更适合简洁模型:Kimi K2.7 Code 或 DeepSeek。棘手问题和长时间 agent 运行更适合 GLM-5.2(预算有限时可选 MiniMax M3),并分配充足的 token 预算。3. 许可证限制? MIT(GLM、DeepSeek)和 Apache 2.0(Qwen、Gemma)都没有附加条件。Kimi 的修改版 MIT 增加了署名要求,但只会在非常大规模的商业使用时才触发。

常见问题

2026 年用于编程的最佳开源 LLM 是什么?

GLM-5.2 具有最高上限——在难题上接近 Claude Sonnet 级别的输出,但代价是速度。Kimi K2.7 Code 在 API agents 的 token 效率上胜出,Qwen3.6-27B 适用于本地硬件,DeepSeek V4 Flash 则在成本上占优。

我可以免费在本地运行这些模型吗?

权重是免费的;硬件不是。一个 27B 模型需要 24GB GPU,Gemma 4 31B 需要 80GB,而万亿参数旗舰只能通过 API 或集群使用。

开源和开放权重有什么区别?

Open-weight 指的是权重开放,但训练数据和代码是私有的,这几乎适用于这里的每一个模型。完全开源的模型(OpenCoder、StarCoder2、IBM Granite Code)会公布一切,但在能力上稍逊一筹。

有没有像 Claude 一样擅长编程的开源 LLM?

在算法基准测试中,是的:DeepSeek V4 Pro 的 93.5% LiveCodeBench 超过了已公布的闭源模型得分。在仓库级修复方面,Claude 仍然领先(95.5% vs ~80% SWE-Bench Verified)。在我们的测试中,开源模型在正确性上与 Claude 持平,但使用的 token 数多出 4–13 倍。

哪个开源 LLM 最适合 C++ 或小众语言?

Kimi 的 K2 系列拥有最强的小众语言口碑(Moonshot 特别提到了 Zig)。对于 C++,社区共识更倾向于 DeepSeek V4 Pro 和 Qwen3 Coder Next。不管你选择哪个,都要在自己的代码库上测试;小众语言的质量差异远比 Python 基准测试所显示的更大。