AIREITER

Qwen 3.8 Max vs Kimi K3:输出更便宜,但 Kimi 编程更强(2026)

最后更新: 2026-08-06 07:46:30

同为中国 MoE 旗舰模型、同样拥有百万 token 上下文、发布时间只差三周,而且默认都以最高推理力度运行,但 Qwen 3.8 Max 和 Kimi K3 的价格却不在一个量级。Kimi K3 的代码能力更强,每百万输出 token 收费 $15;Qwen 3.8 Max 只要 $6,前者是后者的 2.5 倍。Qwen 3.8 Max 是更便宜、也更新的选择,于 2026 年 8 月 3 日正式 GA,并在图表理解和计算机操作上更有优势。需要留意的是,两款模型开箱即默认进行最大力度推理,Kimi K3 较高的输出单价会在每一次请求中持续放大;而 Qwen 的开放权重则要到约 8 月 11 日才会发布。

规格相近,真正的分歧在使用场景

Qwen 3.8 Max 与 Kimi K3 都是万亿参数级的 mixture-of-experts 模型,具备百万 token 上下文窗口和原生视觉能力,并且都在 2026 年年中前后、相隔不到三周推出。从纸面规格看,两者属于同一档位,因此很多对比最终都变成了基准分数的来回较量。真正该问的问题其实更具体:你是否愿意为了更强的编程质量承担更高的输出成本,以及你现在是否需要开放权重或更强的多模态能力。

规格Qwen 3.8 MaxKimi K3
总参数量2.4T2.8T
每 token 激活参数~95B104B
架构MoE(约 4% 激活)MoE(896 个专家中激活 16 个)
上下文窗口~1M(最大输入 991K)1,048,576
视觉能力支持(文本 + 图片输入)支持(原生)
默认推理设置xhigh,开启思考max effort,开启推理
开放权重否(预计 ~8 月 11 日)是(HF,7 月 27 日,1.56TB MXFP4)
API 状态GA,2026 年 8 月 3 日GA

来源:yottalabs 正面对比、AIReiter 转引的阿里 QwenCloud,以及 Moonshot platform.kimi.ai;核验日期为 2026 年 8 月 6 日。

定价、实际工作负载成本与接入方式

两家厂商都公开了按 token 计费的价格。和总参数量给人的直觉不同,真正拉开差距的是输出 token,而这恰恰是推理模型最主要的成本项。Kimi K3 每百万输出 token 收费 $15,Qwen 3.8 Max 为 $6。两者默认都会展示思考过程,因此输出单价不仅覆盖最终回答,也覆盖推理轨迹。

每 1M token 价格Qwen 3.8 MaxKimi K3
输入(缓存未命中)$2.00$3.00
输入(缓存命中)$0.25$0.30
输出(含思考)$6.00$15.00
上下文~1M1,048,576

来源:阿里 QwenCloud 模型页面(更新于 2026 年 8 月 2 日)和 Moonshot platform.kimi.ai/docs/pricing/chat-k3;核验日期为 2026 年 8 月 6 日。

Moonshot 平台上的 Kimi K3 官方 API 定价:缓存未命中输入每百万 token $3.00,缓存读取 $0.30,输出 $15.00,上下文为 1,048,576 token

以一个典型编程工作负载计算:输入 20M token,缓存命中率 60%,输出 5M token。Kimi K3 的费用约为 $103,其中输入 $27.60、输出 $75;Qwen 3.8 Max 则约为 $49,输入 $19、输出 $30。约 2 倍的差距几乎全部来自输出端:缓存可以缩小输入成本的差异,却无法降低输出价格;而两款模型又都默认以最高推理力度工作,输出占比自然很大。

两者的接入情况并不对称。Qwen 3.8 Max 已于 2026 年 8 月 3 日在阿里 API 上正式 GA,但权重尚未公开;模型页面仍标注 Open Source: No,预计会在 8 月 11 日当周登陆 Hugging Face 和 ModelScope(阿里信息,经 Qwen 3.8 Max 定价页面转引)。Kimi K3 则是开放选项:Moonshot 已在 7 月 27 日发布 1.56 TB 的 MXFP4 checkpoint,API 也已上线。

Kimi K3 还可以通过 AIReiter 的 Kimi K3 API endpoint 接入,价格与 Moonshot 官方费率一致,不加价;如果你想在同一份账单下测试 K3 和其他模型,这会比较方便。Qwen 3.8 Max 目前尚未接入该平台。

Kimi K3 的优势:智能体编程

如果任务是多步骤编程,例如智能体循环、代码仓库重构,或需要调用工具并从失败路径中恢复的 SWE 类任务,Kimi K3 是更合适的选择。在公开的智能体基准中,它都能稳定领先 Qwen 3.8 Max,且在最接近真实工程工作的任务上差距最明显。

正面对比基准:Kimi K3 在 TerminalBench 2.1、FrontierSWE 和带工具的 CharXiv 上领先;Qwen 3.8 Max 在不带工具的 CharXiv 和 PerceptionBench 上领先
基准测试Qwen 3.8 MaxKimi K3
FrontierSWE73.581.2
TerminalBench 2.186.688.3
CharXiv(带工具)88.491.3

来源:yottalabs 正面对比;核验日期为 2026 年 8 月 6 日。

社区评价也大体印证了这些数字,只是成本问题始终绕不开:

“K3 强得离谱。Qwen 3.8 和它已经很接近了。不过按现在的情况,这两个模型的订阅或 API 成本都很难说划算……” — r/Qwen_AI

“在这个练习里,K3 对 Qwen 3.8 是碾压级领先;不过 Qwen 生成这个落地页的速度比 Kimi 快了 3 倍。” — X 上的 @filicroval

Kimi K3 的原始智能分数也更高,Artificial Analysis Intelligence Index 为 57,但速度偏慢:输出速度约为每秒 39 个 token,首 token 时间为 3.1 秒(Artificial Analysis)。换来的,是更高质量和开放权重;付出的代价则是延迟与成本。

Qwen 3.8 Max 的优势:多模态与性价比

如果你的工作负载偏重图表、截图阅读或浏览器驱动,又或者输出成本比压榨编程基准的最后几分更重要,Qwen 3.8 Max 更值得选。它在文档和感知类基准上胜过 Kimi K3,在一项计算机操作基准中保持经过验证的 SOTA,同时输出单价只有 Kimi K3 的 40%。

基准测试Qwen 3.8 MaxKimi K3
CharXiv(不带工具)93.584.8
PerceptionBench63.558.5
OSWorld-Verified86.1%(SOTA)无公开分数

来源:yottalabs 正面对比;核验日期为 2026 年 8 月 6 日。

Qwen 3.8 Max 的短板,正好是 Kimi K3 最强、也最接近前沿闭源模型的领域。在 SWE-bench Pro 上,它得到 67.7,明显落后于 Claude Fable 5 的 80(阿里公布的表格,由厂商自行测试),因此它并不是应对最困难软件工程评测的首选。写作时,它的 API 上线也仅三天,正式 GA 日期为 2026 年 8 月 3 日;权重依然闭源(接入详情见上文)。现在就需要自行部署的用户,只能等待或改选 Kimi K3。

按工作负载选择

该选哪款,更多取决于你拿它做什么,而非谁在绝对意义上“更强”。下表将常见工作负载对应到推荐模型,以及背后已经核实的依据。

你的工作负载是……推荐原因
智能体循环、仓库重构、SWE 任务(成本不是限制)Kimi K3FrontierSWE 81.2 vs 73.5,TerminalBench 88.3 vs 86.6
文档/图表解析、浏览器或计算机操作,对成本敏感Qwen 3.8 MaxCharXiv 93.5,OSWorld 86.1% SOTA,输出 $6 vs $15
今天就要自行部署Kimi K3权重自 7 月 27 日起已在 HF 提供;Qwen 预计约 8 月 11 日发布

常见问题

Qwen 3.8 Max 编程能力比 Kimi K3 强吗?

不强。Kimi K3 在关键的智能体编程基准中领先,包括 FrontierSWE 的 81.2 对 73.5,以及 TerminalBench 2.1 的 88.3 对 86.6。因此面对多步骤工程任务,Kimi K3 是更强的选择。

Qwen 3.8 Max 和 Kimi K3,哪个更便宜?

Qwen 3.8 Max。它每百万输出 token 收费 $6,而 Kimi K3 为 $15;输入价格则是 $2 对 $3,缓存命中价格接近。在典型编程工作负载下,整体成本大约相差 2 倍。

在最高推理力度下做智能体编程,哪个更便宜?

依然是 Qwen 3.8 Max。两款模型都会将最高力度推理产生的 token 按输出计费,因此在 Kimi K3 擅长的编程工作负载中,其 $15/M 的费率会让成本差距进一步扩大。

两款模型都支持百万 token 上下文吗?

支持。Qwen 3.8 Max 可接收约 991K 输入 token,开启思考时会更少;Kimi K3 为 1,048,576。两者名义上都属于百万 token 上下文窗口。

两款模型的权重都开放了吗?

Kimi K3 已开放。Moonshot 于 2026 年 7 月 27 日发布了 1.56 TB MXFP4 checkpoint。Qwen 3.8 Max 尚未开放;阿里将其列为闭源,预计在 8 月 11 日当周于 Hugging Face 和 ModelScope 发布。

延伸阅读