AIREITER

AI 图片

FLUX.2 ProGPT-Image 2Wan 2.7 Image ProGPT 4o ImageSeedream 5.0 ProSeedream V5 liteSeedream V4.5更多

AI 视频

Kling 3.0 Motion ControlSora 2 ProKling 3.0 TurboSora 2Kling 3.0Grok Imagine 1.5Veo 3.1更多

LLM

Gemini 3.6 FlashGemini 3.1 ProKimi K3Gemini 3 ProGemini 2.5 ProClaude Opus 5Claude Fable 5更多
即将推出Seedance 2.5
Super ResolutionLyric Video GeneratorGPT Image 2 1K GeneratorGPT Image 2 Product Mockup GeneratorUse GPT-5.6 Online
API 文档价格
博客更新LLM API GuideClaude API GuideKimi K3 API Guide
模板
  • AIReiter
  • 博客
  • DeepSeek V4 Flash vs GLM-5.2:实测 0731 更新

DeepSeek V4 Flash vs GLM-5.2:实测 0731 更新

最后更新: 2026-07-31 07:35:05

DeepSeek 今天悄然更新了 deepseek-v4-flash。我用四项可评分任务将它与 GLM-5.2 对比:前三项战平,第四项由 Flash 胜出,运行成本则低了 19 倍。不过,若看纸面能力,GLM-5.2 依然是分数更高的模型;它在我的第四项任务中失利,也不是答错,而是踩进了一个可以刻意规避的陷阱。

这个陷阱就是推理预算。通过我测试的端点,GLM-5.2 即使面对很短的提示词也会进行长篇推理;在一项规格要求密集的任务里,它消耗了 16,000 个输出 token,却始终没有给出答案。Flash 完成同一任务只用了 2,525 个 token。

deepseek-v4-flash 的 0731 更新到底变了什么

DeepSeek 的 API 文档目前将 deepseek-v4-flash 的模型版本标为 DeepSeek-V4-Flash-0731。调用方式没有变化,别名仍会自动解析到最新构建版本,因此现有代码不会中断,但你也不会收到模型底层已更新的提示。

DeepSeek API 文档显示模型版本 DeepSeek-V4-Flash-0731、1M 上下文长度及 384K 最大输出

该定价页面没有提供这次更新的变更日志;我在 2026-07-31 查看 DeepSeek 新闻索引时,其中也没有 2026 年 7 月的条目。这意味着,阅读任何 Flash 对比测试时,都要看清评测日期和具体变体:公开分数只代表测试当时在线的构建版本,而“Flash Base”“Flash (Reasoning)”和“Flash (Reasoning, Max Effort)”是三行不同的数据,成绩也各不相同。

同一份文档还确认了这场对比最关键的规格:1M 上下文、384K 最大输出、默认开启思考模式且可切换为非思考模式,以及 2,500 的并发限制,相比之下 Pro 为 500。目前 Responses API 仅支持 deepseek-v4-flash,deepseek-v4-pro 计划于 2026 年 8 月初上线。

四项任务逐一实测:两边实际表现如何

我在 2026-07-31 通过一个 OpenAI 兼容中转端点,向两款模型发送完全相同的提示词。思考模式保留默认设置,除非另有说明,max_tokens 均设为 8,000。结果采用机械化方式判定,不依赖主观观感:两项编程题分别运行在隐藏测试用例中,共 6 个和 8 个;JSON 题逐键验证是否符合指定 schema;检索题则只有唯一正确字符串。

任务DeepSeek V4 Flash (0731)GLM-5.2
t1 — 找出并修复区间合并的边界问题6/6 测试通过,5.0 秒,361 输出6/6 测试通过,19.0 秒,990 输出
t2 — 按 8 条规则规格实现 next_version()8/8 测试通过,29.9 秒,2,525 输出未返回答案
t3 — 严格 JSON、键名精确、禁止代码围栏通过,5.2 秒,327 输出通过,11.2 秒,826 输出
t4 — 从约 45K token 中检索并组合 3 项事实正确,5.2 秒,172 输出正确,9.7 秒,317 输出

四项中有三项可以诚实地算作平局。t1 里,两款模型都找到了同一个问题:严格的 < 无法合并相接的区间,例如 (1,4) 和 (4,5);两者给出的修复也完全相同,都是改动一个字符。严格 JSON 任务中,两者输出逐字节一致。t4 中,两者都成功结合了记录 211 中隐藏的密钥与记录 1290 中的规则,返回 quartz-mallard-90。

按任务分组的耗时柱状图,对比 DeepSeek V4 Flash 与 GLM-5.2

真正的异常项是 t2,但这里需要讲清楚,而不是急着庆祝胜利。GLM-5.2 不是给错了答案,而是根本没有作答。在 8,000 token 上限下,它将全部 8,000 token 用于推理,110 秒后返回空内容。我随后将上限提高到 16,000,以排除是我自己的限制导致问题:它消耗了 16,000 token,依然没有内容,耗时 214 秒。第三次尝试设为 24,000,301 秒后报错。Flash 则生成了一个通过全部 8 个用例的函数,其中包括必须抛出 ValueError 的 3 个用例。

有几个限制必须直说:这是单个中转端点上、每项任务 n=1 的测试,不是基准评测。这里的推理 token 被计入 completion_tokens 计费,而官方 Z.ai 端点可能采用不同的流式返回或计费方式。这份数据能支持的结论是趋势,而不是精确倍率:GLM-5.2 在每项任务上都消耗了明显更多的 token 和实际时间。

GLM-5.2 真正领先的地方

按行业真正采用的能力指标衡量,GLM-5.2 是更强的模型;若仅凭这次测试就得出“便宜的模型全面胜出”,那是错误的解读。Artificial Analysis 给出的 Intelligence Index 中,GLM-5.2 (max) 得分为 51,DeepSeek V4 Flash (Reasoning, Max Effort) 为 40,相差 11 分。模型规模也明显不同:GLM-5.2 总参数 753B、激活参数约 40B;Flash 则为总参数 284B、激活参数 13B。

Z.ai 公布的 GLM-5.2 成绩也符合旗舰模型定位:SWE-bench Pro 为 62.1%,Terminal-Bench 2.1 为 81.0,AIME 2026 为 99.2%,GPQA Diamond 为 91.2%,使用工具的 HLE 为 54.7%。这些均为厂商自行报告的数据,而 Flash 在其中大多数项目没有可直接比较的成绩。

这恰恰是基准测试层面最诚实的结论:两款模型几乎没有共享评测。模型追踪网站 benchlm 虽然将两者并列比较,却拒绝判定胜负,原因是它们没有任何可一对一比较的项目。Flash 的公开数据来自基础模型评测集,例如 MMLU 88.7%、HumanEval 69.5%、GSM8K 90.8%;GLM-5.2 的数据则来自智能体编程评测集。

知识能力是两者唯一存在重叠的类别,benchlm 在这里给出 GLM-5.2 领先,59.6 对 56.4。如果两个对比页面对这组型号得出了不同结论,通常是因为它们拿不同变体跑了不同评测集。应当相信的,是模型变体和测试日期都与你计划调用的版本一致的数字。

实践者对两者差异的描述,也与我的测量结果一致。来自 r/opencodeCLI 一个使用两款模型执行相同任务的讨论帖:

GLM 5.2 在任何事情上都会用力推理。V4 会根据任务调整,简单修复几乎不做铺垫;但只要任务不再是极其简单的那种,GLM 5.2 就会领先……

这句话概括了核心取舍:面对困难问题,GLM-5.2 的推理能力是优势;面对简单问题,它则可能只是额外开销。

实际成本差距,比价目表显示的更大

先看标价。以下价格均已于 2026-07-31 在厂商官方页面核实。

每 1M tokenDeepSeek V4 FlashGLM-5.2GLM 倍数
输入(缓存未命中)$0.14$1.4010.0x
输入(缓存命中)$0.0028$0.2692.9x
输出$0.28$4.4015.7x
最大输出384K128K—
DeepSeek API 文档定价行:缓存命中 $0.0028、缓存未命中 $0.14、输出每 1M token $0.28 Z.ai 定价表显示 GLM-5.2 每 1M token 输入 $1.4、缓存输入 $0.26、输出 $4.4

再将这些费率代入两款模型在四项任务中实际消耗的 token,差距会超过输出单价的 15.7 倍。原因很简单:价格更高的模型,输出也更多。

任务Flash 输入→输出Flash 成本GLM-5.2 输入→输出GLM-5.2 成本倍数
t1 修复 bug165→361$0.000124170→990$0.00459437.0x
t2 实现功能182→2,525$0.000732196→16,000$0.07067496.5x
t3 严格 JSON171→327$0.000116177→826$0.00388233.5x
t4 长上下文45,225→172$0.00638044,164→317$0.0632249.9x
全部四项45,743→3,385$0.00735244,707→18,133$0.14237519.4x

所有提示词均以冷缓存发送,因此全部输入都按缓存未命中费率计费;用上表的 token 数据乘以前一张表的价格,即可复算任意一项结果。

GLM-5.2 成本除以 DeepSeek V4 Flash 成本的按任务柱状图,范围为 9.9x 至 96.5x

t4 的差距最小,为 9.9 倍。对于输入占比很高的工作负载,10 倍的输入价格差会成为主导因素,输出冗长的影响则会减弱;这是 GLM-5.2 溢价最容易被控制住的一类场景。

DeepSeek 的定价页面写明,API“即将采用峰谷定价政策”:北京时间(UTC+8)09:00–12:00 和 14:00–18:00 的所有计费项目均为 2x,生效日期尚待公告。这会让 Flash 在亚洲工作时间的输出价格优势缩小至约 5 倍。另一方面,Flash 的缓存命中输入价格为 $0.0028,较 GLM-5.2 的 $0.26 低 93 倍,因此反复使用大型稳定前缀时,差距反而会进一步扩大。若使用场景专门是编程,Z.ai 的 Coding Plan 起价为 $18/月,包含 GLM-5.2,且非高峰时段用量半价;这与上面的按 token 计费是不同账单。

按工作负载选模型

工作负载建议调用原因
高频、简单到中等难度的代码修改V4 Flash在我的 t1 中答案与 GLM-5.2 相同,速度快 3.8 倍,成本低 37 倍
大规模严格格式 / 结构化输出V4 Flash结果逐字节相同,成本仅为 1/34
大型文档的长上下文检索V4 Flash答案同样正确;虽然成本差距最小,仍有 9.9 倍
困难的智能体任务或多文件编程GLM-5.2Intelligence Index 为 51 对 40,而且它的高分主要出现在智能体评测集
任何 max_tokens 很紧的任务V4 Flash在我的 t2 中,GLM-5.2 在 8K 和 16K 上限下都没有返回内容
单次调用需要超过 128K token 输出V4 Flash最大输出 384K,而 GLM-5.2 为 128K

这更适合作为待验证的成本路由默认策略,而不是定论,因为它基于一次四任务测试:优先路由到 Flash;只有当错误答案的代价超过 19 倍 token 支出时,再升级到 GLM-5.2。如果要运行 GLM-5.2,应给它足够的输出空间,因为对 Flash 已经相当宽松的上限,可能让 GLM-5.2 产生一次收费但无答案的调用。

还有一点,这次对比无法下定论:0731 在今天上线后,尚未出现第三方对 Flash 的重新评分。因此,51 对 40 的差距描述的是 4 月版本。当前两者实际能力距离尚未测量;想知道它在你的工作负载下有多大,只能亲自针对两个别名运行评测。

常见问题

DeepSeek V4 Flash 0731 是新模型还是更新?

这是现有模型的一次更新,不是新模型。DeepSeek 文档将版本标为 DeepSeek-V4-Flash-0731,并说明调用方式不变,因此 deepseek-v4-flash 会继续自动解析到最新构建版本,你无需修改代码。

DeepSeek V4 Flash 打败 GLM-5.2 了吗?

若看能力,没有:Artificial Analysis 给 GLM-5.2 (max) 的评分是 51,而 DeepSeek V4 Flash (Reasoning, Max Effort) 是 40。若看每个已解决任务的成本,Flash 胜出:四项评分任务中三项打平,总成本低 19.4 倍。

GLM-5.3 已经发布了吗?

截至 2026-07-31,尚未发布:GLM-5.2 仍是 Z.ai 官方定价表和 Coding Plan 模型列表中最新的条目,两者都没有 5.3 这一行。

处理 1M-token 上下文任务,哪款更便宜?

DeepSeek V4 Flash。缓存未命中输入便宜 10 倍,缓存命中输入便宜 93 倍。我的约 45K-token 检索任务中,Flash 成本为 $0.006380,而 GLM-5.2 为 $0.063224。

两者都能在 Claude Code 中使用吗?

可以。两家厂商都提供 Anthropic 格式兼容端点。DeepSeek 在其 OpenAI 格式基础 URL 之外,还列出了 https://api.deepseek.com/anthropic;Z.ai 的 Claude Code 指南则要求将 ANTHROPIC_BASE_URL 设为 https://api.z.ai/api/anthropic,并将 Sonnet 和 Opus 槽位映射到 glm-5.2[1m]。

延伸阅读

  • DeepSeek V4 Flash vs DeepSeek V4 Pro
  • GLM-5.2 API

来源

  • DeepSeek Models & Pricing — 0731 版本说明、价格、峰谷定价政策,核实日期:2026-07-31
  • Z.ai pricing — GLM-5.2 费率,核实日期:2026-07-31
  • Z.ai Coding Plan — 订阅档位及 GLM-5.2 覆盖范围,核实日期:2026-07-31
  • Z.ai: Claude Code setup — Anthropic 兼容基础 URL 与模型映射
  • DeepSeek news index — 于 2026-07-31 检查,无 2026 年 7 月条目
  • Artificial Analysis: GLM-5.2 vs DeepSeek V4 Flash — Intelligence Index、参数规模
  • benchlm: DeepSeek V4 Flash Base vs GLM-5.2 — 共享基准覆盖情况、知识得分
  • r/opencodeCLI: DeepSeek V4 vs GLM 5.2 for coding — 实践者报告

>_AIReiter 模型目录

快速访问与本指南相关的模型 API

Kimi K3

Chat

用于编码、写作、分析和智能体工作流的长上下文推理模型。

moonshot获取 API Key >

Gemini 3.6 Flash

Chat

一款用于高级推理、编程和智能体任务的快速 Gemini 模型。

Google获取 API Key >

Claude Fable 5

Chat

一款用于深度推理和复杂长篇任务的高级 Claude 模型。

Anthropic获取 API Key >

Claude Opus 4.8

Chat

一款高能力的 Claude 模型,适用于高要求的推理和专业工作。

Anthropic获取 API Key >

Claude Opus 5

Chat

面向复杂推理、编程和长上下文专业工作的高端 Claude 模型。

anthropic获取 API Key >

最新文章

GPT-5.6 降价后:Luna 和 Terra 的实际成本

2026-07-31

Invalid API Key:修复前先判断 401 和 403 的真正原因

2026-07-31

解决 OpenRouter 429:服务商错误还是触发限流?

2026-07-31

B2B 广告情报只能从 HTML 挖:如何写一个扛得住改版的解析器

2026-07-31
AIREITER

有问题?请联系我们
[email protected]

LLM

Gemini 3.6 FlashGemini 3.1 ProKimi K3Gemini 3 ProGemini 2.5 Pro

AI 视频

Kling 3.0 Motion ControlSora 2 ProKling 3.0 TurboSora 2Kling 3.0

AI 图片

FLUX.2 ProGPT-Image 2Wan 2.7 Image ProGPT 4o ImageSeedream 5.0 Pro

博客

查看全部 →

公司

隐私政策服务条款退款政策

© 2026 AIReiter。保留所有权利。