AIREITER

GLM-5.3 深度解析:跑分、价格与 Z.ai 新模型的使用方式

最后更新: 2026-08-17 07:45:10

没有换底座模型,GLM-5.3 却把 GLM-5.2 在 DeepSWE 上的成绩从 46.2 拉升到了 66.9。Z.ai 这次的核心叙事很明确:基于同一个 753B 参数底座,只靠后训练,就将其推向接近前沿的编程模型水平。不过,发布三天后仍有两个现实限制:按 token 计费的 API 尚未上线,而这款定位为“开放权重”的模型,权重也因两周安全审查而暂缓公开。

GLM-5.3 到底是什么模型

GLM-5.3 是 Z.ai 面向长周期软件工程和智能体任务推出的最新旗舰模型,发布于 2026 年 8 月 14 日。官方模型文档确认了本次发布最特别的一点:GLM-5.3 与 GLM-5.2 使用同一套基础模型,所有提升均来自后训练。训练内容聚焦真实工程工作流,覆盖从发现问题、实施开发、验证到交付的完整任务闭环。

因此,GLM-5.3 更像是 GLM-5.2 的同源强化版本,而非采用新架构的后继模型。GLM-5.2 于 2026 年 6 月中旬发布,是一款 753B 参数的 Mixture-of-Experts 模型,采用 MIT 许可证;正如TechTimes 在发布时所报道的那样,其权重自 6 月 17 日起已登陆 Hugging Face。

规格GLM-5.3GLM-5.2
基础模型同一套 753B MoE(据 Z.ai 说明)753B MoE,MIT 许可证
上下文窗口100 万 token100 万 token
最大输出128K token128K token
输入 / 输出文本 / 文本文本 / 文本
工具支持Function calling、MCP、JSON 输出、上下文缓存、思考模式相同功能列表(GLM-5.2 文档)
权重尚未发布,因安全审查延期自 6 月 17 日起已在 Hugging Face 发布
当前访问方式仅限 GLM Coding Plan;API“即将推出”Coding Plan + 按 token 计费的 API

跑分提升值得关注,但尚不能当作定论

以下数字均直接来自 Z.ai 的发布文档。以 GLM-5.2 为基准,完整前后对比如下:

基准测试GLM-5.2GLM-5.3变化
Terminal-Bench 3.04.628.3+23.7
DeepSWE v1.146.266.9+20.7
Agents' Last Exam23.828.5+4.7
ExploitBench24.4%54.4%+30.0 个百分点

仅靠后训练就让 DeepSWE 提高 20.7 分,是发布当天最受讨论的主张。一篇被广泛转发的Reddit 分析将其解读为:如今最大规模的基础模型内部,或许仍蕴藏着大量尚未挖掘的能力。同一发布页面还给出 GLM-5.3 在 GDPval-AA v2 的 44 个职业类别中取得 1,769 分,并将其定位延伸至纯编程以外的任务;Z.ai 还称其编程能力“可与 Claude Fable 5 相比”。

可以认可能力提升的方向,但不宜把这些精确数字视为已经验证的结论。发布页上的数据均由厂商自行报告,没有提供评测 harness 细节或置信区间;追踪这些数据的社区跑分讨论帖也指出,独立复现结果仍未出现。目前较有参考价值的外部交叉对照,来自 r/ZaiGLM 的一份用户整理对比:GPT-5.6 Luna Max 在 DeepSWE v1.1 上为 67.2,GLM-5.3 为 66.9,仅差 0.3 分。这意味着,在智能体代码任务上,GLM-5.3 已在前沿边缘竞争,但还谈不上明显领先。若想现在对照测试,GPT-5.6 Luna已可调用;而在 5.3 API 上线前,GLM-5.2仍是该系列可通过 API 使用的旗舰模型。它不能替代 GLM-5.3 的后训练行为,但两者的基础模型相同。

为何开放权重要延后发布

据Axios 在发布日的报道,Z.ai 将 GLM-5.3 的权重暂缓约两周,以完善安全控制措施。背后的原因是模型在网络安全任务上的表现。随着长周期任务环境扩展,Z.ai 自己也表示,其网络安全能力“超出预期”。

在用于发现已知安全漏洞的 CyberGym 基准中,GLM-5.3 获得 84.5%,按 Z.ai 的对比表,领先 Mythos 5 的 83.8% 和 GPT-5.6 Sol 的 83.6%。在考察真实漏洞利用开发推理能力的 ExploitBench 上,GLM-5.3 的 54.4% 不仅超过 GLM-5.2 的 24.4% 一倍以上,但按 Axios 对结果的解读,仍落后于 Claude Fable 5 和 GPT-5.6 Sol。Z.ai 自己的文档也没有回避局限:优势主要集中在漏洞利用链条的前段,更深入的利用能力,以及完整攻防工作流仍“有待改进”。

还有两项信息可帮助理解此次延期:

  • 已发现超过 2,400 个安全问题:据 Axios 报道,Z.ai 当天上线了一个披露网站,称 GLM 系列模型已发现超过 2,400 个安全漏洞,其中逾 1,000 个属于严重或高危等级,涉及 Linux 内核、VMware 项目和 Apache 项目等目标。开源维护者可以提交代码仓库,由 GLM 进行漏洞扫描。
  • 审查期内提供受控访问:Axios 表示,Z.ai 没有直接公开权重,而是启动分级计划,在审查窗口内向部分安全合作伙伴提供受控访问。这条路径与 Coding Plan 是分开的。

权重一旦公开,Z.ai 将无法控制后续的模型修改与分发。其公告中对风险的表述很直接:“An open world cannot have only open attack surfaces.”

现在怎样使用 GLM-5.3

目前,普通用户只能通过订阅 GLM Coding Plan 使用 GLM-5.3。官方文档标注 API“即将推出”;截至 2026 年 8 月 17 日,Z.ai 的 token 定价表中尚未出现 GLM-5.3。GLM-5.2、GLM-5.1 和 GLM-5 均已列出价格,这表明 5.3 的 API 计费入口还没有启用。

官方订阅页面列出的套餐如下:

套餐标价页面显示价额度适用负载
Lite$18/月$12.60/月10,000 credits/周小型代码仓库、轻量迭代
Pro$80/月$56/月Lite 的 6× 用量日常开发、中型代码仓库
Max$168/月$117.60/月Lite 的 14× 用量中大型代码仓库、重度智能体任务

页面同时展示了较高的参考价格和较低的显示价格,但没有标明后者对应的计费条件。更稳妥的理解是:$18/$80/$168 是月度定价锚点,较低数字则是当前折扣价。配置只需一条命令:npx @z_ai/coding-helper。它可将套餐接入你选择的工具;Z.ai 列出了 20 多种受支持的智能体工具,包括 Claude Code、OpenClaw 及自家的 ZCode。Pro 及以上套餐支持 MCP 工具访问。Max 承诺可优先体验新旗舰模型,所有 Coding Plan 套餐则都会滚动接入当前旗舰。

发布背后悄然发生的套餐涨价

GLM-5.3 发布前后,Coding Plan 进行了重新定价,重度用户很快注意到了这一点。r/ZaiGLM 中一位订阅者追踪并发布了新套餐与旧版 V2 套餐的对比。请将其视为社区数据,而不是 Z.ai 官方价目表;实际操作前仍应查看自己的账户面板:

套餐旧版价格旧版 token/周新版价格新版 token/周
Pro$65~500M$80~526M
Max$144~2B$168~1.22B

“new Max gives you ~39% fewer tokens while costing ~17% more.” - u/x-primez-x, r/ZaiGLM

按照发帖者的计算,Max 套餐每 token 成本大约恶化了 1.9×:每周每美元可获得的 token 数从约 13.89M 降至约 7.26M。Pro 的冲击相对较小:额度约增加 5%,价格却提高约 23%,按同样算法,每美元可获得的 token 数约减少 14%。同一篇帖子对模型本身评价很高,但同时给出警告:

“GLM-5.3 looks awesome… but this new coding plan probably pushes me away from Z.AI for good.” - u/x-primez-x, r/ZaiGLM

再看 API 侧的参考价:待 GLM-5.3 的 token 定价公布后,GLM-5.2 可以作为该系列的价格锚点。其官方定价页面显示,GLM-5.2 每 1M 输入 token 为 $1.40,缓存输入为 $0.26,输出为 $4.40;当前缓存输入存储免费。同一讨论帖中已有评论者认为,订阅和 API 相比,按量付费的灵活性更具优势:“The flexibility is worth it when new models come out every week or two.”

该不该切换到 GLM-5.3

答案取决于你目前使用的方式:

你的情况现在切换?原因
Coding Plan Pro 订阅用户可以同样是 $80 档位,可立即使用 GLM-5.3;DeepSWE 提升来自厂商数据,建议先在自己的代码仓库中验证
Coding Plan Max 重度用户先算账相较旧版 Max,每周 token 约少 39%,价格却更高;单位成本的吞吐量可能已低于你的盈亏平衡点
按量付费 API 用户等待尚无 token 定价;每 1M token 输入/输出为 $1.40/$4.40 的 GLM-5.2,仍是唯一可按量计费的 GLM 旗舰
本地部署用户等待权重约两周审查结束前没有可运行的权重;同一 753B MoE 底座意味着需要多 GPU 服务器硬件,vLLM/SGLang 支持只是基于共用底座的预期,并非 Z.ai 的确认
依赖视觉能力的用户不建议GLM-5.3 与 GLM-5.2 一样仅支持文本输入和文本输出;视觉能力仍在独立且闭源的 GLM-5V 产品线中

最后一行尤其值得强调,因为这正是社区在发布前呼声最高的需求。Jie Tang 于 6 月 29 日发起的投票,询问 GLM-5.3 应包含哪些能力;据报道,该投票获得 466,000 次浏览,视觉能力以压倒性优势成为最高票选项,但最终发布的模型仍没有视觉编码器。如果工作流需要处理截图、PDF 或 UI 设计稿,解决方案是通过 Z.ai API 调用GLM-5V-Turbo,每 1M token 输入/输出为 $1.20/$4.00,而不是 GLM-5.3。

接下来要关注的取舍仍未消失:现在订阅可立即获得 GLM-5.3,但需要接受重新定价后的额度;等待则除了暂时无法使用外,没有额外成本。权重发布有 Z.ai 给出的审查时间线,而 API 只有“即将推出”的标注,没有价格或发布日期。如果你当前并未受限于智能体编程吞吐量,这两周的权重等待窗口并不算长。

FAQ

GLM-5.3 的权重何时发布?

Z.ai 在 8 月 14 日发布后,为安全审查将权重发布延后约两周。若时间线不变,预计将在 8 月底发布。可以关注 Hugging Face 上的 zai-org 组织;GLM-5.2 的权重就是在 6 月发布后的数日内登陆该处。

GLM-5.3 是开源模型吗?

GLM-5.3 被定位为开放权重模型,但其权重尚未发布,且发布文档没有说明许可证。GLM-5.2 使用 MIT 许可证发布,因此社区普遍猜测 GLM-5.3 也会如此;但这只是推测,并非 Z.ai 的承诺。

GLM-5.3 支持图片或视觉输入吗?

不支持。官方文档仅列出文本输入和文本输出,支持 100 万 token 上下文及 128K 最大输出。原生视觉能力仍由独立的 GLM-5V 系列提供,包括 GLM-5V-Turbo、GLM-4.6V;Z.ai 通过 API 提供这些模型,而非开放权重。

GLM-5.3 每 token 怎么收费?

目前没有按 token 计费的价格。API 状态为“即将推出”,GLM-5.3 也尚未出现在 Z.ai 的定价表中。现在唯一的访问方式是 GLM Coding Plan,标价为每月 $18/$80/$168,当前页面显示价格为 $12.60/$56/$117.60。

GLM-5.3 能在本地运行吗?

权重发布前不能。GLM-5.2 的模型卡支持 vLLM、SGLang 和 KTransformers(据 TechTimes 报道);但发布文档目前没有提及 GLM-5.3 的部署栈。因此应按多 GPU 服务器硬件来规划,而不是指望消费级设备。