没有换底座模型,GLM-5.3 却把 GLM-5.2 在 DeepSWE 上的成绩从 46.2 拉升到了 66.9。Z.ai 这次的核心叙事很明确:基于同一个 753B 参数底座,只靠后训练,就将其推向接近前沿的编程模型水平。不过,发布三天后仍有两个现实限制:按 token 计费的 API 尚未上线,而这款定位为“开放权重”的模型,权重也因两周安全审查而暂缓公开。
GLM-5.3 到底是什么模型
GLM-5.3 是 Z.ai 面向长周期软件工程和智能体任务推出的最新旗舰模型,发布于 2026 年 8 月 14 日。官方模型文档确认了本次发布最特别的一点:GLM-5.3 与 GLM-5.2 使用同一套基础模型,所有提升均来自后训练。训练内容聚焦真实工程工作流,覆盖从发现问题、实施开发、验证到交付的完整任务闭环。
因此,GLM-5.3 更像是 GLM-5.2 的同源强化版本,而非采用新架构的后继模型。GLM-5.2 于 2026 年 6 月中旬发布,是一款 753B 参数的 Mixture-of-Experts 模型,采用 MIT 许可证;正如TechTimes 在发布时所报道的那样,其权重自 6 月 17 日起已登陆 Hugging Face。
| 规格 | GLM-5.3 | GLM-5.2 |
|---|---|---|
| 基础模型 | 同一套 753B MoE(据 Z.ai 说明) | 753B MoE,MIT 许可证 |
| 上下文窗口 | 100 万 token | 100 万 token |
| 最大输出 | 128K token | 128K token |
| 输入 / 输出 | 文本 / 文本 | 文本 / 文本 |
| 工具支持 | Function calling、MCP、JSON 输出、上下文缓存、思考模式 | 相同功能列表(GLM-5.2 文档) |
| 权重 | 尚未发布,因安全审查延期 | 自 6 月 17 日起已在 Hugging Face 发布 |
| 当前访问方式 | 仅限 GLM Coding Plan;API“即将推出” | Coding Plan + 按 token 计费的 API |
跑分提升值得关注,但尚不能当作定论
以下数字均直接来自 Z.ai 的发布文档。以 GLM-5.2 为基准,完整前后对比如下:
| 基准测试 | GLM-5.2 | GLM-5.3 | 变化 |
|---|---|---|---|
| Terminal-Bench 3.0 | 4.6 | 28.3 | +23.7 |
| DeepSWE v1.1 | 46.2 | 66.9 | +20.7 |
| Agents' Last Exam | 23.8 | 28.5 | +4.7 |
| ExploitBench | 24.4% | 54.4% | +30.0 个百分点 |
仅靠后训练就让 DeepSWE 提高 20.7 分,是发布当天最受讨论的主张。一篇被广泛转发的Reddit 分析将其解读为:如今最大规模的基础模型内部,或许仍蕴藏着大量尚未挖掘的能力。同一发布页面还给出 GLM-5.3 在 GDPval-AA v2 的 44 个职业类别中取得 1,769 分,并将其定位延伸至纯编程以外的任务;Z.ai 还称其编程能力“可与 Claude Fable 5 相比”。
可以认可能力提升的方向,但不宜把这些精确数字视为已经验证的结论。发布页上的数据均由厂商自行报告,没有提供评测 harness 细节或置信区间;追踪这些数据的社区跑分讨论帖也指出,独立复现结果仍未出现。目前较有参考价值的外部交叉对照,来自 r/ZaiGLM 的一份用户整理对比:GPT-5.6 Luna Max 在 DeepSWE v1.1 上为 67.2,GLM-5.3 为 66.9,仅差 0.3 分。这意味着,在智能体代码任务上,GLM-5.3 已在前沿边缘竞争,但还谈不上明显领先。若想现在对照测试,GPT-5.6 Luna已可调用;而在 5.3 API 上线前,GLM-5.2仍是该系列可通过 API 使用的旗舰模型。它不能替代 GLM-5.3 的后训练行为,但两者的基础模型相同。
为何开放权重要延后发布
据Axios 在发布日的报道,Z.ai 将 GLM-5.3 的权重暂缓约两周,以完善安全控制措施。背后的原因是模型在网络安全任务上的表现。随着长周期任务环境扩展,Z.ai 自己也表示,其网络安全能力“超出预期”。
在用于发现已知安全漏洞的 CyberGym 基准中,GLM-5.3 获得 84.5%,按 Z.ai 的对比表,领先 Mythos 5 的 83.8% 和 GPT-5.6 Sol 的 83.6%。在考察真实漏洞利用开发推理能力的 ExploitBench 上,GLM-5.3 的 54.4% 不仅超过 GLM-5.2 的 24.4% 一倍以上,但按 Axios 对结果的解读,仍落后于 Claude Fable 5 和 GPT-5.6 Sol。Z.ai 自己的文档也没有回避局限:优势主要集中在漏洞利用链条的前段,更深入的利用能力,以及完整攻防工作流仍“有待改进”。
还有两项信息可帮助理解此次延期:
- 已发现超过 2,400 个安全问题:据 Axios 报道,Z.ai 当天上线了一个披露网站,称 GLM 系列模型已发现超过 2,400 个安全漏洞,其中逾 1,000 个属于严重或高危等级,涉及 Linux 内核、VMware 项目和 Apache 项目等目标。开源维护者可以提交代码仓库,由 GLM 进行漏洞扫描。
- 审查期内提供受控访问:Axios 表示,Z.ai 没有直接公开权重,而是启动分级计划,在审查窗口内向部分安全合作伙伴提供受控访问。这条路径与 Coding Plan 是分开的。
权重一旦公开,Z.ai 将无法控制后续的模型修改与分发。其公告中对风险的表述很直接:“An open world cannot have only open attack surfaces.”
现在怎样使用 GLM-5.3
目前,普通用户只能通过订阅 GLM Coding Plan 使用 GLM-5.3。官方文档标注 API“即将推出”;截至 2026 年 8 月 17 日,Z.ai 的 token 定价表中尚未出现 GLM-5.3。GLM-5.2、GLM-5.1 和 GLM-5 均已列出价格,这表明 5.3 的 API 计费入口还没有启用。
官方订阅页面列出的套餐如下:
| 套餐 | 标价 | 页面显示价 | 额度 | 适用负载 |
|---|---|---|---|---|
| Lite | $18/月 | $12.60/月 | 10,000 credits/周 | 小型代码仓库、轻量迭代 |
| Pro | $80/月 | $56/月 | Lite 的 6× 用量 | 日常开发、中型代码仓库 |
| Max | $168/月 | $117.60/月 | Lite 的 14× 用量 | 中大型代码仓库、重度智能体任务 |
页面同时展示了较高的参考价格和较低的显示价格,但没有标明后者对应的计费条件。更稳妥的理解是:$18/$80/$168 是月度定价锚点,较低数字则是当前折扣价。配置只需一条命令:npx @z_ai/coding-helper。它可将套餐接入你选择的工具;Z.ai 列出了 20 多种受支持的智能体工具,包括 Claude Code、OpenClaw 及自家的 ZCode。Pro 及以上套餐支持 MCP 工具访问。Max 承诺可优先体验新旗舰模型,所有 Coding Plan 套餐则都会滚动接入当前旗舰。
发布背后悄然发生的套餐涨价
GLM-5.3 发布前后,Coding Plan 进行了重新定价,重度用户很快注意到了这一点。r/ZaiGLM 中一位订阅者追踪并发布了新套餐与旧版 V2 套餐的对比。请将其视为社区数据,而不是 Z.ai 官方价目表;实际操作前仍应查看自己的账户面板:
| 套餐 | 旧版价格 | 旧版 token/周 | 新版价格 | 新版 token/周 |
|---|---|---|---|---|
| Pro | $65 | ~500M | $80 | ~526M |
| Max | $144 | ~2B | $168 | ~1.22B |
“new Max gives you ~39% fewer tokens while costing ~17% more.” - u/x-primez-x, r/ZaiGLM
按照发帖者的计算,Max 套餐每 token 成本大约恶化了 1.9×:每周每美元可获得的 token 数从约 13.89M 降至约 7.26M。Pro 的冲击相对较小:额度约增加 5%,价格却提高约 23%,按同样算法,每美元可获得的 token 数约减少 14%。同一篇帖子对模型本身评价很高,但同时给出警告:
“GLM-5.3 looks awesome… but this new coding plan probably pushes me away from Z.AI for good.” - u/x-primez-x, r/ZaiGLM
再看 API 侧的参考价:待 GLM-5.3 的 token 定价公布后,GLM-5.2 可以作为该系列的价格锚点。其官方定价页面显示,GLM-5.2 每 1M 输入 token 为 $1.40,缓存输入为 $0.26,输出为 $4.40;当前缓存输入存储免费。同一讨论帖中已有评论者认为,订阅和 API 相比,按量付费的灵活性更具优势:“The flexibility is worth it when new models come out every week or two.”
该不该切换到 GLM-5.3
答案取决于你目前使用的方式:
| 你的情况 | 现在切换? | 原因 |
|---|---|---|
| Coding Plan Pro 订阅用户 | 可以 | 同样是 $80 档位,可立即使用 GLM-5.3;DeepSWE 提升来自厂商数据,建议先在自己的代码仓库中验证 |
| Coding Plan Max 重度用户 | 先算账 | 相较旧版 Max,每周 token 约少 39%,价格却更高;单位成本的吞吐量可能已低于你的盈亏平衡点 |
| 按量付费 API 用户 | 等待 | 尚无 token 定价;每 1M token 输入/输出为 $1.40/$4.40 的 GLM-5.2,仍是唯一可按量计费的 GLM 旗舰 |
| 本地部署用户 | 等待权重 | 约两周审查结束前没有可运行的权重;同一 753B MoE 底座意味着需要多 GPU 服务器硬件,vLLM/SGLang 支持只是基于共用底座的预期,并非 Z.ai 的确认 |
| 依赖视觉能力的用户 | 不建议 | GLM-5.3 与 GLM-5.2 一样仅支持文本输入和文本输出;视觉能力仍在独立且闭源的 GLM-5V 产品线中 |
最后一行尤其值得强调,因为这正是社区在发布前呼声最高的需求。Jie Tang 于 6 月 29 日发起的投票,询问 GLM-5.3 应包含哪些能力;据报道,该投票获得 466,000 次浏览,视觉能力以压倒性优势成为最高票选项,但最终发布的模型仍没有视觉编码器。如果工作流需要处理截图、PDF 或 UI 设计稿,解决方案是通过 Z.ai API 调用GLM-5V-Turbo,每 1M token 输入/输出为 $1.20/$4.00,而不是 GLM-5.3。
接下来要关注的取舍仍未消失:现在订阅可立即获得 GLM-5.3,但需要接受重新定价后的额度;等待则除了暂时无法使用外,没有额外成本。权重发布有 Z.ai 给出的审查时间线,而 API 只有“即将推出”的标注,没有价格或发布日期。如果你当前并未受限于智能体编程吞吐量,这两周的权重等待窗口并不算长。
FAQ
GLM-5.3 的权重何时发布?
Z.ai 在 8 月 14 日发布后,为安全审查将权重发布延后约两周。若时间线不变,预计将在 8 月底发布。可以关注 Hugging Face 上的 zai-org 组织;GLM-5.2 的权重就是在 6 月发布后的数日内登陆该处。
GLM-5.3 是开源模型吗?
GLM-5.3 被定位为开放权重模型,但其权重尚未发布,且发布文档没有说明许可证。GLM-5.2 使用 MIT 许可证发布,因此社区普遍猜测 GLM-5.3 也会如此;但这只是推测,并非 Z.ai 的承诺。
GLM-5.3 支持图片或视觉输入吗?
不支持。官方文档仅列出文本输入和文本输出,支持 100 万 token 上下文及 128K 最大输出。原生视觉能力仍由独立的 GLM-5V 系列提供,包括 GLM-5V-Turbo、GLM-4.6V;Z.ai 通过 API 提供这些模型,而非开放权重。
GLM-5.3 每 token 怎么收费?
目前没有按 token 计费的价格。API 状态为“即将推出”,GLM-5.3 也尚未出现在 Z.ai 的定价表中。现在唯一的访问方式是 GLM Coding Plan,标价为每月 $18/$80/$168,当前页面显示价格为 $12.60/$56/$117.60。
GLM-5.3 能在本地运行吗?
权重发布前不能。GLM-5.2 的模型卡支持 vLLM、SGLang 和 KTransformers(据 TechTimes 报道);但发布文档目前没有提及 GLM-5.3 的部署栈。因此应按多 GPU 服务器硬件来规划,而不是指望消费级设备。