AIREITER

GLM-5.3 硬件要求(2026):GPU、显存与内存

最后更新: 2026-08-29 19:18:13

想知道 GLM-5.3 能不能装进一张桌面显卡?答案很直接:不能。在线旗舰检查点需要服务器级显存。GLM-5.3-Flash 的门槛相对低一些,但依旧是大型多 GPU 模型;能加载一个量化检查点,不等于能流畅运行响应迅速的编程智能体。

先看结论:不同目标需要什么硬件

完整 GLM-5.3 的文档明确给出了 8 GPU FP8 拓扑,而完整的 100 万 token 上下文目标则对应 8× B200。即使稀疏 MoE 路由每个 token 只激活部分参数,24 GB、64 GB、128 GB 或 192 GB 的机器也不适合承载完整模型。

目标公开依据依据类型实际选择
GLM-5.3 原生 FP8官方 vLLM 配方指定 8× H200 或 H20官方拓扑适合服务器级或专业工作站部署。
GLM-5.3 BF16独立 BF16 检查点;vLLM 配方注明需多节点服务官方部署说明仅适合评测或高端生产环境。
GLM-5.3 NVFP4官方 vLLM 配方列出 Inferact/GLM-5.3-NVFP4,这是约 465 GB 的 Blackwell 检查点被官方配方列出的社区检查点面向 Blackwell 的实验或服务方案。
GLM-5.3 量化版一份社区 2-bit GGUF 报告使用了约 281 GB 的文件社区封装,并非 Z.ai 官方尺寸数据可以做 offload 实验,不是常规桌面安装方案。
GLM-5.3-Flash已验证配置使用 2× RTX PRO 6000 Blackwell 96GB,以及 175.6 GB 的 4-bpw 检查点社区验证更现实的本地 GLM 选择,但仍需多 GPU。

在线的 Hugging Face 模型卡显示,模型总参数量为 753,329,940,480,其中 FP8 参数为 751,226,191,872,safetensors 文件总大小为 755,643,409,571 字节。vLLM 配方则将其概括为约 743B 总参数、39B 激活参数。这些四舍五入后的数字略有差异,但不会改变硬件结论。

仅计算权重时需要多少显存

下列数字只是算术估算,尚未计入 KV 缓存、激活值、运行时缓冲区和分配器开销。FP8 与 BF16 按在线旗舰版约 753B 参数的规模估算;NVFP4 和 2-bit 则对应特定实现。

表示精度权重原始内存占用约值实际含义
FP8约 753 GB与原生 FP8 的 8 GPU 级部署方案相符。
BF16约 1.5 TB还未算服务开销,就已需要多节点级内存。
NVFP4官方配方列出的社区检查点约 465 GB官方配方中的 Blackwell 专用路径,不是默认 Z.ai 检查点。
2-bit社区构建版本也要数百 GB适用于 offload 或大内存实验,不可能部署在 24 GB 显卡上。

预发布阶段的硬件建议,现在该怎么更新

GLM-5.3 仓库现已上线,提供原生 FP8 文件。检查点元数据以在线模型卡为准,拓扑和启动参数应参考官方 vLLM 配方,实测部署体验则可以参考社区报告;当前配方标注的上下文窗口为 1,048,576 token。

别盯着参数量,先按内存预算选方案

对 GLM-5.3 而言,第一道门槛是权重所需内存,第二道才是上下文内存。激活参数量较低可以减轻计算负担,却不能免去存储路由专家和运行时缓冲区的需求。

24–64 GB:不要规划完整的本地 GLM-5.3

单张 RTX 4090、RTX 5090 或其他 24 GB 级显卡,无法容纳旗舰版原生 FP8 检查点。在线 Hugging Face 仓库中的 safetensors 文件约为 756 GB。即使换成 64 GB 工作站显卡,距离权重体积仍相差很远。

CPU offload 或许能让量化实验加载起来,但它更适合调试,而不是交互式编程服务的默认方案。智能体还需要以可接受的速度完成一轮又一轮工具调用。

128–192 GB:旗舰版依然不行,Flash 只适合特定配置

128 GB 或 192 GB 统一内存机器依然达不到旗舰版原生 FP8 的要求。Flash 则有一条明确路径:公开的验证配置可在 2× RTX PRO 6000 Blackwell 96GB GPU 上运行固定版本的 EXL3/TR3 4-bpw 检查点。

这套配置使用 175.6 GB 检查点数据、约 220 GB 可用存储空间、PCIe 点对点通信和固定运行时环境。其报告的单请求上限为 262,144 token,但这是双独立 GPU 部署,并不等于拥有 192 GB 普通系统内存。该精确 Flash 配置还报告了 171.7 tokens per second 的解码速度,以及 0.059 seconds 的中位首 token 时间。

2–4 张大显存 GPU:可以研究 Flash,不要期待旗舰版

如果有两张或四张大显存显卡,Flash 是第一个值得评估的方向。实际内存预算会随精度、运行时、上下文长度、批处理和图像输入而变化。已验证的双 GPU 配置支持文本、结构化工具和语义图像输入;视频功能被禁用,端点未内置认证,并且随附的视觉模板需要可逆修复后才能进行多模态验证。这些细节仅适用于该固定配方,不代表所有 Flash 构建版本,更不代表旗舰版。

8× H200 或 H20:官方记录的 FP8 旗舰拓扑

官方 vLLM 配方将 8 张 H200 或 H20 定为原生 FP8 的标准拓扑。该配置采用 8 路张量并行、FP8 KV 缓存、5 token 多 token 预测、自动工具选择,以及 GLM 专用的推理与工具调用解析器。

这是已文档化的硬件拓扑,不是对某个固定 tokens-per-second 数值的承诺。实际吞吐量取决于互连方式、上下文长度、批大小、并发序列数和服务构建版本;vLLM 页面给出了配置,但没有提供生产吞吐实测数据。

8× B200:只有需要 100 万上下文时才考虑

官方配方将 8 张 B200 用于完整的 1,048,576-token 上下文配置。更长上下文本质上是显存问题:KV 缓存会随活跃序列和上下文长度增长,因此能在 32K 或 128K token 下运行的部署,不一定能在相同并发度下支持 100 万 token。

建议从较小的 --max-model-len 值开始,测量 KV 缓存占用后再逐步提高。宣传中的超大上下文窗口对于长代码仓库和文档很有价值,但不意味着每次请求都经济,或都能获得低延迟。

官方配方没有给出的主机要求

vLLM 配方给出了 GPU 拓扑和启动参数,但没有公布通用的系统内存、功耗、散热、存储余量或网络要求。这些数值会随检查点、运行时、目标上下文长度和云服务平台而变化。

主机项目现有证据能够支持的结论
模型存储在线旗舰仓库报告 safetensors 文件为 7556 亿字节;还应为缓存和临时分片预留额外空间。
GPU 互连配方要求 8 路张量并行;应核实租用节点或服务器平台的实际拓扑,不要想当然地按纯 PCIe 性能估计。
系统内存vLLM 配方未发布统一的官方数值。不能拿系统内存容量替代所需 GPU 显存。
功耗与散热没有统一的官方数值。购买硬件前,应以平台的 8 GPU 电气和散热规格为准。
软件官方配方展示了 vLLM 0.28.0 或更高版本,以及 Transformers 5.15.0 或更高版本;FP8 性能需要 DeepGEMM。

按官方方式最小化部署

文档中的部署路径采用 vLLM 0.28.0,并提供 OpenAI 兼容端点。它的目标是多 GPU 节点;把命令复制到更小的机器上,并不会消除模型的内存需求。

安装文档指定的运行时

uv venv
source .venv/bin/activate
uv pip install "vllm==0.28.0" --torch-backend=auto
uv pip install "transformers>=5.15.0"

vLLM 配方还指出,FP8 性能需要 DeepGEMM。在开通付费节点前,请结合目标 GPU 镜像核对当前配方。

启动原生 FP8 GLM-5.3

vllm serve zai-org/GLM-5.3 \
  --kv-cache-dtype fp8 \
  --tensor-parallel-size 8 \
  --speculative-config.method mtp \
  --speculative-config.num_speculative_tokens 5 \
  --tool-call-parser glm47 \
  --reasoning-parser glm45 \
  --enable-auto-tool-choice \
  --served-model-name glm-5.3

这些参数各自承担不同职责:

  • --tensor-parallel-size 8 将检查点分布到 8 张 GPU 上。
  • --kv-cache-dtype fp8 相比更高精度的缓存,可以降低 KV 缓存压力。
  • 5 token 的 MTP 设置启用了文档配方中的推测解码。
  • --tool-call-parser glm47 和 --reasoning-parser glm45 用于将模型输出整理为工具调用和推理格式。
  • --enable-auto-tool-choice 让服务端在客户端提供工具时自行选择工具。

接入智能体前,先验证端点

curl -X POST "http://localhost:8000/v1/chat/completions" \
  -H "Content-Type: application/json" \
  --data '{
    "model": "glm-5.3",
    "messages": [
      {"role": "user", "content": "Write a Python function that reverses a linked list."}
    ],
    "max_tokens": 256
  }'

成功返回结果只能说明模型已成功加载,不能证明工具调用或长上下文能力正常。官方模型卡还将 SGLang 列为另一条 OpenAI 兼容路径;本文选择 vLLM,是因为其 GPU 拓扑和参数在专门配方中已有明确文档。

容易被忽略的显存账:KV 缓存与始终开启的思考

GLM-5.3 模型卡和vLLM 配方都将思考模式视为始终启用。支持的推理强度值为 low、high 和 max;未提供受支持的较低设置时,默认使用 max。

更长的思考会消耗更多输出 token,而编程智能体在反复调用工具时,可能会将大型代码仓库前缀保留在 KV 缓存中。即便模型权重不变,更多并发序列也会成倍扩大缓存需求。

可以把这些设置当作部署控制项:

  • Low:适合交互式编程、短请求和对延迟敏感的工具,建议从这里开始。
  • High:适合需要更多规划、但仍需保持交互响应预算的任务。
  • Max:留给困难、长周期任务,前提是额外的推理 token 确实值得。

官方配方为完整上下文 B200 配置建议 --max-num-seqs 32,同时使用 FP8 缓存设置。应将该数字当作起点:服务器内存不足时降低并发;在真实请求能到达该范围且没有发生缓存截断前,不要宣称支持 100 万 token。

什么时候 API 才是更理性的硬件选择

自托管意味着即使没有开发者发起请求,也要持续预留 GPU 算力。对于间歇性流量、低并发需求,或仍在验证 GLM-5.3 的团队,API 可以避免购买或长期租用 8 GPU 节点;代价则是数据由托管方处理,以及对服务商的依赖。

Z.ai 当前定价页列出:GLM-5.3 的价格为每 100 万输入 token $1.40、每 100 万缓存输入 token $0.26、每 100 万输出 token $4.40。GLM-5.3-Flash 的标价为 $0.15 / $0.03 / $0.50,页面显示截至 2026 年 9 月 9 日有 50% 优惠;做预算前请核对实时计费页面。

工作负载GLM-5.3 按标价计算GLM-5.3-Flash 按标价计算
1000 万新增输入 + 200 万输出$14.00 + $8.80 = $22.80$1.50 + $1.00 = $2.50
200 万新增输入 + 800 万缓存输入 + 200 万输出$2.80 + $2.08 + $8.80 = $13.68$0.30 + $0.24 + $1.00 = $1.54

这些只是 token 成本示例,并非自托管盈亏平衡测算。要进行有效的本地部署对比,还需要计算节点每小时价格、持续 tokens per second、利用率、电费、存储、工程时间,以及失败或重试的智能体运行。若要逐项了解费率,可阅读 AIReiter 的 GLM-5.3-Flash API pricing guide。

实际决策可以这样理解:

  • 当你需要旗舰能力、但需求不规律或规模中等时,选择托管 GLM-5.3 API。
  • 当更低 token 成本、多模态输入,或更小的自托管目标比旗舰能力更重要时,选择 GLM-5.3-Flash。
  • 当隐私、控制权或持续高利用率足以证明 8 GPU 部署合理时,选择自托管旗舰版 GLM-5.3。

GLM-5.3 硬件要求常见问题

GLM-5.3 能在单张 RTX 4090、RTX 5090 或 24 GB GPU 上运行吗?

不能,至少完整模型不行。在线原生 FP8 仓库包含约 756 GB 的 safetensors 文件,因此 24 GB 显卡最多只能参与极端 offload 或量化实验,无法正常承载模型服务。

128 GB 或 192 GB 内存够用吗?

对于旗舰版原生 FP8 部署,不够。已验证的 Flash 配置使用两张独立的 96 GB GPU、固定的 4-bpw 检查点以及额外存储;这并不等同于一台配备 192 GB 内存的笔记本或统一内存工作站。

GLM-5.3 和 GLM-5.3-Flash 有什么区别?

它们是两个独立模型:旗舰模型卡报告的总参数量约为 753B,而Z.ai 对 Flash 的介绍显示其总参数量为 320B、激活参数为 18B,并定位为原生多模态模型。Flash 更小、价格更低,但它仍是服务器级模型,不是一个 18B 桌面模型。

该选哪种精度?

如果具备文档规定的 8 GPU 拓扑,使用原生 FP8。若能接受多节点内存需求,可使用 BF16 进行参考质量或专项评测;仅在受支持的 Blackwell 硬件上考虑 NVFP4,并记住列出的 NVFP4 检查点是社区重新量化版本,而不是原始默认包。

GLM-5.3 能接入编程智能体吗?

可以。官方 vLLM 配方启用了 OpenAI 兼容端点,以及工具调用和推理解析器,因此支持该接口的客户端可以在验证服务端后接入。不过,仍应测试具体的运行框架、工具 schema 和长会话表现;一次成功的聊天补全不代表一定兼容智能体工作流。

下一步怎么做

如果你只有桌面设备,或主机内存低于 192 GB,建议先测试托管 API。可以针对代表性工作负载租用文档所列的 8 GPU 拓扑,或在大显存多 GPU 机器上评估 Flash;只有测得的利用率表明控制权与隐私需求值得承担基础设施成本时,再考虑自托管。