Está pensando em rodar o GLM-5.3 em uma GPU de desktop? Para o modelo carro-chefe ativo, a resposta é não: o checkpoint demanda memória de nível servidor. O GLM-5.3-Flash reduz essa exigência, mas continua sendo um modelo grande para múltiplas GPUs; conseguir carregar um checkpoint quantizado não é o mesmo que servir um agente de programação com boa resposta.
Resumo dos requisitos de hardware
O GLM-5.3 completo tem uma topologia FP8 documentada com 8 GPUs, enquanto a meta de contexto completo de 1 milhão de tokens é documentada para 8× B200. Uma máquina com 24 GB, 64 GB, 128 GB ou 192 GB não é uma opção prática para o modelo completo, mesmo que o roteamento MoE esparso ative apenas parte dos parâmetros a cada token.
| Objetivo | Evidência publicada | Tipo de evidência | Decisão prática |
|---|---|---|---|
| GLM-5.3 FP8 nativo | 8× H200 ou H20 na receita oficial do vLLM | Topologia oficial | Implantação em servidor ou workstation especializada. |
| GLM-5.3 BF16 | Checkpoint BF16 separado; serving multinó na receita do vLLM | Nota oficial de implantação | Apenas para avaliação ou produção de alto nível. |
| GLM-5.3 NVFP4 | A receita oficial do vLLM lista Inferact/GLM-5.3-NVFP4, um checkpoint Blackwell de cerca de 465 GB | Checkpoint da comunidade listado pela receita oficial | Experimento ou serviço específico para Blackwell. |
| GLM-5.3 quantizado | Um relato da comunidade sobre GGUF de 2 bits usou um arquivo de cerca de 281 GB | Empacotamento da comunidade, não dimensionamento da Z.ai | Possível experimento com offload, não uma instalação desktop convencional. |
| GLM-5.3-Flash | Um perfil validado usa 2× RTX PRO 6000 Blackwell 96GB com um checkpoint de 175.6 GB em 4 bpw | Validação da comunidade | A opção local realista para GLM, ainda em múltiplas GPUs. |
O card do modelo no Hugging Face informa 753,329,940,480 parâmetros totais, 751,226,191,872 parâmetros FP8 e 755,643,409,571 bytes de arquivos safetensors no total. A receita do vLLM arredonda o modelo para cerca de 743B parâmetros totais e 39B ativos. Há uma pequena diferença entre os números arredondados, mas ela não muda a conclusão sobre hardware.
Conta bruta de memória para os pesos
Os números abaixo são estimativas aritméticas antes de considerar cache KV, ativações, buffers de runtime e overhead do alocador. FP8 e BF16 usam a escala de aproximadamente 753B parâmetros do carro-chefe ativo; os valores de NVFP4 e 2 bits vêm de implementações específicas.
| Representação | Memória bruta aproximada dos pesos | O que isso representa |
|---|---|---|
| FP8 | ~753 GB | Corresponde ao plano de implantação FP8 nativo com 8 GPUs. |
| BF16 | ~1.5 TB | Exige memória de classe multinó antes mesmo do overhead de serving. |
| NVFP4 | ~465 GB para o checkpoint da comunidade listado | Caminho exclusivo para Blackwell na receita oficial; não é o checkpoint padrão da Z.ai. |
| 2 bits | Centenas de GB nas versões da comunidade | Para offload ou experimentação com muita memória, não para uma GPU de 24 GB. |
O que mudou desde as recomendações pré-lançamento
O repositório do GLM-5.3 já está disponível com arquivos FP8 nativos. Consulte o card ativo do modelo para os metadados do checkpoint, a receita oficial do vLLM para topologia e flags, e os relatos da comunidade para experiência prática de implantação; a receita atual anuncia uma janela de 1,048,576 tokens.
Escolha pela memória disponível, não pela contagem de parâmetros
No GLM-5.3, a memória dos pesos é a primeira limitação e a memória de contexto é a segunda. Parâmetros ativos reduzem o processamento, mas não eliminam a necessidade de armazenar os especialistas roteados e os buffers de runtime.
24–64 GB: não planeje rodar o GLM-5.3 completo localmente
Uma RTX 4090, RTX 5090 ou qualquer outra placa na faixa de 24 GB não comporta o checkpoint FP8 nativo do carro-chefe, que tem cerca de 756 GB em arquivos safetensors no repositório ativo do Hugging Face. Mesmo uma placa de workstation com 64 GB continua muito abaixo da memória necessária para os pesos.
O offload para CPU pode permitir carregar um experimento quantizado, mas isso serve para depuração, não como padrão para um serviço interativo de programação. O agente ainda precisa concluir chamadas repetidas de ferramentas em uma velocidade aceitável.
128–192 GB: carro-chefe não; Flash apenas em uma configuração específica
Uma máquina com memória unificada de 128 GB ou 192 GB continua abaixo do requisito de FP8 nativo do carro-chefe. O Flash tem um caminho concreto: um perfil validado público executa um checkpoint EXL3/TR3 4-bpw fixado em 2× RTX PRO 6000 Blackwell 96GB.
Esse perfil usa 175.6 GB de dados de checkpoint, aproximadamente 220 GB de armazenamento livre, comunicação PCIe peer-to-peer e um runtime fixado. Ele informa um teto de 262,144 tokens por requisição, mas se trata de uma implantação com duas GPUs discretas, não de 192 GB de RAM comum do sistema. O perfil também relata 171.7 tokens por segundo na decodificação e 0.059 segundos de mediana até o primeiro token nessa configuração exata do Flash.
2–4 GPUs com muita memória: avalie o Flash, não o carro-chefe
Duas ou quatro placas com muita memória são a primeira faixa que vale investigar para o Flash, pois precisão, runtime, tamanho de contexto, batching e entradas de imagem alteram o orçamento de memória. O perfil validado para duas GPUs suporta texto, ferramentas estruturadas e entrada semântica de imagem; vídeo está desativado, o endpoint não conta com autenticação nativa e o template de visão fornecido precisa de um reparo reversível antes da validação multimodal. Esses detalhes valem para essa receita fixada, não para toda build do Flash nem para o carro-chefe.
8× H200 ou H20: topologia FP8 documentada para o carro-chefe
A receita oficial do vLLM indica oito GPUs H200 ou H20 como topologia padrão para FP8 nativo. Ela usa paralelismo de tensor em oito vias, cache KV em FP8, previsão de múltiplos tokens com cinco tokens, escolha automática de ferramentas e parsers específicos do GLM para raciocínio e chamadas de ferramentas.
Essa é a topologia documentada, não uma promessa de determinado desempenho em tokens por segundo. O throughput real depende da interconexão, do comprimento de contexto, do tamanho do lote, das sequências simultâneas e da build de serving; a página do vLLM oferece a configuração, mas não dados de throughput medidos em produção.
8× B200: para quando o contexto de 1M de tokens for importante
A receita oficial posiciona oito GPUs B200 para a configuração completa de contexto de 1,048,576 tokens. Esse contexto extra é uma decisão de VRAM: o cache KV cresce com as sequências ativas e o contexto, portanto uma implantação que funciona com 32K ou 128K tokens pode não suportar um milhão de tokens com a mesma concorrência.
Comece com um valor menor de --max-model-len e aumente-o apenas depois de medir o uso do cache KV. Uma janela de contexto grande anunciada é útil para repositórios e documentos extensos, mas não torna toda requisição econômica ou de baixa latência.
Requisitos do host que a receita oficial não define
A receita do vLLM informa a topologia de GPU e as flags de inicialização, mas não publica uma exigência universal de RAM do sistema, energia, refrigeração, espaço extra em armazenamento ou rede. Esses valores variam conforme o checkpoint, o runtime, a meta de contexto e a plataforma do provedor.
| Item do host | O que as evidências reunidas sustentam |
|---|---|
| Armazenamento do modelo | O repositório ativo do carro-chefe informa 755.6 bilhões de bytes em arquivos safetensors; reserve espaço adicional para caches e shards temporários. |
| Interconexão entre GPUs | A receita exige paralelismo de tensor em oito vias; verifique a topologia da locação ou do servidor em vez de presumir desempenho apenas via PCIe. |
| RAM do sistema | A receita do vLLM não publica um número oficial universal. Não substitua a memória de GPU necessária por um valor de RAM do sistema. |
| Energia e refrigeração | Não há um número oficial universal publicado. Consulte as especificações elétricas e térmicas da plataforma para oito GPUs antes de comprar hardware. |
| Software | A receita oficial mostra vLLM 0.28.0 ou superior e Transformers 5.15.0 ou superior; DeepGEMM é necessário para desempenho em FP8. |
Caminho mínimo oficial para servir o modelo
O caminho de implantação documentado usa vLLM 0.28.0 e um endpoint compatível com OpenAI. Ele foi pensado para um nó com múltiplas GPUs; copiar o comando para uma máquina menor não elimina o requisito de memória do modelo.
Instale o runtime documentado
uv venv
source .venv/bin/activate
uv pip install "vllm==0.28.0" --torch-backend=auto
uv pip install "transformers>=5.15.0"
A receita do vLLM também observa que DeepGEMM é necessário para o desempenho em FP8. Antes de provisionar um nó pago, confira a receita atual em relação à imagem de GPU desejada.
Inicie o GLM-5.3 em FP8 nativo
vllm serve zai-org/GLM-5.3 \
--kv-cache-dtype fp8 \
--tensor-parallel-size 8 \
--speculative-config.method mtp \
--speculative-config.num_speculative_tokens 5 \
--tool-call-parser glm47 \
--reasoning-parser glm45 \
--enable-auto-tool-choice \
--served-model-name glm-5.3
Cada flag tem uma função específica:
--tensor-parallel-size 8distribui o checkpoint entre oito GPUs.--kv-cache-dtype fp8reduz a pressão sobre o cache em comparação com um cache de maior precisão.- A configuração MTP de cinco tokens ativa a decodificação especulativa da receita documentada.
--tool-call-parser glm47e--reasoning-parser glm45formatam a saída do modelo para uso de ferramentas e raciocínio.--enable-auto-tool-choicepermite que o servidor selecione ferramentas quando o cliente as fornece.
Valide o endpoint antes de conectar um agente
curl -X POST "http://localhost:8000/v1/chat/completions" \
-H "Content-Type: application/json" \
--data '{
"model": "glm-5.3",
"messages": [
{"role": "user", "content": "Write a Python function that reverses a linked list."}
],
"max_tokens": 256
}'
Uma resposta bem-sucedida valida o carregamento, não o uso de ferramentas nem o comportamento com contexto longo. O card oficial do modelo documenta o SGLang como outro caminho compatível com OpenAI, mas este guia usa o vLLM porque sua topologia de GPU e suas flags estão documentadas em uma receita dedicada.
O orçamento de memória invisível: cache KV e raciocínio sempre ativo
O card do GLM-5.3 e a receita do vLLM tratam o pensamento como sempre habilitado. Os valores compatíveis de esforço de raciocínio são low, high e max; max é o padrão quando nenhuma configuração inferior compatível é fornecida.
Raciocínios mais longos consomem mais tokens de saída, enquanto um agente de programação pode manter grandes prefixos de repositórios no cache KV ao longo de chamadas repetidas de ferramentas. Mais sequências simultâneas multiplicam a necessidade de cache, mesmo que os pesos do modelo não mudem.
Use essas configurações como controles de implantação:
- Low: comece por aqui para programação interativa, requisições curtas e ferramentas sensíveis à latência.
- High: use quando a tarefa exige mais planejamento, mas ainda trabalha com um orçamento de resposta interativa.
- Max: reserve para tarefas difíceis e de horizonte longo, nas quais tokens extras de raciocínio se justificam.
A receita oficial recomenda --max-num-seqs 32 para a configuração B200 de contexto completo e usa ajustes de cache FP8. Trate esse número como ponto de partida: reduza a concorrência caso o servidor fique sem memória e não afirme suporte a um milhão de tokens até uma requisição real alcançar essa faixa sem truncamento de cache.
Quando a API é a escolha mais racional de hardware
Hospedar o modelo por conta própria reserva capacidade de GPU mesmo quando nenhum desenvolvedor envia requisições. Para tráfego intermitente, baixa concorrência ou equipes que ainda estão validando o GLM-5.3, a API evita comprar ou alugar continuamente um nó com oito GPUs; em troca, há tratamento de dados hospedado e dependência do provedor.
A página atual de preços da Z.ai lista o GLM-5.3 por $1.40 por 1M de tokens de entrada, $0.26 por 1M de tokens de entrada em cache e $4.40 por 1M de tokens de saída. Para o GLM-5.3-Flash, ela lista $0.15 / $0.03 / $0.50 no preço de tabela, com uma promoção de 50% indicada até 9 de setembro de 2026; confira a página de cobrança ativa antes de fazer o orçamento.
| Carga de trabalho | Cálculo no preço de tabela do GLM-5.3 | Cálculo no preço de tabela do GLM-5.3-Flash |
|---|---|---|
| 10M de entrada nova + 2M de saída | $14.00 + $8.80 = $22.80 | $1.50 + $1.00 = $2.50 |
| 2M de entrada nova + 8M de entrada em cache + 2M de saída | $2.80 + $2.08 + $8.80 = $13.68 | $0.30 + $0.24 + $1.00 = $1.54 |
Estes são exemplos de custo por token, não um cálculo de ponto de equilíbrio para self-hosting. Uma comparação local válida exige o preço por hora do nó, tokens sustentados por segundo, utilização, eletricidade, armazenamento, tempo de engenharia e execuções de agentes que falharam ou precisaram ser repetidas. Para uma explicação tarifa a tarifa, veja o guia de preços da API GLM-5.3-Flash da AIReiter.
A decisão é a seguinte:
- Escolha a API hospedada do GLM-5.3 se você precisa do carro-chefe, mas tem demanda irregular ou moderada.
- Escolha o GLM-5.3-Flash quando custo menor por token, entrada multimodal ou um alvo menor para self-hosting forem mais importantes do que a capacidade do carro-chefe.
- Escolha o GLM-5.3 carro-chefe em self-hosting quando privacidade, controle ou utilização sustentada justificarem uma implantação com oito GPUs.
Perguntas frequentes sobre os requisitos de hardware do GLM-5.3
O GLM-5.3 roda em uma única RTX 4090, RTX 5090 ou GPU de 24 GB?
Não, não como modelo completo. O repositório FP8 nativo ativo contém cerca de 756 GB de arquivos safetensors; portanto, uma placa de 24 GB só pode participar de um experimento extremo com offload ou quantização, em vez de armazenar o modelo para serving convencional.
128 GB ou 192 GB de RAM são suficientes?
Não são suficientes para a implantação FP8 nativa do carro-chefe. O perfil validado do Flash usa duas GPUs discretas de 96 GB, um checkpoint 4-bpw fixado e armazenamento adicional; isso não equivale a um notebook ou workstation de memória unificada com 192 GB.
Qual é a diferença entre GLM-5.3 e GLM-5.3-Flash?
São modelos distintos: o card do modelo carro-chefe informa aproximadamente 753B parâmetros totais, enquanto a Z.ai descreve o Flash como tendo 320B no total e 18B ativos, com posicionamento multimodal nativo. O Flash é menor e mais barato, mas ainda é um modelo de nível servidor, não um modelo desktop de 18B.
Qual precisão devo escolher?
Use FP8 nativo quando a topologia documentada com oito GPUs estiver disponível. Use BF16 para avaliação de qualidade de referência ou especializada quando memória multinó for aceitável; considere NVFP4 apenas em hardware Blackwell compatível e lembre-se de que o checkpoint NVFP4 listado é uma re-quantização da comunidade, não o pacote padrão original.
Posso conectar o GLM-5.3 a um agente de programação?
Sim. A receita oficial do vLLM habilita um endpoint compatível com OpenAI, além de parsers para chamadas de ferramentas e raciocínio, de modo que clientes compatíveis com essa interface podem se conectar após a validação do servidor. Teste o harness exato, o esquema das ferramentas e o comportamento em sessões longas em vez de presumir que uma conclusão de chat bem-sucedida comprova compatibilidade com agentes.
Próximos passos
Para desktop ou host com menos de 192 GB, teste primeiro a API hospedada. Alugue a topologia documentada com oito GPUs para uma carga de trabalho representativa ou avalie o Flash em uma máquina multi-GPU com muita memória; só adote self-hosting depois que a utilização medida mostrar que controle e privacidade justificam o custo da infraestrutura.