Si estás comprobando si GLM-5.3 puede funcionar en una GPU de escritorio, la respuesta es no: el checkpoint insignia necesita la memoria de un servidor. GLM-5.3-Flash reduce el listón, pero sigue siendo un modelo grande que requiere varias GPU; cargar un checkpoint cuantizado no equivale a ofrecer un agente de programación con una respuesta ágil.
La respuesta de hardware, de un vistazo
El modelo completo GLM-5.3 tiene una topología documentada de 8 GPU en FP8, mientras que el objetivo de contexto completo de 1 millón de tokens está documentado para 8× B200. Una máquina con 24 GB, 64 GB, 128 GB o 192 GB no es un objetivo práctico para el modelo completo, aunque el enrutamiento disperso MoE solo active parte de los parámetros con cada token.
| Objetivo | Evidencia publicada | Tipo de evidencia | Decisión práctica |
|---|---|---|---|
| GLM-5.3 FP8 nativo | 8× H200 o H20 en la receta oficial de vLLM | Topología oficial | Despliegue en servidor o estación de trabajo especializada. |
| GLM-5.3 BF16 | Checkpoint BF16 independiente; servicio multinodo en la receta de vLLM | Nota oficial de despliegue | Solo para evaluación o producción de gama alta. |
| GLM-5.3 NVFP4 | La receta oficial de vLLM incluye Inferact/GLM-5.3-NVFP4, un checkpoint Blackwell de aproximadamente 465 GB | Checkpoint comunitario incluido en la receta oficial | Experimento o servicio específico para Blackwell. |
| GLM-5.3 cuantizado | Un informe comunitario sobre GGUF de 2 bits utilizó un archivo de aproximadamente 281 GB | Empaquetado comunitario, no dimensionamiento de Z.ai | Posible experimento con descarga a CPU, pero no una instalación de escritorio normal. |
| GLM-5.3-Flash | Un perfil validado utiliza 2× RTX PRO 6000 Blackwell de 96 GB con un checkpoint de 4 bpw y 175,6 GB | Validación comunitaria | La opción local realista de GLM, aunque sigue requiriendo varias GPU. |
La tarjeta del modelo en Hugging Face indica 753.329.940.480 parámetros totales, 751.226.191.872 parámetros en FP8 y un tamaño total de 755.643.409.571 bytes para los archivos safetensors. La receta de vLLM redondea el modelo a unos 743B de parámetros totales y 39B de parámetros activos. Las cifras redondeadas difieren ligeramente, pero ninguna cambia la conclusión sobre el hardware.
El cálculo bruto de memoria de los pesos
Estas cifras son estimaciones aritméticas previas a la caché KV, las activaciones, los búferes del runtime y la sobrecarga del asignador de memoria. FP8 y BF16 utilizan la escala aproximada de 753B parámetros del modelo insignia; los valores de NVFP4 y 2 bits proceden de implementaciones concretas.
| Representación | Memoria bruta aproximada de los pesos | Qué significa |
|---|---|---|
| FP8 | ~753 GB | Coincide con el plan de despliegue nativo en FP8 y con la clase de 8 GPU. |
| BF16 | ~1,5 TB | Requiere memoria de clase multinodo antes de sumar la sobrecarga del servicio. |
| NVFP4 | ~465 GB para el checkpoint comunitario indicado | Vía exclusiva para Blackwell en la receta oficial; no es el checkpoint predeterminado de Z.ai. |
| 2 bits | Cientos de GB en las compilaciones comunitarias | Experimentación con descarga a CPU o con mucha memoria, no un despliegue de 24 GB. |
Qué ha cambiado respecto a las recomendaciones de hardware previas al lanzamiento
El repositorio de GLM-5.3 ya está disponible con archivos FP8 nativos. Para los metadatos del checkpoint, consulta la tarjeta actual del modelo; para la topología y los parámetros de lanzamiento, la receta oficial de vLLM; y para la experiencia medida en despliegues reales, los informes de la comunidad. La receta actual anuncia una ventana de 1.048.576 tokens.
Elige según la memoria disponible, no según el número de parámetros
En GLM-5.3, la memoria de los pesos es la primera limitación y la memoria de contexto, la segunda. Los parámetros activos reducen el cálculo, pero no eliminan la necesidad de almacenar los expertos enrutados ni los búferes del runtime.
24–64 GB: no plantees ejecutar el GLM-5.3 completo en local
Una RTX 4090, una RTX 5090 u otra tarjeta de 24 GB no puede contener el checkpoint insignia en FP8 nativo, cuyos archivos safetensors ocupan aproximadamente 756 GB en el repositorio activo de Hugging Face. Incluso una tarjeta profesional de 64 GB queda muy por debajo del tamaño de los pesos.
La descarga a CPU puede permitir que cargue un experimento cuantizado, pero es una vía de depuración, no la opción predeterminada para un servicio interactivo de programación. El agente tiene que completar llamadas repetidas a herramientas a una velocidad razonable.
128–192 GB: no para el insignia; Flash solo con una configuración concreta
Una máquina con 128 GB o 192 GB de memoria unificada sigue estando por debajo de los requisitos del modelo insignia en FP8 nativo. Flash sí tiene una vía concreta: un perfil público validado ejecuta un checkpoint EXL3/TR3 fijado de 4 bpw repartido entre 2× RTX PRO 6000 Blackwell de 96 GB.
Ese perfil utiliza 175,6 GB de datos del checkpoint, aproximadamente 220 GB de almacenamiento libre, comunicación PCIe peer-to-peer y un runtime fijado. Indica un límite de 262.144 tokens por solicitud, pero se trata de un despliegue discreto con dos GPU, no de 192 GB de RAM convencional del sistema. El perfil también registra 171,7 tokens por segundo durante la decodificación y 0,059 segundos de tiempo mediano hasta el primer token para esa configuración exacta de Flash.
2–4 GPU con mucha memoria: considera Flash, no el modelo insignia
Dos o cuatro tarjetas con mucha memoria son el primer rango que merece la pena investigar para Flash, porque la precisión, el runtime, la longitud del contexto, el procesamiento por lotes y las entradas de imagen modifican el presupuesto de memoria. El perfil validado de dos GPU admite texto, herramientas estructuradas y entrada de imágenes semántica; el vídeo está desactivado, el endpoint no incluye autenticación y la plantilla de visión proporcionada necesita una corrección reversible antes de verificar el funcionamiento multimodal. Estos detalles corresponden a esa receta fijada, no a todas las compilaciones de Flash ni al modelo insignia.
8× H200 o H20: la topología FP8 documentada para el modelo insignia
La receta oficial de vLLM establece ocho GPU H200 o H20 como topología estándar para FP8 nativo. Utiliza paralelismo tensorial de ocho vías, caché KV en FP8, predicción mult token de cinco tokens, selección automática de herramientas y analizadores específicos de GLM para razonamiento y llamadas a herramientas.
Esta es la topología documentada, no una promesa de una velocidad concreta en tokens por segundo. El rendimiento real depende de la interconexión, la longitud del contexto, el tamaño del lote, las secuencias simultáneas y la compilación del servicio; la página de vLLM proporciona la configuración, pero no cifras de rendimiento medidas en producción.
8× B200: úsalo cuando importe el objetivo de contexto de 1M
La receta oficial sitúa ocho GPU B200 como configuración para el contexto completo de 1.048.576 tokens. Ese contexto adicional es una decisión de VRAM: la caché KV crece con las secuencias activas y el contexto, de modo que un despliegue que funciona con 32K o 128K tokens puede no admitir un millón de tokens con el mismo nivel de concurrencia.
Empieza con un valor menor de --max-model-len y auméntalo solo después de medir el uso de la caché KV. Una ventana de contexto anunciada tan grande resulta útil para repositorios y documentos extensos, pero no hace que todas las solicitudes sean económicas o tengan baja latencia.
Requisitos del host que la receta oficial no especifica
La receta de vLLM proporciona la topología de GPU y los parámetros de lanzamiento, pero no publica requisitos universales de RAM del sistema, consumo, refrigeración, espacio libre de almacenamiento o red. Esos valores varían según el checkpoint, el runtime, el objetivo de contexto y la plataforma del proveedor.
| Elemento del host | Lo que respalda la evidencia recopilada |
|---|---|
| Almacenamiento del modelo | El repositorio activo del modelo insignia indica 755.600 millones de bytes de archivos safetensors; reserva espacio adicional para cachés y fragmentos temporales. |
| Interconexión de GPU | La receta exige paralelismo tensorial de ocho vías; verifica la topología de la plataforma alquilada o del servidor en lugar de asumir un rendimiento basado únicamente en PCIe. |
| RAM del sistema | La receta de vLLM no publica una cifra oficial universal. No sustituyas la memoria GPU necesaria por una cifra de RAM del sistema. |
| Consumo y refrigeración | No existe una cifra oficial universal publicada. Consulta las especificaciones eléctricas y térmicas de la plataforma para ocho GPU antes de comprar el hardware. |
| Software | La receta oficial muestra vLLM 0.28.0 o posterior y Transformers 5.15.0 o posterior; DeepGEMM es necesario para el rendimiento en FP8. |
La ruta mínima de servicio oficial
La ruta de despliegue documentada utiliza vLLM 0.28.0 y un endpoint compatible con OpenAI. Está diseñada para un nodo con varias GPU; copiar el comando en una máquina más pequeña no elimina el requisito de memoria del modelo.
Instala el runtime documentado
uv venv
source .venv/bin/activate
uv pip install "vllm==0.28.0" --torch-backend=auto
uv pip install "transformers>=5.15.0"
La receta de vLLM también señala que DeepGEMM es necesario para el rendimiento en FP8. Comprueba la receta actual con la imagen de GPU de destino antes de aprovisionar un nodo de pago.
Inicia GLM-5.3 nativo en FP8
vllm serve zai-org/GLM-5.3 \
--kv-cache-dtype fp8 \
--tensor-parallel-size 8 \
--speculative-config.method mtp \
--speculative-config.num_speculative_tokens 5 \
--tool-call-parser glm47 \
--reasoning-parser glm45 \
--enable-auto-tool-choice \
--served-model-name glm-5.3
Cada parámetro tiene una función concreta:
--tensor-parallel-size 8reparte el checkpoint entre ocho GPU.--kv-cache-dtype fp8reduce la presión sobre la caché frente a una caché de mayor precisión.- La configuración MTP de cinco tokens activa la decodificación especulativa indicada en la receta documentada.
--tool-call-parser glm47y--reasoning-parser glm45dan formato a la salida del modelo para el uso de herramientas y el razonamiento.--enable-auto-tool-choicepermite que el servidor seleccione herramientas cuando el cliente las proporciona.
Valida el endpoint antes de conectarlo a un agente
curl -X POST "http://localhost:8000/v1/chat/completions" \
-H "Content-Type: application/json" \
--data '{
"model": "glm-5.3",
"messages": [
{"role": "user", "content": "Write a Python function that reverses a linked list."}
],
"max_tokens": 256
}'
Una respuesta correcta confirma que el modelo se ha cargado, pero no valida el uso de herramientas ni el comportamiento con contextos largos. La tarjeta oficial del modelo documenta SGLang como otra vía compatible con OpenAI, pero esta guía utiliza vLLM porque su topología de GPU y sus parámetros están documentados en una receta específica.
El presupuesto de memoria oculto: caché KV y razonamiento siempre activo
La tarjeta del modelo GLM-5.3 y la receta de vLLM tratan el razonamiento como una función siempre activada. Los valores de esfuerzo de razonamiento admitidos son low, high y max; max es el valor predeterminado cuando no se proporciona una opción inferior compatible.
Un razonamiento más largo consume más tokens de salida, mientras que un agente de programación puede mantener grandes prefijos de un repositorio en la caché KV durante llamadas repetidas a herramientas. Además, más secuencias simultáneas multiplican las necesidades de caché aunque los pesos del modelo no cambien.
Utiliza estos ajustes como controles de despliegue:
- Low: empieza aquí para programación interactiva, solicitudes breves y herramientas sensibles a la latencia.
- High: úsalo cuando una tarea necesite más planificación, pero siga requiriendo un tiempo de respuesta interactivo.
- Max: resérvalo para tareas difíciles y de largo recorrido en las que estén justificados los tokens de razonamiento adicionales.
La receta oficial recomienda --max-num-seqs 32 para la configuración B200 de contexto completo y utiliza ajustes de caché en FP8. Toma esa cifra como punto de partida: reduce la concurrencia si el servidor se queda sin memoria y no afirmes que admite un millón de tokens hasta que una solicitud real alcance ese rango sin truncar la caché.
Cuándo la API es la opción de hardware más sensata
El alojamiento propio reserva capacidad de GPU incluso cuando ningún desarrollador está enviando solicitudes. Para un tráfico intermitente, una concurrencia baja o un equipo que todavía está validando GLM-5.3, la API evita comprar o alquilar de forma continua un nodo de ocho GPU; a cambio, implica gestionar los datos en la plataforma y depender del proveedor.
La página de precios actual de Z.ai muestra GLM-5.3 a $1.40 por 1M de tokens de entrada, $0.26 por 1M de tokens de entrada en caché y $4.40 por 1M de tokens de salida. Para GLM-5.3-Flash indica $0.15 / $0.03 / $0.50 como precio de lista, con una promoción del 50% mostrada hasta el 9 de septiembre de 2026; comprueba la página de facturación activa antes de preparar el presupuesto.
| Carga de trabajo | Cálculo de GLM-5.3 a precio de lista | Cálculo de GLM-5.3-Flash a precio de lista |
|---|---|---|
| 10M de entrada nueva + 2M de salida | $14.00 + $8.80 = $22.80 | $1.50 + $1.00 = $2.50 |
| 2M de entrada nueva + 8M de entrada en caché + 2M de salida | $2.80 + $2.08 + $8.80 = $13.68 | $0.30 + $0.24 + $1.00 = $1.54 |
Son ejemplos de coste por tokens, no un cálculo del punto de equilibrio frente al alojamiento propio. Para hacer una comparación local válida necesitas el precio por hora del nodo, los tokens por segundo sostenidos, la utilización, la electricidad, el almacenamiento, el tiempo de ingeniería y las ejecuciones fallidas o repetidas del agente. Para consultar el desglose por tarifa, revisa la guía de precios de la API de GLM-5.3-Flash de AIReiter.
La decisión es esta:
- Elige la API alojada de GLM-5.3 si necesitas el modelo insignia, pero tienes una demanda irregular o moderada.
- Elige GLM-5.3-Flash si te importan más el menor coste por token, la entrada multimodal o un objetivo de autoalojamiento más pequeño que la capacidad del modelo insignia.
- Elige el GLM-5.3 insignia autoalojado cuando la privacidad, el control o una utilización sostenida justifiquen un despliegue de ocho GPU.
Preguntas frecuentes sobre los requisitos de hardware de GLM-5.3
¿Puede GLM-5.3 funcionar en una RTX 4090, RTX 5090 o GPU de 24 GB?
No, al menos no el modelo completo. El repositorio activo en FP8 nativo contiene aproximadamente 756 GB de archivos safetensors, por lo que una tarjeta de 24 GB solo puede participar en un experimento extremo con descarga a CPU o cuantización, no alojar el modelo para un servicio normal.
¿Bastan 128 GB o 192 GB de RAM?
No para el despliegue insignia en FP8 nativo. El perfil validado de Flash utiliza dos GPU discretas de 96 GB, un checkpoint fijado de 4 bpw y almacenamiento adicional; eso no equivale a un portátil o una estación de trabajo con 192 GB de memoria unificada.
¿Cuál es la diferencia entre GLM-5.3 y GLM-5.3-Flash?
Son modelos independientes: la tarjeta del modelo insignia indica aproximadamente 753B de parámetros totales, mientras que Z.ai describe Flash como un modelo de 320B de parámetros totales y 18B activos, con posicionamiento multimodal nativo. Flash es más pequeño y barato, pero sigue siendo un modelo de clase servidor, no un modelo de 18B para escritorio.
¿Qué precisión debería elegir?
Utiliza FP8 nativo cuando tengas disponible la topología documentada de ocho GPU. Usa BF16 para evaluaciones de referencia o especializadas cuando la memoria multinodo sea asumible; considera NVFP4 únicamente en hardware Blackwell compatible y recuerda que el checkpoint NVFP4 indicado es una recalibración cuantizada comunitaria, no el paquete original predeterminado.
¿Puedo conectar GLM-5.3 a un agente de programación?
Sí. La receta oficial de vLLM activa un endpoint compatible con OpenAI junto con analizadores de llamadas a herramientas y razonamiento, de modo que los clientes compatibles con esa interfaz pueden conectarse después de validar el servidor. Prueba el arnés exacto, el esquema de herramientas y el comportamiento durante sesiones largas; una respuesta correcta en un chat no demuestra por sí sola la compatibilidad con agentes.
Qué hacer ahora
Si utilizas un equipo de escritorio o un host con menos de 192 GB, prueba primero la API alojada. Alquila la topología documentada de ocho GPU para una carga de trabajo representativa o evalúa Flash en una máquina con varias GPU y mucha memoria; pasa al autoalojamiento solo cuando la utilización medida demuestre que el control y la privacidad compensan el coste de la infraestructura.