AIREITER

Требования GLM-5.3 к железу (2026): GPU, VRAM и RAM

Последнее обновление: 2026-08-29 19:20:21

Если вы пытаетесь понять, запустится ли GLM-5.3 на обычной видеокарте, ответ короткий: нет. Актуальный флагманский чекпойнт требует серверного объёма памяти. GLM-5.3-Flash снижает порог входа, но это всё ещё крупная модель для нескольких GPU. Загрузить квантованный чекпойнт — не то же самое, что обеспечить отзывчивую работу агента для программирования.

Требования к железу — в одной таблице

Для полной модели GLM-5.3 заявлена топология на 8 GPU в FP8, а работа с контекстом до 1 миллиона токенов документирована для конфигурации 8× B200. Машины с 24, 64, 128 или 192 ГБ памяти не подходят для полноценной модели, даже несмотря на то, что разреженная MoE-маршрутизация активирует для каждого токена лишь часть параметров.

ЦельОпубликованные данныеТип подтвержденияПрактический вывод
GLM-5.3 в исходном FP88× H200 или H20 в официальном рецепте vLLMОфициальная топологияСерверное развёртывание или специализированная рабочая станция.
GLM-5.3 в BF16Отдельный чекпойнт BF16; в рецепте vLLM указано развёртывание на нескольких узлахОфициальная заметка по развёртываниюТолько для оценки или производственной эксплуатации высокого класса.
GLM-5.3 в NVFP4В официальном рецепте vLLM указан Inferact/GLM-5.3-NVFP4 — чекпойнт для Blackwell размером примерно 465 ГБСторонний чекпойнт, упомянутый в официальном рецептеЭксперимент или сервис на Blackwell.
GLM-5.3 в квантованном видеВ стороннем отчёте о 2-битном GGUF использовался файл размером примерно 281 ГБСторонняя упаковка, не оценка Z.aiПодходит для экспериментов с выгрузкой на CPU, но не для обычной установки на ПК.
GLM-5.3-FlashПроверенная конфигурация использует 2× RTX PRO 6000 Blackwell 96GB и чекпойнт 4-bpw размером 175,6 ГБСторонняя валидацияСамый реалистичный локальный вариант GLM, но всё равно на нескольких GPU.

На актуальной карточке модели на Hugging Face указаны 753 329 940 480 параметров всего, 751 226 191 872 параметров FP8 и общий размер файлов safetensors 755 643 409 571 байт. В рецепте vLLM модель округлённо описывается как имеющая около 743 млрд параметров всего и 39 млрд активных параметров. Округлённые значения немного различаются, но на вывод о требованиях к железу это не влияет.

Сколько памяти занимают сами веса

Ниже приведены арифметические оценки без учёта KV-кэша, активаций, буферов рантайма и накладных расходов аллокатора. Для FP8 и BF16 используется масштаб флагманской модели — примерно 753 млрд параметров; значения для NVFP4 и 2-битного формата относятся к конкретным реализациям.

ПредставлениеПримерный объём памяти под весаЧто это означает
FP8~753 ГБСоответствует плану развёртывания на 8 GPU серверного класса в native FP8.
BF16~1,5 ТБДо учёта накладных расходов потребуется память уровня нескольких узлов.
NVFP4~465 ГБ для указанного стороннего чекпойнтаПуть только для Blackwell в официальном рецепте; это не стандартный чекпойнт Z.ai.
2-битный форматСотни гигабайт для сторонних сборокЭксперименты с выгрузкой на CPU или большим объёмом памяти, но не развёртывание на 24 ГБ.

Что изменилось по сравнению с ранними оценками требований

Репозиторий GLM-5.3 теперь доступен и содержит файлы в исходном формате FP8. Метаданные чекпойнта стоит брать из актуальной карточки модели, топологию и параметры запуска — из официального рецепта vLLM, а практический опыт измеренных развёртываний — из отчётов сообщества. В текущем рецепте заявлено окно контекста на 1 048 576 токенов.

Ориентируйтесь на объём памяти, а не на количество параметров

Для GLM-5.3 сначала упираются в память под веса, а затем — в память под контекст. Активные параметры снижают вычислительную нагрузку, но не отменяют необходимость хранить маршрутизируемые эксперты и рабочие буферы.

24–64 ГБ: полноценный локальный GLM-5.3 лучше не планировать

Одна RTX 4090, RTX 5090 или другая карта класса 24 ГБ не может вместить флагманский чекпойнт в native FP8: в актуальном репозитории Hugging Face его файлы safetensors занимают около 756 ГБ. Даже рабочая станция с видеокартой на 64 ГБ остаётся далеко за пределами необходимого объёма.

Выгрузка на CPU может позволить загрузить квантованный вариант для эксперимента, но для интерактивного сервиса программирования это скорее режим отладки, чем рабочая конфигурация по умолчанию. Агенту всё равно нужно выполнять повторяющиеся вызовы инструментов с приемлемой скоростью.

128–192 ГБ: для флагмана мало, Flash — только в конкретной конфигурации

Машина с унифицированной памятью объёмом 128 или 192 ГБ всё ещё не дотягивает до требований флагмана в native FP8. Для Flash есть конкретный рабочий вариант: в открытой проверенной конфигурации чекпойнт EXL3/TR3 4-bpw распределяется между 2× RTX PRO 6000 Blackwell 96GB.

Эта конфигурация использует 175,6 ГБ данных чекпойнта, примерно 220 ГБ свободного места на накопителе, обмен PCIe peer-to-peer и зафиксированную версию рантайма. Заявленный предел запроса — 262 144 токена, но перед нами именно система с двумя дискретными GPU, а не обычный компьютер с 192 ГБ оперативной или унифицированной памяти. Для этой конкретной конфигурации Flash также заявлены 171,7 токена в секунду при декодировании и 0,059 секунды медианного времени до первого токена.

2–4 видеокарты с большим объёмом памяти: смотрите на Flash, а не на флагман

Две или четыре видеокарты с большим объёмом памяти — первый диапазон, который имеет смысл рассматривать для Flash. Итоговый бюджет зависит от точности, рантайма, длины контекста, размера батча и наличия изображений на входе. Проверенная конфигурация на двух GPU поддерживает текст, структурированные инструменты и семантический ввод изображений. Видео отключено, у эндпоинта нет встроенной аутентификации, а поставляемый шаблон для зрения требует обратимого исправления перед мультимодальной проверкой. Эти детали относятся к конкретному зафиксированному рецепту, а не ко всем сборкам Flash или к флагманской модели.

8× H200 или H20: документированная топология флагмана в FP8

В официальном рецепте vLLM восемь H200 или H20 указаны как стандартная топология для native FP8. Конфигурация использует восьмикратный tensor parallelism, KV-кэш в FP8, предсказание следующих пяти токенов, автоматический выбор инструментов и специализированные парсеры GLM для рассуждений и вызовов инструментов.

Это документированная топология, а не обещание конкретной скорости в токенах в секунду. Реальная производительность зависит от межсоединения, длины контекста, размера батча, числа параллельных последовательностей и сборки сервера. На странице vLLM приведена конфигурация, но нет измерений производительности в production.

8× B200: выбирайте эту конфигурацию, если нужен контекст на 1 млн токенов

Официальный рецепт предусматривает восемь GPU B200 для конфигурации с полным контекстом в 1 048 576 токенов. Дополнительный контекст напрямую влияет на требования к VRAM: KV-кэш растёт вместе с числом активных последовательностей и длиной контекста. Поэтому система, работающая на 32K или 128K токенах, не обязательно сможет обслуживать миллион токенов при той же степени параллелизма.

Начните с меньшего значения --max-model-len и увеличивайте его только после измерения расхода KV-кэша. Большое заявленное окно контекста полезно для длинных репозиториев и документов, но не делает каждый запрос дешёвым или быстрым.

Требования к хосту, которых нет в официальном рецепте

Рецепт vLLM описывает топологию GPU и параметры запуска, но не публикует универсальные требования к оперативной памяти, энергопотреблению, охлаждению, запасу места на накопителе или сети. Эти значения зависят от чекпойнта, рантайма, целевой длины контекста и платформы провайдера.

Компонент хостаЧто подтверждают собранные данные
Место под модельВ актуальном репозитории флагмана указано 755,6 млрд байт файлов safetensors; дополнительно потребуется место под кэши и временные шарды.
Межсоединение GPUРецепт требует восьмикратного tensor parallelism; проверяйте топологию арендованного сервера или платформы, не рассчитывая автоматически на производительность только через PCIe.
Оперативная памятьВ рецепте vLLM не указано универсальное официальное значение. Не подменяйте требуемый объём памяти GPU объёмом системной RAM.
Питание и охлаждениеУниверсальные официальные значения не опубликованы. Перед покупкой оборудования изучите электрические и тепловые характеристики платформы с восемью GPU.
Программное обеспечениеВ официальном рецепте указаны vLLM 0.28.0 или новее и Transformers 5.15.0 или новее; для производительности FP8 требуется DeepGEMM.

Минимальный официальный вариант запуска

В документированном варианте используется vLLM 0.28.0 и эндпоинт, совместимый с OpenAI API. Конфигурация рассчитана на узел с несколькими GPU: копирование команды на меньшую машину не отменит требований модели к памяти.

Установите рекомендованный рантайм

uv venv
source .venv/bin/activate
uv pip install "vllm==0.28.0" --torch-backend=auto
uv pip install "transformers>=5.15.0"

В рецепте vLLM также отмечено, что для производительности FP8 требуется DeepGEMM. Перед арендой платного узла сверьте актуальный рецепт с образом системы и целевой моделью GPU.

Запустите GLM-5.3 в native FP8

vllm serve zai-org/GLM-5.3 \
  --kv-cache-dtype fp8 \
  --tensor-parallel-size 8 \
  --speculative-config.method mtp \
  --speculative-config.num_speculative_tokens 5 \
  --tool-call-parser glm47 \
  --reasoning-parser glm45 \
  --enable-auto-tool-choice \
  --served-model-name glm-5.3

У каждого параметра здесь своя задача:

  • --tensor-parallel-size 8 распределяет чекпойнт между восемью GPU.
  • --kv-cache-dtype fp8 снижает нагрузку на память по сравнению с KV-кэшем более высокой точности.
  • Настройка MTP на пять токенов включает спекулятивное декодирование из документированного рецепта.
  • --tool-call-parser glm47 и --reasoning-parser glm45 форматируют вывод модели для работы с инструментами и рассуждениями.
  • --enable-auto-tool-choice позволяет серверу выбирать инструменты, когда клиент их передаёт.

Проверьте эндпоинт до подключения агента

curl -X POST "http://localhost:8000/v1/chat/completions" \
  -H "Content-Type: application/json" \
  --data '{
    "model": "glm-5.3",
    "messages": [
      {"role": "user", "content": "Write a Python function that reverses a linked list."}
    ],
    "max_tokens": 256
  }'

Успешный ответ подтверждает загрузку модели, но ничего не говорит о работе инструментов или длинном контексте. В официальной карточке модели также указан SGLang как ещё один вариант с совместимым с OpenAI API интерфейсом, однако в этом руководстве используется vLLM: для него в отдельном рецепте подробно описаны топология GPU и параметры запуска.

Скрытый расход памяти: KV-кэш и постоянно включённые рассуждения

В карточке модели GLM-5.3 и рецепте vLLM режим рассуждений описан как постоянно включённый. Поддерживаются значения уровня рассуждений low, high и max; если не передать поддерживаемый менее высокий уровень, по умолчанию используется max.

Чем дольше модель рассуждает, тем больше выходных токенов расходуется. При этом агент для программирования может сохранять большие префиксы репозитория в KV-кэше между повторными вызовами инструментов. Чем больше параллельных последовательностей, тем выше требования к кэшу — даже если объём весов модели не меняется.

Используйте эти настройки как инструмент управления развёртыванием:

  • Low: начните с этого режима для интерактивного программирования, коротких запросов и инструментов, чувствительных к задержке.
  • High: выбирайте, когда задаче требуется больше планирования, но бюджет интерактивного ответа всё ещё ограничен.
  • Max: оставляйте для сложных задач с длинной цепочкой действий, где дополнительные токены рассуждений оправданы.

Для конфигурации с полным контекстом на B200 официальный рецепт рекомендует --max-num-seqs 32 и настройки кэша FP8. Считайте это отправной точкой: если серверу не хватает памяти, снижайте параллелизм и не заявляйте поддержку контекста в один миллион токенов, пока реальный запрос не достигнет этого диапазона без усечения KV-кэша.

Когда API — более рациональный выбор

При самостоятельном размещении GPU заняты даже тогда, когда разработчики не отправляют запросы. При нерегулярном трафике, небольшой параллельной нагрузке или на этапе проверки GLM-5.3 API избавляет от покупки или постоянной аренды узла с восемью GPU. Обратная сторона — обработка данных у провайдера и зависимость от его сервиса.

Актуальная страница с тарифами Z.ai указывает для GLM-5.3 $1.40 за 1 млн входных токенов, $0.26 за 1 млн кэшированных входных токенов и $4.40 за 1 млн выходных токенов. Для GLM-5.3-Flash указаны $0.15 / $0.03 / $0.50 по базовому тарифу; там же отображается скидка 50%, действующая до 9 сентября 2026 года. Перед расчётом бюджета проверьте актуальную страницу биллинга.

СценарийРасчёт по базовому тарифу GLM-5.3Расчёт по базовому тарифу GLM-5.3-Flash
10 млн новых входных + 2 млн выходных токенов$14.00 + $8.80 = $22.80$1.50 + $1.00 = $2.50
2 млн новых входных + 8 млн кэшированных входных + 2 млн выходных токенов$2.80 + $2.08 + $8.80 = $13.68$0.30 + $0.24 + $1.00 = $1.54

Это примеры стоимости токенов, а не расчёт точки окупаемости собственного сервера. Для честного сравнения с локальным запуском понадобятся почасовая цена узла, стабильная скорость в токенах в секунду, загрузка, стоимость электричества, накопителей, инженерного времени, а также неудачных или повторных запусков агента. Разбор тарифов по отдельным ставкам есть в руководстве AIReiter по ценам API GLM-5.3-Flash.

Выбор выглядит так:

  • Выбирайте облачный API GLM-5.3, если нужен флагман, но нагрузка нерегулярная или умеренная.
  • Выбирайте GLM-5.3-Flash, если важнее низкая стоимость токенов, мультимодальный ввод или более доступная конфигурация для самостоятельного размещения, а не возможности флагмана.
  • Выбирайте GLM-5.3 на собственном сервере, если требования к приватности и контролю, а также стабильная загрузка оправдывают развёртывание на восьми GPU.

FAQ: требования GLM-5.3 к железу

Запустится ли GLM-5.3 на одной RTX 4090, RTX 5090 или другой видеокарте на 24 ГБ?

Нет, если речь идёт о полной модели. В актуальном репозитории native-FP8 находятся файлы safetensors общим объёмом около 756 ГБ, поэтому карта на 24 ГБ может участвовать только в экстремальном эксперименте с выгрузкой или квантованием, но не вместить модель для обычного сервинга.

Достаточно ли 128 или 192 ГБ RAM?

Для развёртывания флагмана в native FP8 этого недостаточно. Проверенная конфигурация Flash использует две дискретные видеокарты по 96 ГБ, зафиксированный чекпойнт 4-bpw и дополнительное место на накопителе. Это не эквивалент ноутбуку или рабочей станции с 192 ГБ оперативной либо унифицированной памяти.

Чем GLM-5.3 отличается от GLM-5.3-Flash?

Это разные модели: в карточке флагмана указано около 753 млрд параметров всего, а Z.ai описывает Flash как модель со 320 млрд параметров всего и 18 млрд активных параметров, изначально ориентированную на мультимодальную работу. Flash меньше и дешевле, но это всё равно серверная модель, а не настольная модель на 18 млрд параметров.

Какую точность выбрать?

Используйте native FP8, если доступна документированная конфигурация на восьми GPU. BF16 подходит для эталонной по качеству или специализированной оценки, когда приемлема память уровня нескольких узлов. NVFP4 стоит рассматривать только на совместимом оборудовании Blackwell и помнить, что указанный чекпойнт NVFP4 — это сторонняя переквантизация, а не оригинальный пакет по умолчанию.

Можно ли подключить GLM-5.3 к агенту для программирования?

Да. Официальный рецепт vLLM включает совместимый с OpenAI API эндпоинт, а также парсеры вызовов инструментов и рассуждений. Поэтому после проверки сервера к нему можно подключать клиентов с поддержкой этого интерфейса. Но обязательно протестируйте конкретный хarness, схему инструментов и поведение в длинной сессии: успешный ответ на обычный chat completion ещё не доказывает совместимость с агентом.

Что делать дальше

Если у вас настольный компьютер или хост с памятью менее 192 ГБ, сначала протестируйте облачный API. Для реальной нагрузки арендуйте конфигурацию с документированной топологией на восьми GPU либо оцените Flash на машине с несколькими GPU и большим объёмом памяти. Переходите к самостоятельному размещению только после измерений, подтверждающих, что контроль и приватность оправдывают расходы на инфраструктуру.