AIREITER

GLM-5.3-Flash API: цены, кэш, хостинг и ограничения

Последнее обновление: 2026-08-28 04:14:54

Цена $0.15 за миллион входных токенов — лишь отправная точка для GLM-5.3-Flash. На итоговый счёт влияют попадания в кэш, объём генерации, обязательный reasoning и чекпойнт примерно на 320B параметров. Именно эти факторы определяют, что практичнее для конкретного внедрения: API или самостоятельный запуск весов.

Актуальные тарифы GLM-5.3-Flash

На официальной странице тарифов Z.AI для GLM-5.3-Flash указаны $0.15 за 1 миллион входных токенов, $0.03 за 1 миллион кэшированных входных токенов и $0.50 за 1 миллион выходных токенов. Там же действует временная скидка 50%, которая заканчивается 9 сентября 2026 года в 24:00 по UTC+8, сингапурскому времени.

Статья расходов GLM-5.3-FlashБазовая цена / 1M токеновЦена по акции / 1M токенов
Новый входной текст$0.15$0.075
Кэшированный входной текст$0.03$0.015
Выходные токены$0.50$0.25
Хранение кэшированного вводаБесплатно в течение ограниченного периодаБесплатно в течение ограниченного периода
Сравнение цен API GLM-5.3-Flash для входных, кэшированных входных и выходных токенов

Скидку 50% стоит считать временной промоакцией, а не основой для долгосрочного production-бюджета. В анонсе запуска Z.AI также указывает, что ox-alpha был прежним preview-идентификатором модели.

В той же официальной таблице обычная GLM-5.3 стоит $1.40 за входные токены, $0.26 за кэшированный ввод и $4.40 за выход — всё за 1 миллион токенов. По базовым тарифам Flash примерно на 89% дешевле и на входе, и на выходе. Но это сравнение цен, а не утверждение о равном качестве, задержках или эксплуатационных свойствах двух моделей.

Что именно вы получаете: API, а не компактную локальную модель

GLM-5.3-Flash — мультимодальная open-weight модель под лицензией MIT: всего 320B параметров, из которых на каждый токен активно 18B. В официальной карточке модели на Hugging Face описаны публичный чекпойнт zai-org/GLM-5.3-Flash и варианты локального сервинга. В материалах к релизу Z.AI заявлены контекстное окно в 1 миллион токенов и приём текста, изображений и видео.

Показатель «18B active» означает объём вычислений выбранных экспертов, а не требуемую память для всей модели. При локальном запуске решающими остаются полный весовой файл, KV-кэш, накладные расходы рантайма, мультимодальная обработка и длина контекста.

Способ доступаЧто даётГлавное ограничение
Z.AI APIХостинговый инференс с оплатой за входные, кэшированные входные и выходные токеныЛимиты аккаунта и задержка reasoning
Официальный чекпойнтВеса под лицензией MIT для самостоятельного хостинга или адаптацииИнфраструктура с большим объёмом памяти, зависящим от точности и квантования
Квантованная сборка сообществаФайлы меньшего размера для некоторых локальных рантаймовКачество сборки, поддержка модальностей, скорость и совместимость могут различаться

Низкая цена токенов и низкая стоимость хостинга — не одно и то же. При API расходы появляются по мере всплесков трафика, а self-hosting требует держать вычислительные мощности зарезервированными даже в периоды простоя.

Как считается счёт API в реальных сценариях

Стоимость GLM-5.3-Flash складывается из нового ввода, распознанного кэшированного ввода и сгенерированного вывода:

cost = (new_input_tokens / 1,000,000 × input_rate)
     + (cached_input_tokens / 1,000,000 × cached_rate)
     + (output_tokens / 1,000,000 × output_rate)

По базовому тарифу 10 миллионов новых входных токенов и 2 миллиона выходных обойдутся в $2.50: $1.50 за ввод и $1.00 за вывод. Во время акции тот же объём стоит $1.25.

НагрузкаРасчёт по базовому тарифуИтого по базовому тарифуИтого по акции
10M нового ввода + 2M вывода$1.50 + $1.00$2.50$1.25
2M нового ввода + 8M кэшированного ввода + 2M вывода$0.30 + $0.24 + $1.00$1.54$0.77
100K нового ввода + 10K вывода$0.015 + $0.005$0.020$0.010

Указанная Artificial Analysis смешанная цена $0.10 за миллион основана на конкретном соотношении: 7:2:1 для кэш-попаданий, входных и выходных токенов. Это полезный ориентир для сопоставимой нагрузки, но не универсальный тариф GLM-5.3-Flash.

Экономия на кэше появляется только при фактическом cache hit. В схеме ответа Chat Completion от Z.AI есть поле usage.prompt_tokens_details.cached_tokens. Поэтому в production-учёте стоит записывать именно его, а не считать, что похожие повторяющиеся промпты автоматически получат скидку. Один из участников r/opencodeCLI так описал экономику на старте:

«There's a 50% discount offer until September 9th, and its context consumption is much better than in dsv4f...» — u/CriteriumA, обсуждение на Reddit

Дату окончания скидки подтверждает тарифная сетка Z.AI; сравнение с другой моделью и пользовательский опыт остаются мнением автора комментария. Стабильный повторяющийся контекст способен повысить использование кэша, но не отменяет расходы на вывод, повторы запросов, инструменты и лимиты аккаунта.

Короткая таблица для планирования бюджета

В прогнозе лучше выделить четыре отдельные строки: новый ввод, кэшированный ввод, вывод и платные инструменты. Z.AI указывает цену Web Search в $0.01 за использование, поэтому частые поисковые вызовы агента могут превысить оценку, рассчитанную только по токенам.

Предположение по месячному использованиюФормула по базовому тарифуРасход за месяц
100M нового ввода + 20M вывода100 × $0.15 + 20 × $0.50$25.00
20M нового ввода + 80M кэшированного ввода + 20M вывода20 × $0.15 + 80 × $0.03 + 20 × $0.50$23.40
100 вызовов Web Search100 × $0.01$1.00

Это арифметические примеры, а не квота. Повторные запросы и незавершённые запуски агентов нужно учитывать отдельно. При большом объёме генерации реалистичное значение max_tokens и более низкий reasoning_effort, где он уместен, могут повлиять на расходы сильнее, чем оптимизация небольшой части промпта.

Ограничения Z.AI API перед миграцией

Основной base URL официального Z.AI API — https://api.z.ai/api/paas/v4/, а endpoint для чат-комплишенов — https://api.z.ai/api/paas/v4/chat/completions. Для авторизации нужен Bearer API key. В введении в API Z.AI описывает OpenAI-совместимые схемы для Python, Node.js и Java с указанием кастомного base URL.

В текущем справочнике Chat Completion GLM-5.3-FLASH упоминается в описаниях thinking и reasoning, однако в отображаемом enum моделей нет glm-5.3-flash. При этом Flash SKU есть и на официальной странице цен, и в материалах запуска. Перед переводом production-трафика проверьте точный ID хостинговой модели небольшим запросом.

Деталь интеграцииПодтверждённое ограничение
ID хостинговой модели для проверкиglm-5.3-flash; подтвердите, что он принимается текущей схемой вашего аккаунта
Хостинговый endpointhttps://api.z.ai/api/paas/v4/chat/completions
АутентификацияAuthorization: Bearer YOUR_API_KEY
ThinkingВ GLM-5.3-FLASH thinking включён; глубина управляется параметром reasoning_effort
Reasoning effortlow, high или max
Максимальное значение max_tokens131,072 в текущем справочнике параметров
Coding PlanОтдельные ключ, endpoint’ы и система кредитов; это не общий баланс API. См. быстрый старт Coding Plan от Z.AI

Z.AI устанавливает max как уровень reasoning effort по умолчанию. Тариф за токен от выбранного уровня не меняется, однако reasoning может увеличить объём вывода и время ожидания. По лимитам аккаунта Z.AI направляет пользователей в персональную панель rate limits; в публичной документации нет единого числового ограничения для всех API-аккаунтов.

Open weights или хостинговый API

В официальной карточке модели приведены рецепты локального запуска через Transformers, vLLM, SGLang, TokenSpeed и KTransformers. Однако из этих инструкций не следует, что модель практически можно развернуть на потребительском GPU.

Хостинговый API разумнее использовать при нерегулярном трафике или отсутствии оборудования для инференса с большим объёмом памяти. Распределённый либо локальный сервинг стоит рассматривать при стабильной высокой загрузке или когда контроль обработки данных оправдывает операционные расходы. Текстовая сборка с пониженной точностью может не воспроизводить возможности официальной мультимодальной конфигурации.

Когда самостоятельный хостинг начинает окупаться

По оценке GetDeploying, для 4-битного развёртывания нужно около 192 GB GPU-памяти, для 8-битного — примерно 384 GB, для BF16 — 768 GB. Конфигурация на MI300X за $2.90 в час при непрерывной работе оценивается примерно в $2,088 в месяц, а равенство затрат API и self-hosting достигается около 14 миллионов токенов в час при соотношении входа к выходу 5:1.

Это сторонние расчёты, а не гарантии Z.AI по оборудованию. Конфигурация на 192 GB для 4 бит обозначена как работающая на пределе: KV-кэш, накладные расходы рантайма, мультимодальная обработка, батчинг и простой могут сдвинуть точку окупаемости. Перед выбором локального инференса сопоставьте стоимость инфраструктуры в час, загрузку, фактические токены в час, долю cache hit и цену завершённой задачи.

GLM-5.3-Flash и GLM-5.3: где проходит граница выбора

У Flash и стандартной GLM-5.3 разные тарифы и разные сценарии развёртывания.

ВопросGLM-5.3-FlashGLM-5.3
Базовая цена входа$0.15 / 1M$1.40 / 1M
Базовая цена кэшированного ввода$0.03 / 1M$0.26 / 1M
Базовая цена выхода$0.50 / 1M$4.40 / 1M
Временная акцияСкидка 50% до 9 сентября 2026 года по UTC+8Сопоставимая акция для Flash не показана
Open-weight чекпойнтУказан официальный чекпойнт под лицензией MITОтдельная карточка модели; не следует считать веса идентичными
Мультимодальное позиционированиеНативная мультимодальность; Z.AI заявляет ввод изображений и видеоВозможности стандартной GLM-5.3 нужно рассматривать отдельно
Локальное развёртываниеТребуются крупный чекпойнт и сервинг с большим объёмом памятиИспользуйте её собственную документацию по модели и развёртыванию

Сначала выбирайте Flash, если важны цена токенов, мультимодальный ввод или путь с open weights, а приложение допускает принудительный reasoning и ограничения провайдера. К стандартной GLM-5.3 стоит переходить только после замеров: нужно убедиться, что более высокий тариф даёт значимое для приложения преимущество в возможностях или надёжности.

FAQ

Какова текущая цена GLM-5.3-Flash API?

Официальные базовые тарифы составляют $0.15 за вход, $0.03 за кэшированный вход и $0.50 за выход на 1M токенов; временные цены со скидкой 50% приведены в таблице выше.

Кэшированный ввод оплачивается по ставке $0.03?

Да, если Z.AI распознаёт эти токены как кэшированные. Хранение кэшированного ввода отдельно указано как временно бесплатное, поэтому статус хранения и оплату cache hit не стоит смешивать.

GLM-5.3-Flash — это open source?

Точнее называть её open-weight чекпойнтом под лицензией MIT. Лицензия допускает широкое применение, но модели с 320B параметров всё равно требуются существенный объём памяти, совместимое ПО и мощности для сервинга.

Можно ли запустить GLM-5.3-Flash на обычном ноутбуке?

Не как практичное развёртывание в полной точности. Даже сторонние оценки для 4-битной версии говорят примерно о 192 GB GPU-памяти, а 18B активных параметров не убирают затраты на хранение и работу с полным чекпойнтом.

GLM-5.3-Flash быстрее GLM-5.3?

Название «Flash» подтверждает позиционирование по цене и активным вычислениям, но не служит универсальной гарантией задержки. Artificial Analysis сообщает о 48.7 выходных токенах в секунду через Z.AI и 42.57 секунды до первого токена ответа в своей тестовой конфигурации; время reasoning и характер нагрузки могут сильнее влиять на воспринимаемую скорость.

Coding Plan даёт тот же баланс, что и API?

Нет. В быстром старте Coding Plan от Z.AI описаны отдельный ключ Coding Plan, отдельные endpoint’ы и доступ только к официально поддерживаемым инструментам и продуктам. Подписку Coding Plan нельзя напрямую пересчитать в публичный API-бюджет в долларах за токен.

При нерегулярном трафике и уже не оплаченной инфраструктуре API — менее рискованный вариант. Локальный сервинг — это отдельная экономическая модель, зависящая от постоянной загрузки, объёма памяти и требований к контролю данных.