AIREITER

Prime Inference: цены и API-гид (2026)

Последнее обновление: 2026-10-03 07:29:09

Prime Inference уже работает: это OpenAI-совместимый сервис для стабильного агентного трафика, а не очередной анонс будущего продукта. Но с прозрачностью цен есть нюанс. В запусковом посте Prime Intellect подробно рассказывает о своей инфраструктуре, тогда как полный прайс по моделям сейчас проще найти в актуальных каталогах, чем на привычной официальной странице с тарифами.

Страница запуска Prime Inference от Prime Intellect

Prime Inference уже запущен, а цены приходится сверять в нескольких местах

Prime Intellect официально представила Prime Inference 2 октября 2026 года. В продукт входят serverless-эндпоинты для неравномерной нагрузки и зарезервированные мощности для постоянных задач. Публичный API отделён от парка моделей: мощности могут переключаться или выходить из строя без изменения клиентского эндпоинта.

Это полноценный продакшен-релиз, а не лист ожидания. По данным Prime Intellect, первая публичная развёртка — GLM-5.3 — появилась на OpenRouter 22 сентября, а прямые клиенты могут подключать OpenAI-совместимые SDK к https://api.pinference.ai/api/v1.

С тарифами ситуация простая: на официальной странице запуска обещаны единый биллинг и отслеживание потребления на уровне команд, но полной таблицы ставок там нет. Поэтому перед фиксацией бюджета цены конкретных моделей нужно проверять в авторизованной панели или через endpoint моделей. Публичные каталоги полезны как снимок текущей ситуации, но не заменяют договорную оферту.

Сколько сейчас стоит Prime Inference

В Prime Inference цены зависят от модели и фактического потребления. Входные и выходные токены тарифицируются отдельно; выход может стоить в несколько раз дороже входа. Поэтому низкая цена за входные токены способна создать обманчивое впечатление в кодовых агентах и reasoning-сценариях с длинными ответами.

Ниже — снимок цен на 3 октября 2026 года из каталога Prime Intellect на endpoints.run, где было указано 64 эндпоинта. Перед покупкой обязательно сверяйте каждую ставку у Prime Intellect.

ID моделиВход / 1 млн токеновВыход / 1 млн токеновУказанный контекстОптимальное применение
meta-llama/Llama-3.2-1B-Instruct$0.03$0.2060KКлассификация и простое извлечение данных
qwen/qwen3.7-flash$0.03$0.131MНедорогие универсальные задачи с длинным контекстом
z-ai/glm-5.3-flash$0.15$0.501MБыстрые агентные сценарии и работа с инструментами
qwen/qwen3-coder-next$0.30$1.50262KПрограммирование и использование инструментов
deepseek/deepseek-v4.1-flash$0.30$1.201MРассуждения на длинном контексте и vision-задачи
z-ai/glm-5.3$1.40$4.401MФлагманские агентные нагрузки GLM
deepseek/deepseek-v4-pro$1.91$3.831MПродвинутые задачи на рассуждение
moonshotai/kimi-k3$3.45$17.251MПремиальные задачи с длинным контекстом

Другой каталог, Compute Prices, в тот же день показывал 111 моделей и точный минимум $0.027 за миллион входных токенов для Llama 3.2 1B. Расхождение в количестве позиций — ещё один повод запрашивать актуальные данные через API, а не считать инвентарь любого каталога постоянным: в списки могут попадать разные пространства имён, gateway-модели, да и обновляются сервисы в разное время.

Три примера расчёта расходов

Стоимость токенов можно оценить по формуле:

(входные токены ÷ 1,000,000 × ставка за вход) + (выходные токены ÷ 1,000,000 × ставка за выход)

Месячная нагрузкаМодель и объём токеновОценка счёта за токены
Лёгкий бот поддержкиQwen3.7 Flash; 50M входных + 10M выходных$2.80
Кодовый агентQwen3 Coder Next; 100M входных + 40M выходных$90.00
Флагманский агент с большим объёмом генерацииGLM-5.3; 200M входных + 100M выходных$720.00

В этих расчётах учтены только опубликованные тарифы за токены. Сюда не входят контракты на зарезервированные мощности, выполнение в sandbox, обучение, оценки или аренда GPU. Prime Intellect продаёт их как отдельные сервисы, поэтому итоговый счёт за агента может состоять не только из инференс-токенов.

Поддержка длинного контекста также не означает, что каждый запрос съедает миллион токенов. Оплата зависит от фактически обработанного объёма. Но если агент раз за разом отправляет историю на 140K токенов, расходы на вход быстро вырастут — если prefix caching или управление контекстом на стороне приложения не сократят повторную работу.

Для подключения API достаточно сменить endpoint

Prime Inference предоставляет OpenAI-совместимый endpoint, поэтому в существующей интеграции через OpenAI SDK обычно достаточно заменить base URL, API-ключ и идентификатор модели. В запусковом посте Prime Intellect указан base URL: https://api.pinference.ai/api/v1.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_PRIME_API_KEY",
    base_url="https://api.pinference.ai/api/v1",
)

response = client.chat.completions.create(
    model="z-ai/glm-5.3",
    messages=[
        {"role": "user", "content": "Write a haiku about KV caches."}
    ],
    stream=False,
)

print(response.choices[0].message.content)

Эквивалентный запрос через cURL:

curl https://api.pinference.ai/api/v1/chat/completions \
  -H "Authorization: Bearer $PRIME_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "z-ai/glm-5.3",
    "messages": [
      {"role": "user", "content": "Write a haiku about KV caches."}
    ]
  }'

Prime Intellect также описывает вариант с CLI: установите инструмент prime, авторизуйтесь командой prime login, затем запустите prime inference chat. Перед развёртыванием получите актуальный список моделей и скопируйте точный ID: префиксы в разных каталогах различаются.

Что архитектура запуска меняет для агентных нагрузок

Сильнее всего Prime Inference выделяется в сценариях с длинными промптами, повторными сессиями и вызовами инструментов, которые должны оставаться валидными. Prime Intellect утверждает, что типичный внутренний ход агента добавляет около 6K токенов к промпту на 140K токенов. В такой ситуации удержание кэша и маршрутизация не менее важны, чем чистая скорость декодирования.

В официальном отчёте о запуске приведён ряд конкретных измерений для развёртки GLM-5.3 на оборудовании GB200 NVL72:

  • Разделение воркеров prefill и decode сократило p90-латентность между токенами почти на 40% в тестах Prime Intellect.
  • При цели в 100 сквозных токенов в секунду на пользователя протестированная топология prefill/decode 1:4 обслуживала 66 сессий на группу prefill при 101 токене в секунду на пользователя.
  • Снижение бюджета prefill с 8K до 4K токенов на GPU уменьшило медианное ожидание в очереди с 550 мс до 110 мс и сократило медианное время до первого токена примерно на 20%.
  • Сжатие NVFP4 увеличило ёмкость кэша с 1.09 млн до 1.63 млн кэшированных токенов на декодер — примерно на 50% — при том же бюджете памяти.
  • Блочно-ориентированная раскладка кэша сократила число дескрипторов передачи примерно в 10 раз, а среднее время передачи — со 146 мс до 78 мс в отдельном сравнении TP8.

Эти цифры зависят от нагрузки и конфигурации, а не являются универсальной гарантией задержек. Их практическая ценность в другом: Prime Intellect открыто показывает, какие узкие места оптимизировала — повторное использование кэша в возвращающихся сессиях, задержку допуска, взаимное влияние prefill и decode, а также накладные расходы на перенос кэша.

Вызовы инструментов стоит тестировать отдельно. Prime Intellect обнаружила случаи, когда необъявленные инструменты молча отбрасывались, а аргументы получали неверные типы, после чего добавила constrained decoding и проверки схем в путь обслуживания GLM. Компания сообщает о почти нулевой частоте ошибок tool call, но перед переводом продакшен-трафика покупателям всё равно стоит прогнать собственные вложенные схемы, nullable-аргументы, потоковые вызовы и некорректные запросы.

Serverless или зарезервированные мощности: выбор зависит от профиля трафика

Для большинства команд разумнее начать с serverless: неопределённый спрос превращается в расходы за токены. Зарезервированные мощности становятся актуальны, когда постоянная конкурентная нагрузка, предсказуемая задержка или кастомное развёртывание важнее, чем отсутствие платы за простаивающие ресурсы.

НагрузкаОптимальный стартовый вариантПочему
Прототип или чат-бот с нерегулярной активностьюServerlessНе нужно резервировать простаивающие GPU
Пакетные задачи оценки со всплесками нагрузкиПока serverlessПакетный и асинхронный инференс по сниженной цене обозначен в roadmap, а не заявлен как функция текущего запуска
Стабильный агентный сервис с высокой конкуренциейЗапросить предложение на резервированиеПланирование ёмкости может быть важнее номинальных ставок за токены
Дообученная или LoRA-модельСначала подтвердить доступностьРазвёртывание дообученных моделей на выделенных мощностях в один клик описано в запусковом посте как работа из roadmap
Строгий договорный SLA или требование к регионуОбсуждение с продажамиВ публичных материалах запуска нет универсального контракта, матрицы регионов или стандартной цены на резервирование

Не стоит считать, что «резервирование» автоматически обойдётся дешевле. Сопоставьте предложенную стоимость мощностей с измеренными расходами на serverless при характерной конкуренции, учитывая простой и запас на пиковую нагрузку.

Что Prime Intellect пока не раскрывает достаточно ясно

Prime Inference необычно подробно раскрывает инфраструктурные детали, но в доступных публичных индексируемых материалах всё ещё не хватает нескольких важных для закупки сведений:

  • полной официальной таблицы ставок по моделям;
  • правил тарификации кэшированного ввода и reasoning-токенов для каждой модели;
  • публичных лимитов по запросам и конкурентности;
  • карты обработки данных по регионам;
  • стандартных условий хранения данных инференс-запросов;
  • универсального формального SLA и компенсаций;
  • минимальных сроков и цен для зарезервированных мощностей;
  • информации о том, какие позиции каталога хостятся непосредственно Prime, а какие являются маршрутизируемыми gateway-моделями.

Отсутствие информации не означает, что функция не поддерживается. Это означает лишь, что такие пункты следует подтверждать в панели управления, документации, endpoint моделей, договоре или ответе отдела продаж, а не выводить из одной лишь OpenAI-совместимости.

FAQ по Prime Inference

Prime Inference официально доступен?

Да. Prime Intellect объявила о публичном запуске 2 октября 2026 года и опубликовала базовый URL API, CLI-команду, а также разделение продукта на serverless и резервируемые мощности.

Есть ли у Prime Inference бесплатный тариф?

В публичном запусковом посте не упоминаются бесплатные кредиты Prime Inference. В других частях обучающего стека Prime Intellect есть бесплатные или нулевые по цене варианты, но считать их бесплатным тарифом инференса нельзя.

Совместим ли Prime Inference с OpenAI SDK?

Да. Укажите OpenAI-совместимый base URL https://api.pinference.ai/api/v1, передайте Prime API key и используйте доступный на данный момент ID модели.

Поддерживает ли Prime Inference tool calling?

Путь обслуживания GLM-5.3 поддерживает tool calling, а Prime Intellect описывает grammar enforcement и регрессионные тесты для схем аргументов. Возможности следует всё же проверять для каждой модели отдельно, поскольку они различаются.

Сколько моделей доступно?

Публичные каталоги показывали 64 и 111 позиций на 3 октября 2026 года. Поскольку цифры не совпадают, надёжным источником списка моделей, доступных конкретному аккаунту, остаётся актуальный Prime endpoint или панель управления.

Prime Inference дешевле аренды GPU?

Serverless обычно проще оправдать при переменном трафике; арендуемые или зарезервированные GPU могут стать выгоднее при высокой и стабильной загрузке. Ответ зависит от измеренного числа токенов, конкурентности, целевых задержек и простаивающей ёмкости, а не только от цены токена.

Пятиминутная проверка перед решением

Prime Inference стоит протестировать командам, которым нужен доступ к открытым моделям, обслуживание агентов с длинным контекстом или путь из обучающего стека Prime Intellect в продакшен. Но закупать сервис вслепую, опираясь только на публичный прайс, пока рано.

  1. Запросите актуальный список моделей и зафиксируйте точные ставки за вход, выход, кэш и reasoning.
  2. Воспроизведите характерный длинный диалог и измерьте задержку до первого токена, скорость генерации и общее число тарифицированных токенов.
  3. Прогоните реальные схемы инструментов приложения в потоковом и непотоковом режимах.
  4. Если нагрузка чувствительна, запросите условия хранения данных, регионов, лимитов, SLA и резервируемых мощностей.
  5. Сравнивайте измеренные serverless-расходы с предложением на резервирование только после наблюдения за обычным и пиковым трафиком.

Главный компромисс понятен: Prime Inference предлагает убедительную инженерию инференса и API с низким порогом входа, но для проверки цен и контрактных условий придётся сделать ещё один шаг сверх того, что даёт сама страница запуска.