AIREITER
ДОКИ APIЦЕНЫ
ШАБЛОНЫ
  • AIReiter
  • Блог
  • Бесплатные квоты LLM API: сравнение 11 провайдеров (2026)

Бесплатные квоты LLM API: сравнение 11 провайдеров (2026)

Последнее обновление: 2026-09-08 08:44:31

Бесплатные LLM API: главное в одной таблице

Данные в этой сводке проверены 8 сентября 2026 года. Лимиты зависят от модели, аккаунта, региона и текущей нагрузки, поэтому окончательным источником всегда остаётся документация провайдера по ссылке.

Сведения о карте, коммерческом использовании и совместимости с OpenAI дополнительно сверены со сравнением Free LLM API Hub.

ПровайдерБесплатный доступ и заявленная квотаУсловия оплатыФормат APIЧто говорят условияГлавный нюанс
Google AI StudioЛимиты Gemini зависят от модели: 5–30 RPM и 15–1,000 RPD; пример для Gemini 2.5 Flash: 10 RPM / 250 RPDКарта не указана; могут потребоваться проверка аккаунта и проектаВ проверенном сравнении заявлена совместимость с OpenAIКоммерческое использование указано как допустимое; уточняйте актуальные условияGoogle рекомендует смотреть действующие лимиты в AI Studio
GroqДля qwen/qwen3.6-27b: 30 RPM / 1,000 RPD / 8,000 TPM / 200,000 TPDFree Plan не требует перехода на платный тариф; для Developer tier нужен способ оплатыДа, в основномКоммерческое использование указано как допустимое; лимиты Free Plan отличаются от платной ёмкостиЛимиты действуют на уровне организации и модели
OpenRouterБесплатные варианты: 20 RPM / 50 RPD, пока куплено менее $10 кредитов; 1,000 RPD после покупки кредитов минимум на $10Базовый бесплатный маршрут работает без карты; кредиты открывают более высокий лимитДа, нормализован под OpenAI Chat APIКоммерческое использование указано как допустимое; доступность бесплатных моделей меняетсяПовышенный дневной лимит доступен только после покупки
Cloudflare Workers AI10,000 Neurons/day на весь аккаунт; сброс в 00:00 UTCБазовая квота бесплатна; для отдельных моделей требуется платёжный биллингВ проверенном сравнении заявлена совместимость с OpenAIКоммерческое использование указано как допустимое; доступность зависит от моделиNeurons — это вычислительные ресурсы, а не фиксированная квота токенов
Cerebras InferenceFree Trial: 5 RPM / 30K uncached TPM / 90K total TPM / 1M TPD для перечисленных моделейТребуется подтверждённый способ оплатыВ приведённой документации не установленоПробный доступ; кредиты сгорают через 30 днейПробный кредит $5 не является постоянной квотой
SambaNova CloudFree Tier: 20 RPM / 20 RPD / 200,000 TPD для перечисленных моделейНа Free Tier способ оплаты не нужен; его привязка включает платный Developer TierДа, но с документированными отличиямиКоммерческое использование указано как допустимое; проверяйте условия конкретной моделиЛимит в 20 RPD очень строгий
Cohere1,000 calls/month; Chat — 20 RPM, Embed — 2,000 inputs/min, Rerank — 10 RPMВ проверенном сравнении карта не указана; уточняйте при регистрацииВ проверенном сравнении заявлена совместимость с OpenAIВ проверенном сравнении — только для оценкиВызовы нельзя напрямую приравнивать к токенам
Z.AIДля GLM-4.7-Flash и GLM-4.5-Flash указана стоимость $0 в отображаемых категориях токенов; публичные RPM/TPM не приведеныВ проверенном сравнении карта не указанаВ проверенном сравнении заявлена совместимость с OpenAIКоммерческое использование указано как допустимое; проверьте условия модели$0 за токен не раскрывает реальную доступную ёмкость
NVIDIA NIMБесплатные Inference Endpoints для прототипирования; на главной странице нет универсальной квотыУсловие оплаты зависит от endpoint; проверяйте страницу моделиВ приведённой документации не установленоНа указанной странице есть сигнал о прототипировании/оценкеПометка «бесплатно» на лендинге не равна опубликованной квоте
Hugging Face Inference ProvidersПользователям Free выдаётся $0.10/month в кредитах; сумма может меняться, RPM/TPM не опубликованыУсловие по карте не указано в официальной ценовой документацииВ проверенном сравнении заявлена совместимость с OpenAIПроверяйте условия провайдера и моделиЭто небольшой кредит, а не квота на число запросов
Mistral StudioРежим Free mode в Studio; на главной странице документации нет публичной квотыУсловие по карте на главной странице не указаноДокументирован endpoint в стиле OpenAI, но полная совместимость не заявленаЕсть сигнал о режиме знакомства/оценки; проверяйте условияFree mode не доказывает ни безлимитность, ни готовность доступа для продакшена

Не сортируйте эти строки по самому большому числу. Запросы, токены, вызовы, доллары и Neurons — разные единицы измерения, а одноразовый триал с истекающим сроком — не то же самое, что регулярно возобновляемая квота.

Для изображений, речи, эмбеддингов и других модальностей смотрите более широкое сравнение бесплатных AI API. Здесь речь только о хостинговом LLM-инференсе.

Где бесплатный доступ наиболее понятен и не требует карты

Google AI Studio: практичный старт для универсальных задач

В официальной документации Google по rate limits сказано, что квоты Gemini определяются моделью и проектом. Среди типичных измерений указаны RPM, input TPM и RPD; квота привязана к проекту Google Cloud, а не к каждому API-ключу. Актуальные значения Google предлагает проверять непосредственно в AI Studio. Дневные лимиты запросов сбрасываются в полночь по тихоокеанскому времени.

Во вторичном проверенном сравнении для Gemini 2.5 Flash приведены 10 RPM и 250 RPD, а разброс между моделями составляет 5–30 RPM и 15–1,000 RPD. Используйте эти цифры для предварительной оценки: Google предупреждает, что текущие лимиты меняются и не гарантируются.

Gemini хорошо подходит для универсальных и мультимодальных прототипов, но дневной лимит конкретной модели может стать узким местом при большом числе запросов.

Groq: самый сильный вариант без карты по опубликованной квоте запросов

В документации Groq по rate limits ограничения перечислены по моделям и организациям. В текущей строке Free Plan для qwen/qwen3.6-27b указаны 30 RPM, 1,000 RPD, 8,000 TPM и 200,000 TPD. Для других моделей дневные и токенные потолки отличаются.

«Лимиты скорости применяются на уровне организации, а не отдельных пользователей». — документация Groq по rate limits

Несколько API-ключей не создают отдельную ёмкость для организации. В документации Groq описаны заголовки retry-after и x-ratelimit-*, которые помогают корректно обрабатывать HTTP 429.

Groq — наиболее очевидный выбор для частых небольших запросов, если выбранная модель решает вашу задачу. Смотрите строку именно нужной модели: у провайдера нет одной общей квоты для всего каталога.

OpenRouter: самый гибкий шлюз к бесплатным моделям

OpenRouter даёт единый API к меняющемуся набору бесплатных вариантов моделей. В актуальном сравнении бесплатного доступа указаны 20 запросов в минуту и 50 запросов в день, если за аккаунтом закреплено менее $10 купленных кредитов. После покупки кредитов за всё время на сумму не менее $10 дневной лимит повышается до 1,000 запросов. То есть для увеличенной квоты нужна покупка.

В официальной документации по лимитам сказано, что дополнительные аккаунты или API-ключи не меняют глобальные ограничения платформы. Информация о квоте доступна через endpoint ключа и заголовки ошибок rate limit.

Можно жёстко выбрать модель суффиксом :free либо использовать openrouter/free, автоматически подбирающий доступную бесплатную модель. Роутер умеет отбирать модели по возможностям, например tool calling или пониманию изображений, но базовая модель при этом может измениться.

OpenRouter стоит выбирать для экспериментов и резервной маршрутизации, а не для приложения, которому критично стабильное поведение одной бесплатной модели.

Cloudflare Workers AI: регулярная вычислительная квота, а не бесплатные токены

На официальной странице цен Cloudflare каждому аккаунту выделяется 10,000 Neurons в день без оплаты. Лимит общий для всей активности Workers AI и сбрасывается в 00:00 UTC. В плане Workers Free дальнейшие операции после исчерпания квоты завершаются ошибкой.

Neuron отражает объём GPU-вычислений, необходимый для запроса. Cloudflare публикует эквиваленты в токенах для конкретных моделей, а не обещает, что 10,000 Neurons соответствуют фиксированному числу промптов.

Cloudflare также указывает, что для некоторых новых моделей DeepSeek, GLM и Kimi требуется платёжный биллинг. Формулировка «10,000 Neurons бесплатно» не означает, что любая модель доступна без подключения оплаты.

Бесплатно, но с важными ограничениями

Cerebras: полезный триал, а не постоянный бесплатный API

В документации Cerebras по rate limits для моделей Free Trial указаны 5 RPM, 30,000 uncached TPM, 90,000 total TPM и 1 million TPD. Там же объясняется, что token bucket пополняется непрерывно, а не ожидает обычного ежедневного сброса.

Новым аккаунтам начисляют $5 бесплатных кредитов, они истекают через 30 дней, а для активации Playground и API нужен подтверждённый способ оплаты. Когда кредит заканчивается или истекает, доступ прекращается, пока вы не купите ещё кредиты. В проверенной документации не описана постоянно возобновляемая публичная бесплатная квота.

Cerebras подойдёт для короткой оценки сервиса. Но он не должен быть единственной зависимостью проекта, который обязан работать после окончания триала.

SambaNova Cloud: чёткая граница между бесплатным и платным биллингом

SambaNova определяет Free Tier через статус биллинга: он действует, пока способ оплаты не привязан. Для перечисленных моделей Free Tier официальная документация указывает 20 RPM, 20 RPD и 200,000 TPD. Лимит в 20 RPD способен остановить интенсивно опрашивающий сервис раньше, чем будет израсходована токенная квота.

Привязка способа оплаты активирует Developer Tier — это платный тариф, и считать его бесплатным нельзя. SambaNova также передаёт в заголовках ответа данные об оставшихся запросах и времени сброса.

Используйте SambaNova только для низкообъёмных proof of concept: потолок 20 RPD нужно проверить до запуска любого агентного сценария.

Cohere: полезен для RAG, но вызовы нужно считать отдельно

Пробный ключ Cohere — не бесплатный тариф с токенной квотой. В актуальном проверенном сравнении указаны 1,000 calls/month, а также лимиты отдельных endpoint: 20 RPM для Chat, 2,000 inputs per minute для Embed и 10 RPM для Rerank. В FAQ Cohere пробные ключи описаны как бесплатные, но ограниченные.

Такой набор удобен для экспериментов с retrieval-augmented generation: в одном проекте можно протестировать генерацию, эмбеддинги и реранжирование. Но триал не становится от этого высоконагруженным backend для чата. Не сопоставляйте напрямую 1,000 calls/month и 1 million tokens/day.

В проверенном сравнении триал помечен как доступный только для оценки. Перед использованием в публичном или коммерческом приложении уточните действующую политику использования.

Z.AI: бесплатная цена не означает известную квоту

В ценовой документации Z.AI модели GLM-4.7-Flash и GLM-4.5-Flash обозначены как бесплатные в показанных категориях токенов. Но на проверенной публичной странице цен нет конкретных значений RPM, RPD, TPM или TPD.

Считайте квоту Z.AI неизвестной: сервис может подойти для ручного тестирования, но не для пакетной обработки. При регистрации проверьте endpoint, доступность модели и условия использования.

NVIDIA, Hugging Face и Mistral: варианты для знакомства без полной информации о квотах

ПровайдерПризнак бесплатного доступаКаких публичных данных не хватаетПрактическое применение
NVIDIA NIMБесплатные Inference Endpoints для прототипированияНа лендинге нет универсальных RPM, токенной квоты, правила по карте или цены за превышениеПротестируйте выбранный endpoint, затем изучите условия конкретной модели
Hugging Face Inference Providers$0.10/month кредитов для пользователей Free; сумма может менятьсяНет сопоставимой квоты RPM или TPMНебольшие эксперименты с моделями через маршрутизацию без управления GPU-инфраструктурой
Mistral StudioРежим Free mode в Studio и быстрые старты APIНа главной странице документации нет квоты или правила по картеПознакомьтесь с возможностями Mistral API до перехода на платную конфигурацию

Какой бесплатный LLM API выбрать?

ПриоритетС чего начатьПочему
Универсальный прототипGoogle AI StudioGemini даёт понятную базу для широкого круга задач, а действующие лимиты видны в AI Studio
Частые небольшие запросыGroqОпубликованы строки Free Plan для конкретных моделей и есть пример с 1,000 RPD
Много моделей через единый APIOpenRouterБесплатные варианты, маршрутизация и интерфейс в стиле OpenAI
Приложение в экосистеме CloudflareWorkers AIРегулярная квота 10,000 Neurons/day
Наибольшая заявленная токенная квота в триалеCerebrasДо 1M TPD, но только в 30-дневном триале с обязательной картой
Строгий сценарий без способа оплатыСначала Groq; SambaNova — только для очень малого объёмаУ Free Tier SambaNova потолок составляет 20 RPD
Компоненты для RAGCohereChat, Embed и Rerank работают в одной экосистеме пробного ключа
Тестирование GLM FlashZ.AIУказанная цена токенов — $0, но публичная квота неизвестна
Знакомство с open-моделями без GPUHugging FaceМаршрутизируемый доступ и $0.10/month для пользователей Free

Начните с одного провайдера и записывайте для каждого запроса четыре поля: ID модели, HTTP-статус, расход токенов и заголовки оставшегося лимита. Второго провайдера добавляйте только после того, как поймёте, в какой лимит упирается первый маршрут: несколько ключей не обязательно увеличивают доступную ёмкость.

Что проверить перед использованием бесплатного LLM API

Перед запуском убедитесь в пяти вещах:

  1. Единица квоты: предложение измеряется запросами, токенами, вызовами, долларами или вычислительными единицами?
  2. Механика сброса: лимит обновляется на границе UTC или тихоокеанского времени, пополняется непрерывно, продлевается раз в месяц или сгорает один раз?
  3. Область действия: ограничение привязано к модели, проекту, аккаунту или организации?
  4. Условие оплаты: привязка карты даёт больше ёмкости, включает платный тариф или обязательна для триала?
  5. Условия и сценарий отказа: доступ ограничен тестированием или оценкой, и умеет ли клиент обрабатывать HTTP 429 без лавины повторных запросов?

FAQ: бесплатные LLM API

Какой бесплатный LLM API лучший в целом?

Google AI Studio подходит для универсальных прототипов, Groq — для более высокого бесплатного объёма запросов, а OpenRouter — для работы с разнообразными моделями.

Можно ли использовать бесплатный LLM API без банковской карты?

Да. В проверенном сравнении Google, Groq, базовый маршрут OpenRouter, базовая квота Cloudflare и Free Tier SambaNova указаны как варианты без карты. Для Free Trial Cerebras требуется подтверждённый способ оплаты.

Бесплатные LLM API действительно доступны постоянно?

Некоторые регулярно возобновляемые тарифы действуют, пока сохраняются их условия. Но триалы, промо-цены и меняющиеся маршруты :free не являются постоянной квотой, гарантированной для всего провайдера. Перед тем как зависеть от одного сервиса, проверяйте текущую документацию и статус модели.

Можно ли использовать бесплатный LLM API в продакшене?

Не делайте его единственным backend, если действующие условия, квота и доступность модели не соответствуют требованиям вашего продакшена.

Что произойдёт при достижении бесплатного лимита?

Обычно провайдер вернёт ошибку троттлинга или превышения квоты. Groq документирует обработку HTTP 429, Cloudflare сообщает об отказе дальнейших операций после исчерпания дневной квоты Free plan, а Cerebras прекращает доступ к триалу, когда кредит заканчивается или истекает.

>_Каталог моделей AIReiter

Быстрый API-доступ к моделям, связанным с этим гайдом

Gemini 3.6 Flash

Chat

Быстрая модель Gemini для продвинутых рассуждений, программирования и agentic-задач.

GoogleСоздать API Key >

Gemini 2.5 Pro

Chat
GoogleСоздать API Key >

Claude Fable 5

Chat

Премиальная модель Claude для глубокого рассуждения и сложной объемной работы.

AnthropicСоздать API Key >

Claude Fable 5.1

Chat

Mythos-class model for long-horizon coding, research, and knowledge work.

AnthropicСоздать API Key >

Claude Opus 4.8

Chat

Высокопроизводительная модель Claude для сложных задач, требующих глубоких рассуждений и профессиональной работы.

AnthropicСоздать API Key >

Недавние статьи

Как подключить DeepSeek к Janitor AI: настройка 2026

2026-09-08

Цены API Muse Spark 1.3: Standard против Contributor

2026-09-08

Обзор API GPT-6 Astra (2026): для агентов, а не простой замены

2026-09-07

Kling API: официальный доступ и агрегаторы — руководство по интеграции (2026)

2026-09-07
AIREITER

Есть вопросы? Свяжитесь с нами
[email protected]

新速率有限公司NEWRATE LIMITED香港九龍花園街 2-16 號好景商業中心 2304 室Room 2304, Haojing Commercial Center, 2-16 Garden Street, Kowloon, Hong Kong

LLM

GPT-6 AstraGemini 3.8 FlashClaude Fable 5.1GLM-5.3 FlashGemini 3.6 Flash

AI-видео

Gemini Omni 1.1 Flash ExtMiniMax H3Kling 3.0 Motion ControlKling 3.0 TurboKling 3.0

AI-изображения

Grok Imagine Image 2.0Midjourney V8.1Midjourney V7Z-Image TurboKrea 2 Turbo

Блог

Посмотреть все →

Компания

Политика конфиденциальностиУсловия обслуживанияПолитика возврата

© 2026 AIReiter. Все права защищены.