Бесплатные LLM API: главное в одной таблице
Данные в этой сводке проверены 8 сентября 2026 года. Лимиты зависят от модели, аккаунта, региона и текущей нагрузки, поэтому окончательным источником всегда остаётся документация провайдера по ссылке.
Сведения о карте, коммерческом использовании и совместимости с OpenAI дополнительно сверены со сравнением Free LLM API Hub.
| Провайдер | Бесплатный доступ и заявленная квота | Условия оплаты | Формат API | Что говорят условия | Главный нюанс |
|---|---|---|---|---|---|
| Google AI Studio | Лимиты Gemini зависят от модели: 5–30 RPM и 15–1,000 RPD; пример для Gemini 2.5 Flash: 10 RPM / 250 RPD | Карта не указана; могут потребоваться проверка аккаунта и проекта | В проверенном сравнении заявлена совместимость с OpenAI | Коммерческое использование указано как допустимое; уточняйте актуальные условия | Google рекомендует смотреть действующие лимиты в AI Studio |
| Groq | Для qwen/qwen3.6-27b: 30 RPM / 1,000 RPD / 8,000 TPM / 200,000 TPD | Free Plan не требует перехода на платный тариф; для Developer tier нужен способ оплаты | Да, в основном | Коммерческое использование указано как допустимое; лимиты Free Plan отличаются от платной ёмкости | Лимиты действуют на уровне организации и модели |
| OpenRouter | Бесплатные варианты: 20 RPM / 50 RPD, пока куплено менее $10 кредитов; 1,000 RPD после покупки кредитов минимум на $10 | Базовый бесплатный маршрут работает без карты; кредиты открывают более высокий лимит | Да, нормализован под OpenAI Chat API | Коммерческое использование указано как допустимое; доступность бесплатных моделей меняется | Повышенный дневной лимит доступен только после покупки |
| Cloudflare Workers AI | 10,000 Neurons/day на весь аккаунт; сброс в 00:00 UTC | Базовая квота бесплатна; для отдельных моделей требуется платёжный биллинг | В проверенном сравнении заявлена совместимость с OpenAI | Коммерческое использование указано как допустимое; доступность зависит от модели | Neurons — это вычислительные ресурсы, а не фиксированная квота токенов |
| Cerebras Inference | Free Trial: 5 RPM / 30K uncached TPM / 90K total TPM / 1M TPD для перечисленных моделей | Требуется подтверждённый способ оплаты | В приведённой документации не установлено | Пробный доступ; кредиты сгорают через 30 дней | Пробный кредит $5 не является постоянной квотой |
| SambaNova Cloud | Free Tier: 20 RPM / 20 RPD / 200,000 TPD для перечисленных моделей | На Free Tier способ оплаты не нужен; его привязка включает платный Developer Tier | Да, но с документированными отличиями | Коммерческое использование указано как допустимое; проверяйте условия конкретной модели | Лимит в 20 RPD очень строгий |
| Cohere | 1,000 calls/month; Chat — 20 RPM, Embed — 2,000 inputs/min, Rerank — 10 RPM | В проверенном сравнении карта не указана; уточняйте при регистрации | В проверенном сравнении заявлена совместимость с OpenAI | В проверенном сравнении — только для оценки | Вызовы нельзя напрямую приравнивать к токенам |
| Z.AI | Для GLM-4.7-Flash и GLM-4.5-Flash указана стоимость $0 в отображаемых категориях токенов; публичные RPM/TPM не приведены | В проверенном сравнении карта не указана | В проверенном сравнении заявлена совместимость с OpenAI | Коммерческое использование указано как допустимое; проверьте условия модели | $0 за токен не раскрывает реальную доступную ёмкость |
| NVIDIA NIM | Бесплатные Inference Endpoints для прототипирования; на главной странице нет универсальной квоты | Условие оплаты зависит от endpoint; проверяйте страницу модели | В приведённой документации не установлено | На указанной странице есть сигнал о прототипировании/оценке | Пометка «бесплатно» на лендинге не равна опубликованной квоте |
| Hugging Face Inference Providers | Пользователям Free выдаётся $0.10/month в кредитах; сумма может меняться, RPM/TPM не опубликованы | Условие по карте не указано в официальной ценовой документации | В проверенном сравнении заявлена совместимость с OpenAI | Проверяйте условия провайдера и модели | Это небольшой кредит, а не квота на число запросов |
| Mistral Studio | Режим Free mode в Studio; на главной странице документации нет публичной квоты | Условие по карте на главной странице не указано | Документирован endpoint в стиле OpenAI, но полная совместимость не заявлена | Есть сигнал о режиме знакомства/оценки; проверяйте условия | Free mode не доказывает ни безлимитность, ни готовность доступа для продакшена |
Не сортируйте эти строки по самому большому числу. Запросы, токены, вызовы, доллары и Neurons — разные единицы измерения, а одноразовый триал с истекающим сроком — не то же самое, что регулярно возобновляемая квота.
Для изображений, речи, эмбеддингов и других модальностей смотрите более широкое сравнение бесплатных AI API. Здесь речь только о хостинговом LLM-инференсе.
Где бесплатный доступ наиболее понятен и не требует карты
Google AI Studio: практичный старт для универсальных задач
В официальной документации Google по rate limits сказано, что квоты Gemini определяются моделью и проектом. Среди типичных измерений указаны RPM, input TPM и RPD; квота привязана к проекту Google Cloud, а не к каждому API-ключу. Актуальные значения Google предлагает проверять непосредственно в AI Studio. Дневные лимиты запросов сбрасываются в полночь по тихоокеанскому времени.
Во вторичном проверенном сравнении для Gemini 2.5 Flash приведены 10 RPM и 250 RPD, а разброс между моделями составляет 5–30 RPM и 15–1,000 RPD. Используйте эти цифры для предварительной оценки: Google предупреждает, что текущие лимиты меняются и не гарантируются.
Gemini хорошо подходит для универсальных и мультимодальных прототипов, но дневной лимит конкретной модели может стать узким местом при большом числе запросов.
Groq: самый сильный вариант без карты по опубликованной квоте запросов
В документации Groq по rate limits ограничения перечислены по моделям и организациям. В текущей строке Free Plan для qwen/qwen3.6-27b указаны 30 RPM, 1,000 RPD, 8,000 TPM и 200,000 TPD. Для других моделей дневные и токенные потолки отличаются.
«Лимиты скорости применяются на уровне организации, а не отдельных пользователей». — документация Groq по rate limits
Несколько API-ключей не создают отдельную ёмкость для организации. В документации Groq описаны заголовки retry-after и x-ratelimit-*, которые помогают корректно обрабатывать HTTP 429.
Groq — наиболее очевидный выбор для частых небольших запросов, если выбранная модель решает вашу задачу. Смотрите строку именно нужной модели: у провайдера нет одной общей квоты для всего каталога.
OpenRouter: самый гибкий шлюз к бесплатным моделям
OpenRouter даёт единый API к меняющемуся набору бесплатных вариантов моделей. В актуальном сравнении бесплатного доступа указаны 20 запросов в минуту и 50 запросов в день, если за аккаунтом закреплено менее $10 купленных кредитов. После покупки кредитов за всё время на сумму не менее $10 дневной лимит повышается до 1,000 запросов. То есть для увеличенной квоты нужна покупка.
В официальной документации по лимитам сказано, что дополнительные аккаунты или API-ключи не меняют глобальные ограничения платформы. Информация о квоте доступна через endpoint ключа и заголовки ошибок rate limit.
Можно жёстко выбрать модель суффиксом :free либо использовать openrouter/free, автоматически подбирающий доступную бесплатную модель. Роутер умеет отбирать модели по возможностям, например tool calling или пониманию изображений, но базовая модель при этом может измениться.
OpenRouter стоит выбирать для экспериментов и резервной маршрутизации, а не для приложения, которому критично стабильное поведение одной бесплатной модели.
Cloudflare Workers AI: регулярная вычислительная квота, а не бесплатные токены
На официальной странице цен Cloudflare каждому аккаунту выделяется 10,000 Neurons в день без оплаты. Лимит общий для всей активности Workers AI и сбрасывается в 00:00 UTC. В плане Workers Free дальнейшие операции после исчерпания квоты завершаются ошибкой.
Neuron отражает объём GPU-вычислений, необходимый для запроса. Cloudflare публикует эквиваленты в токенах для конкретных моделей, а не обещает, что 10,000 Neurons соответствуют фиксированному числу промптов.
Cloudflare также указывает, что для некоторых новых моделей DeepSeek, GLM и Kimi требуется платёжный биллинг. Формулировка «10,000 Neurons бесплатно» не означает, что любая модель доступна без подключения оплаты.
Бесплатно, но с важными ограничениями
Cerebras: полезный триал, а не постоянный бесплатный API
В документации Cerebras по rate limits для моделей Free Trial указаны 5 RPM, 30,000 uncached TPM, 90,000 total TPM и 1 million TPD. Там же объясняется, что token bucket пополняется непрерывно, а не ожидает обычного ежедневного сброса.
Новым аккаунтам начисляют $5 бесплатных кредитов, они истекают через 30 дней, а для активации Playground и API нужен подтверждённый способ оплаты. Когда кредит заканчивается или истекает, доступ прекращается, пока вы не купите ещё кредиты. В проверенной документации не описана постоянно возобновляемая публичная бесплатная квота.
Cerebras подойдёт для короткой оценки сервиса. Но он не должен быть единственной зависимостью проекта, который обязан работать после окончания триала.
SambaNova Cloud: чёткая граница между бесплатным и платным биллингом
SambaNova определяет Free Tier через статус биллинга: он действует, пока способ оплаты не привязан. Для перечисленных моделей Free Tier официальная документация указывает 20 RPM, 20 RPD и 200,000 TPD. Лимит в 20 RPD способен остановить интенсивно опрашивающий сервис раньше, чем будет израсходована токенная квота.
Привязка способа оплаты активирует Developer Tier — это платный тариф, и считать его бесплатным нельзя. SambaNova также передаёт в заголовках ответа данные об оставшихся запросах и времени сброса.
Используйте SambaNova только для низкообъёмных proof of concept: потолок 20 RPD нужно проверить до запуска любого агентного сценария.
Cohere: полезен для RAG, но вызовы нужно считать отдельно
Пробный ключ Cohere — не бесплатный тариф с токенной квотой. В актуальном проверенном сравнении указаны 1,000 calls/month, а также лимиты отдельных endpoint: 20 RPM для Chat, 2,000 inputs per minute для Embed и 10 RPM для Rerank. В FAQ Cohere пробные ключи описаны как бесплатные, но ограниченные.
Такой набор удобен для экспериментов с retrieval-augmented generation: в одном проекте можно протестировать генерацию, эмбеддинги и реранжирование. Но триал не становится от этого высоконагруженным backend для чата. Не сопоставляйте напрямую 1,000 calls/month и 1 million tokens/day.
В проверенном сравнении триал помечен как доступный только для оценки. Перед использованием в публичном или коммерческом приложении уточните действующую политику использования.
Z.AI: бесплатная цена не означает известную квоту
В ценовой документации Z.AI модели GLM-4.7-Flash и GLM-4.5-Flash обозначены как бесплатные в показанных категориях токенов. Но на проверенной публичной странице цен нет конкретных значений RPM, RPD, TPM или TPD.
Считайте квоту Z.AI неизвестной: сервис может подойти для ручного тестирования, но не для пакетной обработки. При регистрации проверьте endpoint, доступность модели и условия использования.
NVIDIA, Hugging Face и Mistral: варианты для знакомства без полной информации о квотах
| Провайдер | Признак бесплатного доступа | Каких публичных данных не хватает | Практическое применение |
|---|---|---|---|
| NVIDIA NIM | Бесплатные Inference Endpoints для прототипирования | На лендинге нет универсальных RPM, токенной квоты, правила по карте или цены за превышение | Протестируйте выбранный endpoint, затем изучите условия конкретной модели |
| Hugging Face Inference Providers | $0.10/month кредитов для пользователей Free; сумма может меняться | Нет сопоставимой квоты RPM или TPM | Небольшие эксперименты с моделями через маршрутизацию без управления GPU-инфраструктурой |
| Mistral Studio | Режим Free mode в Studio и быстрые старты API | На главной странице документации нет квоты или правила по карте | Познакомьтесь с возможностями Mistral API до перехода на платную конфигурацию |
Какой бесплатный LLM API выбрать?
| Приоритет | С чего начать | Почему |
|---|---|---|
| Универсальный прототип | Google AI Studio | Gemini даёт понятную базу для широкого круга задач, а действующие лимиты видны в AI Studio |
| Частые небольшие запросы | Groq | Опубликованы строки Free Plan для конкретных моделей и есть пример с 1,000 RPD |
| Много моделей через единый API | OpenRouter | Бесплатные варианты, маршрутизация и интерфейс в стиле OpenAI |
| Приложение в экосистеме Cloudflare | Workers AI | Регулярная квота 10,000 Neurons/day |
| Наибольшая заявленная токенная квота в триале | Cerebras | До 1M TPD, но только в 30-дневном триале с обязательной картой |
| Строгий сценарий без способа оплаты | Сначала Groq; SambaNova — только для очень малого объёма | У Free Tier SambaNova потолок составляет 20 RPD |
| Компоненты для RAG | Cohere | Chat, Embed и Rerank работают в одной экосистеме пробного ключа |
| Тестирование GLM Flash | Z.AI | Указанная цена токенов — $0, но публичная квота неизвестна |
| Знакомство с open-моделями без GPU | Hugging Face | Маршрутизируемый доступ и $0.10/month для пользователей Free |
Начните с одного провайдера и записывайте для каждого запроса четыре поля: ID модели, HTTP-статус, расход токенов и заголовки оставшегося лимита. Второго провайдера добавляйте только после того, как поймёте, в какой лимит упирается первый маршрут: несколько ключей не обязательно увеличивают доступную ёмкость.
Что проверить перед использованием бесплатного LLM API
Перед запуском убедитесь в пяти вещах:
- Единица квоты: предложение измеряется запросами, токенами, вызовами, долларами или вычислительными единицами?
- Механика сброса: лимит обновляется на границе UTC или тихоокеанского времени, пополняется непрерывно, продлевается раз в месяц или сгорает один раз?
- Область действия: ограничение привязано к модели, проекту, аккаунту или организации?
- Условие оплаты: привязка карты даёт больше ёмкости, включает платный тариф или обязательна для триала?
- Условия и сценарий отказа: доступ ограничен тестированием или оценкой, и умеет ли клиент обрабатывать HTTP 429 без лавины повторных запросов?
FAQ: бесплатные LLM API
Какой бесплатный LLM API лучший в целом?
Google AI Studio подходит для универсальных прототипов, Groq — для более высокого бесплатного объёма запросов, а OpenRouter — для работы с разнообразными моделями.
Можно ли использовать бесплатный LLM API без банковской карты?
Да. В проверенном сравнении Google, Groq, базовый маршрут OpenRouter, базовая квота Cloudflare и Free Tier SambaNova указаны как варианты без карты. Для Free Trial Cerebras требуется подтверждённый способ оплаты.
Бесплатные LLM API действительно доступны постоянно?
Некоторые регулярно возобновляемые тарифы действуют, пока сохраняются их условия. Но триалы, промо-цены и меняющиеся маршруты :free не являются постоянной квотой, гарантированной для всего провайдера. Перед тем как зависеть от одного сервиса, проверяйте текущую документацию и статус модели.
Можно ли использовать бесплатный LLM API в продакшене?
Не делайте его единственным backend, если действующие условия, квота и доступность модели не соответствуют требованиям вашего продакшена.
Что произойдёт при достижении бесплатного лимита?
Обычно провайдер вернёт ошибку троттлинга или превышения квоты. Groq документирует обработку HTTP 429, Cloudflare сообщает об отказе дальнейших операций после исчерпания дневной квоты Free plan, а Cerebras прекращает доступ к триалу, когда кредит заканчивается или истекает.