Comparativo rápido das APIs LLM gratuitas
Este levantamento foi verificado em 8 de setembro de 2026. Os limites podem mudar conforme o modelo, a conta, a região e a demanda; a documentação vinculada de cada provedor deve ser considerada a fonte final.
As indicações sobre cartão, uso comercial e compatibilidade com OpenAI foram conferidas também no comparativo do Free LLM API Hub.
| Provedor | Acesso gratuito e cota publicada | Condição de cartão/pagamento | Formato da API | Indicação nos termos | Principal restrição |
|---|---|---|---|---|---|
| Google AI Studio | Os modelos Gemini variam: 5–30 RPM e 15–1.000 RPD; exemplo do Gemini 2.5 Flash: 10 RPM / 250 RPD | Nenhum cartão indicado; podem ser exigidas verificação de conta e de projeto | Compatível com OpenAI no comparativo verificado | Uso comercial indicado como permitido; confirme os termos atuais | O Google informa que os limites ativos devem ser consultados no AI Studio |
| Groq | Representativo para qwen/qwen3.6-27b: 30 RPM / 1.000 RPD / 8.000 TPM / 200.000 TPD | O Free Plan não exige upgrade pago; o nível Developer requer uma forma de pagamento | Sim, em grande parte | Uso comercial indicado como permitido; os limites do Free Plan diferem da capacidade paga | Os limites se aplicam por organização e por modelo |
| OpenRouter | Variantes gratuitas: 20 RPM / 50 RPD abaixo de $10 em créditos comprados; 1.000 RPD após a compra de pelo menos $10 | A rota gratuita básica não exige cartão; créditos liberam um teto maior | Sim, normalizada para a OpenAI Chat API | Uso comercial indicado como permitido; a disponibilidade de modelos gratuitos muda | A maior franquia diária depende de compra |
| Cloudflare Workers AI | 10.000 Neurons/dia, compartilhados por toda a conta; redefinição às 00:00 UTC | A alocação básica é gratuita; modelos selecionados exigem faturamento pago | Compatível com OpenAI no comparativo verificado | Uso comercial indicado como permitido; a elegibilidade varia conforme o modelo | Neurons medem computação, não uma cota fixa de tokens |
| Cerebras Inference | Free Trial: 5 RPM / 30K TPM sem cache / 90K TPM totais / 1M TPD para os modelos listados | Exige forma de pagamento verificada | Não estabelecido na documentação citada | Acesso de teste; os créditos expiram após 30 dias | O crédito de teste de $5 não é permanente |
| SambaNova Cloud | Free Tier: 20 RPM / 20 RPD / 200.000 TPD para os modelos listados | Sem forma de pagamento no Free Tier; vinculá-la ativa o Developer Tier pago | Sim, com diferenças documentadas | Uso comercial indicado como permitido; confira os termos do modelo | O limite de 20 RPD é restritivo |
| Cohere | 1.000 chamadas/mês; Chat com 20 RPM, Embed com 2.000 entradas/min e Rerank com 10 RPM | Nenhum cartão indicado no comparativo verificado; confirme no cadastro | Compatível com OpenAI no comparativo verificado | Somente avaliação no comparativo verificado | Chamadas não são intercambiáveis com tokens |
| Z.AI | GLM-4.7-Flash e GLM-4.5-Flash aparecem com $0 nas categorias de tokens exibidas; não há RPM/TPM público informado | Nenhum cartão indicado no comparativo verificado | Compatível com OpenAI no comparativo verificado | Uso comercial indicado como permitido; verifique os termos do modelo | $0 por token não informa a capacidade disponível |
| NVIDIA NIM | Free Inference Endpoints para prototipagem; não há cota universal na página inicial | A condição de pagamento varia por endpoint; confira a página do modelo | Não estabelecido na documentação citada | Indicação de protótipo/avaliação na página citada | O rótulo gratuito na página inicial não equivale a uma cota publicada |
| Hugging Face Inference Providers | Usuários gratuitos recebem $0.10/mês em créditos, sujeito a alterações; não há RPM/TPM publicado | A condição de cartão não é informada na documentação oficial de preços | Compatível com OpenAI no comparativo verificado | Consulte os termos do provedor e do modelo | Trata-se de um crédito pequeno, não de uma cota de requisições |
| Mistral Studio | Free mode no Studio; não há cota pública na página inicial da documentação | A condição de cartão não é informada na página inicial | Endpoint no estilo OpenAI documentado; paridade completa não é declarada | Indicação de experimentar e explorar/avaliação; confirme os termos | O modo gratuito não prova acesso ilimitado nem pronto para produção |
Não ordene as opções pelo maior número. Requisições, tokens, chamadas, dólares e Neurons são unidades diferentes; um teste que expira não é o mesmo que uma franquia renovável.
Para imagens, fala, embeddings e outras modalidades, veja o comparativo mais amplo de APIs de IA gratuitas. Esta página permanece focada em inferência LLM hospedada.
Provedores com acesso recorrente ou sem cartão mais claro
Google AI Studio: ponto de partida prático para uso geral
A documentação oficial de limites de taxa do Google informa que as cotas do Gemini dependem do modelo e do projeto. RPM, TPM de entrada e RPD são dimensões comuns, as cotas valem para o projeto do Google Cloud — não para cada chave de API — e os valores ativos devem ser consultados no AI Studio. As cotas diárias de requisições são redefinidas à meia-noite no horário do Pacífico.
Um comparativo verificado secundário aponta 10 RPM e 250 RPD para o Gemini 2.5 Flash, com faixas de 5–30 RPM e 15–1.000 RPD entre os modelos. Use esses números para planejamento, pois o Google informa que os limites ativos variam e não são garantidos.
Use o Gemini em protótipos gerais e multimodais; os tetos diários específicos de cada modelo podem restringir cargas com muitas requisições.
Groq: a opção sem cartão mais forte pela cota de requisições publicada
A documentação de limites de taxa da Groq apresenta os limites por modelo e organização. A linha atual do Free Plan para qwen/qwen3.6-27b mostra 30 RPM, 1.000 RPD, 8.000 TPM e 200.000 TPD. Outros modelos têm diferentes tetos diários e de tokens.
“Os limites de taxa se aplicam no nível da organização, não de usuários individuais.” — documentação de limites de taxa da Groq
Ter várias chaves de API não cria automaticamente capacidade independente para toda a organização. A documentação da Groq descreve os cabeçalhos retry-after e x-ratelimit-* para lidar com respostas HTTP 429.
A Groq é o ponto de partida mais claro para muitas requisições pequenas quando o modelo escolhido atende à sua tarefa. Confira a linha do modelo específico, em vez de tratar a marca do provedor como se tivesse uma única cota.
OpenRouter: o gateway mais flexível para modelos gratuitos
O OpenRouter oferece uma única interface de API para uma seleção variável de variantes de modelos gratuitos. Seu comparativo atual de acesso grátis informa 20 requisições por minuto e 50 requisições por dia enquanto a conta tiver comprado menos de $10 em créditos. Depois de ao menos $10 em créditos comprados ao longo da vida da conta, a franquia diária sobe para 1.000 requisições. Portanto, o teto maior exige compra.
A documentação oficial de limites explica que contas ou chaves de API adicionais não alteram os limites globais da plataforma. O serviço expõe informações de cota pelo endpoint de chave e pelos cabeçalhos de erro de limite de taxa.
Você pode fixar um modelo com o sufixo :free ou usar openrouter/free, que escolhe automaticamente um modelo gratuito disponível. O roteador pode filtrar por recursos como chamada de ferramentas ou entendimento de imagens, mas o modelo usado internamente pode mudar.
Use o OpenRouter para experimentos e roteamento de fallback, não em uma aplicação que dependa do comportamento estável de um único modelo gratuito.
Cloudflare Workers AI: computação recorrente, não tokens grátis
A página oficial de preços da Cloudflare concede a cada conta uma alocação total de 10.000 Neurons por dia sem cobrança. A franquia é compartilhada entre as atividades do Workers AI e é redefinida às 00:00 UTC. No plano Workers Free, operações adicionais falham após o esgotamento da alocação.
Um Neuron representa a computação de GPU necessária para uma requisição. A Cloudflare publica equivalentes de tokens específicos por modelo, em vez de prometer que 10.000 Neurons correspondem a uma quantidade fixa de prompts.
A Cloudflare também informa que determinados modelos mais novos de DeepSeek, GLM e Kimi exigem uma forma de pagamento com faturamento ativo. “10.000 Neurons grátis” não significa que todos os modelos estejam disponíveis sem faturamento.
Acesso gratuito, mas com ressalvas
Cerebras: um teste útil, não uma API gratuita permanente
A documentação de limites de taxa da Cerebras lista 5 RPM, 30.000 TPM sem cache, 90.000 TPM totais e 1 milhão de TPD para os modelos do Free Trial. Ela também explica que o bucket de tokens é reabastecido continuamente, em vez de aguardar uma simples redefinição diária.
Novas contas recebem $5 em créditos gratuitos, que expiram após 30 dias, e precisam de uma forma de pagamento verificada para ativar o acesso ao Playground e à API. Quando o crédito expira ou acaba, o acesso é interrompido até que você compre mais. A documentação consultada não descreve uma alocação pública gratuita que se renove permanentemente.
A Cerebras funciona para uma avaliação curta. Ela não deve ser a única dependência de um projeto que precisa continuar funcionando após o período de teste.
SambaNova Cloud: a fronteira mais clara entre gratuito e pago
A SambaNova define o Free Tier pelo status de faturamento: ele se aplica quando nenhuma forma de pagamento está vinculada. Para os modelos listados nesse nível, a documentação oficial mostra 20 RPM, 20 RPD e 200.000 TPD. O limite de 20 RPD pode interromper um fluxo com muitas consultas periódicas antes que a franquia de tokens seja consumida.
Vincular uma forma de pagamento ativa o Developer Tier, que é pago e não deve ser contabilizado como gratuito. A SambaNova também expõe informações de requisições restantes e de redefinição por meio de cabeçalhos de resposta.
Use a SambaNova apenas em provas de conceito de baixo volume: o teto de 20 RPD precisa ser validado antes de qualquer fluxo de agentes.
Cohere: útil para RAG, mas acompanhe as chamadas com atenção
A chave de teste da Cohere não equivale a um nível gratuito baseado em tokens. O comparativo verificado atual informa 1.000 chamadas por mês, com limites específicos por endpoint: 20 RPM para Chat, 2.000 entradas por minuto para Embed e 10 RPM para Rerank. O FAQ da Cohere descreve as chaves de teste como gratuitas, porém limitadas.
Essa combinação torna a Cohere útil para experimentos de geração aumentada por recuperação: um projeto pode testar geração, embeddings e reranking. Mas o teste não se transforma em um backend de chat de alto volume. Não compare diretamente 1.000 chamadas/mês com 1 milhão de tokens/dia.
O comparativo verificado classifica o teste como exclusivo para avaliação. Confirme a política de uso atual antes de utilizá-lo em uma aplicação pública ou comercial.
Z.AI: preço gratuito não é o mesmo que cota conhecida
A documentação de preços da Z.AI lista GLM-4.7-Flash e GLM-4.5-Flash como gratuitos nas categorias de tokens exibidas. A página pública de preços consultada não informa números concretos de RPM, RPD, TPM ou TPD.
Considere a cota da Z.AI desconhecida: ela pode servir para testes manuais, mas não para trabalho em lote; confirme endpoint, disponibilidade do modelo e termos no cadastro.
NVIDIA, Hugging Face e Mistral: caminhos de descoberta com dados de cota incompletos
| Provedor | Sinal de acesso gratuito | Cota pública ausente | Uso prático |
|---|---|---|---|
| NVIDIA NIM | Free Inference Endpoints para prototipagem | Não há RPM universal, franquia de tokens, regra de cartão ou preço de excedente na página inicial | Teste um endpoint selecionado e depois leia os termos específicos do modelo |
| Hugging Face Inference Providers | $0.10/mês em créditos para usuários Free, sujeito a alterações | Não há cota comparável de RPM ou TPM | Pequenos experimentos com modelos roteados sem administrar infraestrutura de GPU |
| Mistral Studio | Free mode no Studio e guias rápidos de API | Não há cota nem regra de cartão na página inicial da documentação | Experimente os recursos da API Mistral antes de adotar uma configuração paga |
Qual API LLM gratuita escolher?
| Sua prioridade | Melhor ponto de partida | Motivo |
|---|---|---|
| Protótipo de uso geral | Google AI Studio | O Gemini oferece uma base geral clara; os limites ativos aparecem no AI Studio |
| Requisições pequenas frequentes | Groq | Linhas publicadas do Free Plan por modelo e um exemplo de 1.000 RPD |
| Muitos modelos em uma API | OpenRouter | Variantes gratuitas, roteamento e interface no estilo OpenAI |
| Aplicação nativa da Cloudflare | Workers AI | Alocação recorrente de 10.000 Neurons/dia |
| Maior número de tokens declarado em teste | Cerebras | Até 1M TPD, mas apenas em um teste de 30 dias com exigência de cartão |
| Configuração rigorosamente sem forma de pagamento | Groq primeiro; SambaNova para volume muito baixo | O Free Tier da SambaNova tem teto de 20 RPD |
| Componentes para RAG | Cohere | Chat, Embed e Rerank compartilham o ecossistema de uma mesma chave de teste |
| Testar GLM Flash | Z.AI | O preço de token exibido é $0, mas a cota pública é desconhecida |
| Descobrir modelos abertos sem GPU | Hugging Face | Acesso roteado mais $0.10/mês para usuários Free |
Comece com um provedor e registre quatro campos em cada requisição: ID do modelo, status HTTP, uso de tokens e cabeçalhos de limite restante. Adicione um segundo provedor apenas depois de saber qual limite a primeira rota atinge; usar várias chaves não cria necessariamente mais capacidade.
Como verificar uma API LLM gratuita antes de usá-la
Antes do lançamento, confirme cinco pontos:
- Unidade da cota: A oferta é medida em requisições, tokens, chamadas, dólares ou unidades de computação?
- Comportamento de redefinição: Ela é redefinida em um horário UTC ou do Pacífico, reabastecida continuamente, renovada mensalmente ou expira uma única vez?
- Escopo: O limite está vinculado ao modelo, projeto, conta ou organização?
- Condição de pagamento: Adicionar um cartão libera mais capacidade, ativa um nível pago ou se torna obrigatório para o teste?
- Termos e caminho de falha: A oferta é limitada a testes ou avaliação, e o cliente lida com HTTP 429 sem provocar uma tempestade de tentativas?
Perguntas frequentes sobre APIs LLM gratuitas
Qual é a melhor API LLM gratuita no geral?
O Google AI Studio atende bem a protótipos gerais; a Groq é indicada para maior volume gratuito de requisições; e o OpenRouter, para variedade de modelos.
Posso usar uma API LLM gratuita sem cartão de crédito?
Sim. Google, Groq, a rota básica do OpenRouter, a alocação básica da Cloudflare e o Free Tier da SambaNova são listados como opções sem cartão no comparativo verificado. A Cerebras exige uma forma de pagamento verificada em seu Free Trial.
As APIs LLM gratuitas são realmente permanentes?
Alguns níveis recorrentes continuam disponíveis enquanto seus termos permanecerem válidos, mas testes, preços promocionais e rotas :free rotativas não são franquias permanentes para todo o provedor. Consulte a documentação e o status atual do modelo antes de depender de um deles.
Posso usar uma API LLM gratuita em produção?
Não a use como seu único backend, a menos que os termos, a cota e a disponibilidade atual do modelo atendam aos requisitos de produção.
O que acontece quando atinjo o limite gratuito?
Normalmente, os provedores retornam um erro de limitação ou de cota. A Groq documenta o tratamento de HTTP 429, a Cloudflare informa que operações adicionais falham após a alocação diária do plano Free, e a Cerebras interrompe o acesso de teste quando seu crédito expira ou acaba.