AIREITER
DOCS APIPREÇOS
TEMPLATES
  • AIReiter
  • Blog
  • Comparativo de cotas de APIs LLM gratuitas: 11 provedores (2026)

Comparativo de cotas de APIs LLM gratuitas: 11 provedores (2026)

Última Atualização: 2026-09-08 08:41:40

Comparativo rápido das APIs LLM gratuitas

Este levantamento foi verificado em 8 de setembro de 2026. Os limites podem mudar conforme o modelo, a conta, a região e a demanda; a documentação vinculada de cada provedor deve ser considerada a fonte final.

As indicações sobre cartão, uso comercial e compatibilidade com OpenAI foram conferidas também no comparativo do Free LLM API Hub.

ProvedorAcesso gratuito e cota publicadaCondição de cartão/pagamentoFormato da APIIndicação nos termosPrincipal restrição
Google AI StudioOs modelos Gemini variam: 5–30 RPM e 15–1.000 RPD; exemplo do Gemini 2.5 Flash: 10 RPM / 250 RPDNenhum cartão indicado; podem ser exigidas verificação de conta e de projetoCompatível com OpenAI no comparativo verificadoUso comercial indicado como permitido; confirme os termos atuaisO Google informa que os limites ativos devem ser consultados no AI Studio
GroqRepresentativo para qwen/qwen3.6-27b: 30 RPM / 1.000 RPD / 8.000 TPM / 200.000 TPDO Free Plan não exige upgrade pago; o nível Developer requer uma forma de pagamentoSim, em grande parteUso comercial indicado como permitido; os limites do Free Plan diferem da capacidade pagaOs limites se aplicam por organização e por modelo
OpenRouterVariantes gratuitas: 20 RPM / 50 RPD abaixo de $10 em créditos comprados; 1.000 RPD após a compra de pelo menos $10A rota gratuita básica não exige cartão; créditos liberam um teto maiorSim, normalizada para a OpenAI Chat APIUso comercial indicado como permitido; a disponibilidade de modelos gratuitos mudaA maior franquia diária depende de compra
Cloudflare Workers AI10.000 Neurons/dia, compartilhados por toda a conta; redefinição às 00:00 UTCA alocação básica é gratuita; modelos selecionados exigem faturamento pagoCompatível com OpenAI no comparativo verificadoUso comercial indicado como permitido; a elegibilidade varia conforme o modeloNeurons medem computação, não uma cota fixa de tokens
Cerebras InferenceFree Trial: 5 RPM / 30K TPM sem cache / 90K TPM totais / 1M TPD para os modelos listadosExige forma de pagamento verificadaNão estabelecido na documentação citadaAcesso de teste; os créditos expiram após 30 diasO crédito de teste de $5 não é permanente
SambaNova CloudFree Tier: 20 RPM / 20 RPD / 200.000 TPD para os modelos listadosSem forma de pagamento no Free Tier; vinculá-la ativa o Developer Tier pagoSim, com diferenças documentadasUso comercial indicado como permitido; confira os termos do modeloO limite de 20 RPD é restritivo
Cohere1.000 chamadas/mês; Chat com 20 RPM, Embed com 2.000 entradas/min e Rerank com 10 RPMNenhum cartão indicado no comparativo verificado; confirme no cadastroCompatível com OpenAI no comparativo verificadoSomente avaliação no comparativo verificadoChamadas não são intercambiáveis com tokens
Z.AIGLM-4.7-Flash e GLM-4.5-Flash aparecem com $0 nas categorias de tokens exibidas; não há RPM/TPM público informadoNenhum cartão indicado no comparativo verificadoCompatível com OpenAI no comparativo verificadoUso comercial indicado como permitido; verifique os termos do modelo$0 por token não informa a capacidade disponível
NVIDIA NIMFree Inference Endpoints para prototipagem; não há cota universal na página inicialA condição de pagamento varia por endpoint; confira a página do modeloNão estabelecido na documentação citadaIndicação de protótipo/avaliação na página citadaO rótulo gratuito na página inicial não equivale a uma cota publicada
Hugging Face Inference ProvidersUsuários gratuitos recebem $0.10/mês em créditos, sujeito a alterações; não há RPM/TPM publicadoA condição de cartão não é informada na documentação oficial de preçosCompatível com OpenAI no comparativo verificadoConsulte os termos do provedor e do modeloTrata-se de um crédito pequeno, não de uma cota de requisições
Mistral StudioFree mode no Studio; não há cota pública na página inicial da documentaçãoA condição de cartão não é informada na página inicialEndpoint no estilo OpenAI documentado; paridade completa não é declaradaIndicação de experimentar e explorar/avaliação; confirme os termosO modo gratuito não prova acesso ilimitado nem pronto para produção

Não ordene as opções pelo maior número. Requisições, tokens, chamadas, dólares e Neurons são unidades diferentes; um teste que expira não é o mesmo que uma franquia renovável.

Para imagens, fala, embeddings e outras modalidades, veja o comparativo mais amplo de APIs de IA gratuitas. Esta página permanece focada em inferência LLM hospedada.

Provedores com acesso recorrente ou sem cartão mais claro

Google AI Studio: ponto de partida prático para uso geral

A documentação oficial de limites de taxa do Google informa que as cotas do Gemini dependem do modelo e do projeto. RPM, TPM de entrada e RPD são dimensões comuns, as cotas valem para o projeto do Google Cloud — não para cada chave de API — e os valores ativos devem ser consultados no AI Studio. As cotas diárias de requisições são redefinidas à meia-noite no horário do Pacífico.

Um comparativo verificado secundário aponta 10 RPM e 250 RPD para o Gemini 2.5 Flash, com faixas de 5–30 RPM e 15–1.000 RPD entre os modelos. Use esses números para planejamento, pois o Google informa que os limites ativos variam e não são garantidos.

Use o Gemini em protótipos gerais e multimodais; os tetos diários específicos de cada modelo podem restringir cargas com muitas requisições.

Groq: a opção sem cartão mais forte pela cota de requisições publicada

A documentação de limites de taxa da Groq apresenta os limites por modelo e organização. A linha atual do Free Plan para qwen/qwen3.6-27b mostra 30 RPM, 1.000 RPD, 8.000 TPM e 200.000 TPD. Outros modelos têm diferentes tetos diários e de tokens.

“Os limites de taxa se aplicam no nível da organização, não de usuários individuais.” — documentação de limites de taxa da Groq

Ter várias chaves de API não cria automaticamente capacidade independente para toda a organização. A documentação da Groq descreve os cabeçalhos retry-after e x-ratelimit-* para lidar com respostas HTTP 429.

A Groq é o ponto de partida mais claro para muitas requisições pequenas quando o modelo escolhido atende à sua tarefa. Confira a linha do modelo específico, em vez de tratar a marca do provedor como se tivesse uma única cota.

OpenRouter: o gateway mais flexível para modelos gratuitos

O OpenRouter oferece uma única interface de API para uma seleção variável de variantes de modelos gratuitos. Seu comparativo atual de acesso grátis informa 20 requisições por minuto e 50 requisições por dia enquanto a conta tiver comprado menos de $10 em créditos. Depois de ao menos $10 em créditos comprados ao longo da vida da conta, a franquia diária sobe para 1.000 requisições. Portanto, o teto maior exige compra.

A documentação oficial de limites explica que contas ou chaves de API adicionais não alteram os limites globais da plataforma. O serviço expõe informações de cota pelo endpoint de chave e pelos cabeçalhos de erro de limite de taxa.

Você pode fixar um modelo com o sufixo :free ou usar openrouter/free, que escolhe automaticamente um modelo gratuito disponível. O roteador pode filtrar por recursos como chamada de ferramentas ou entendimento de imagens, mas o modelo usado internamente pode mudar.

Use o OpenRouter para experimentos e roteamento de fallback, não em uma aplicação que dependa do comportamento estável de um único modelo gratuito.

Cloudflare Workers AI: computação recorrente, não tokens grátis

A página oficial de preços da Cloudflare concede a cada conta uma alocação total de 10.000 Neurons por dia sem cobrança. A franquia é compartilhada entre as atividades do Workers AI e é redefinida às 00:00 UTC. No plano Workers Free, operações adicionais falham após o esgotamento da alocação.

Um Neuron representa a computação de GPU necessária para uma requisição. A Cloudflare publica equivalentes de tokens específicos por modelo, em vez de prometer que 10.000 Neurons correspondem a uma quantidade fixa de prompts.

A Cloudflare também informa que determinados modelos mais novos de DeepSeek, GLM e Kimi exigem uma forma de pagamento com faturamento ativo. “10.000 Neurons grátis” não significa que todos os modelos estejam disponíveis sem faturamento.

Acesso gratuito, mas com ressalvas

Cerebras: um teste útil, não uma API gratuita permanente

A documentação de limites de taxa da Cerebras lista 5 RPM, 30.000 TPM sem cache, 90.000 TPM totais e 1 milhão de TPD para os modelos do Free Trial. Ela também explica que o bucket de tokens é reabastecido continuamente, em vez de aguardar uma simples redefinição diária.

Novas contas recebem $5 em créditos gratuitos, que expiram após 30 dias, e precisam de uma forma de pagamento verificada para ativar o acesso ao Playground e à API. Quando o crédito expira ou acaba, o acesso é interrompido até que você compre mais. A documentação consultada não descreve uma alocação pública gratuita que se renove permanentemente.

A Cerebras funciona para uma avaliação curta. Ela não deve ser a única dependência de um projeto que precisa continuar funcionando após o período de teste.

SambaNova Cloud: a fronteira mais clara entre gratuito e pago

A SambaNova define o Free Tier pelo status de faturamento: ele se aplica quando nenhuma forma de pagamento está vinculada. Para os modelos listados nesse nível, a documentação oficial mostra 20 RPM, 20 RPD e 200.000 TPD. O limite de 20 RPD pode interromper um fluxo com muitas consultas periódicas antes que a franquia de tokens seja consumida.

Vincular uma forma de pagamento ativa o Developer Tier, que é pago e não deve ser contabilizado como gratuito. A SambaNova também expõe informações de requisições restantes e de redefinição por meio de cabeçalhos de resposta.

Use a SambaNova apenas em provas de conceito de baixo volume: o teto de 20 RPD precisa ser validado antes de qualquer fluxo de agentes.

Cohere: útil para RAG, mas acompanhe as chamadas com atenção

A chave de teste da Cohere não equivale a um nível gratuito baseado em tokens. O comparativo verificado atual informa 1.000 chamadas por mês, com limites específicos por endpoint: 20 RPM para Chat, 2.000 entradas por minuto para Embed e 10 RPM para Rerank. O FAQ da Cohere descreve as chaves de teste como gratuitas, porém limitadas.

Essa combinação torna a Cohere útil para experimentos de geração aumentada por recuperação: um projeto pode testar geração, embeddings e reranking. Mas o teste não se transforma em um backend de chat de alto volume. Não compare diretamente 1.000 chamadas/mês com 1 milhão de tokens/dia.

O comparativo verificado classifica o teste como exclusivo para avaliação. Confirme a política de uso atual antes de utilizá-lo em uma aplicação pública ou comercial.

Z.AI: preço gratuito não é o mesmo que cota conhecida

A documentação de preços da Z.AI lista GLM-4.7-Flash e GLM-4.5-Flash como gratuitos nas categorias de tokens exibidas. A página pública de preços consultada não informa números concretos de RPM, RPD, TPM ou TPD.

Considere a cota da Z.AI desconhecida: ela pode servir para testes manuais, mas não para trabalho em lote; confirme endpoint, disponibilidade do modelo e termos no cadastro.

NVIDIA, Hugging Face e Mistral: caminhos de descoberta com dados de cota incompletos

ProvedorSinal de acesso gratuitoCota pública ausenteUso prático
NVIDIA NIMFree Inference Endpoints para prototipagemNão há RPM universal, franquia de tokens, regra de cartão ou preço de excedente na página inicialTeste um endpoint selecionado e depois leia os termos específicos do modelo
Hugging Face Inference Providers$0.10/mês em créditos para usuários Free, sujeito a alteraçõesNão há cota comparável de RPM ou TPMPequenos experimentos com modelos roteados sem administrar infraestrutura de GPU
Mistral StudioFree mode no Studio e guias rápidos de APINão há cota nem regra de cartão na página inicial da documentaçãoExperimente os recursos da API Mistral antes de adotar uma configuração paga

Qual API LLM gratuita escolher?

Sua prioridadeMelhor ponto de partidaMotivo
Protótipo de uso geralGoogle AI StudioO Gemini oferece uma base geral clara; os limites ativos aparecem no AI Studio
Requisições pequenas frequentesGroqLinhas publicadas do Free Plan por modelo e um exemplo de 1.000 RPD
Muitos modelos em uma APIOpenRouterVariantes gratuitas, roteamento e interface no estilo OpenAI
Aplicação nativa da CloudflareWorkers AIAlocação recorrente de 10.000 Neurons/dia
Maior número de tokens declarado em testeCerebrasAté 1M TPD, mas apenas em um teste de 30 dias com exigência de cartão
Configuração rigorosamente sem forma de pagamentoGroq primeiro; SambaNova para volume muito baixoO Free Tier da SambaNova tem teto de 20 RPD
Componentes para RAGCohereChat, Embed e Rerank compartilham o ecossistema de uma mesma chave de teste
Testar GLM FlashZ.AIO preço de token exibido é $0, mas a cota pública é desconhecida
Descobrir modelos abertos sem GPUHugging FaceAcesso roteado mais $0.10/mês para usuários Free

Comece com um provedor e registre quatro campos em cada requisição: ID do modelo, status HTTP, uso de tokens e cabeçalhos de limite restante. Adicione um segundo provedor apenas depois de saber qual limite a primeira rota atinge; usar várias chaves não cria necessariamente mais capacidade.

Como verificar uma API LLM gratuita antes de usá-la

Antes do lançamento, confirme cinco pontos:

  1. Unidade da cota: A oferta é medida em requisições, tokens, chamadas, dólares ou unidades de computação?
  2. Comportamento de redefinição: Ela é redefinida em um horário UTC ou do Pacífico, reabastecida continuamente, renovada mensalmente ou expira uma única vez?
  3. Escopo: O limite está vinculado ao modelo, projeto, conta ou organização?
  4. Condição de pagamento: Adicionar um cartão libera mais capacidade, ativa um nível pago ou se torna obrigatório para o teste?
  5. Termos e caminho de falha: A oferta é limitada a testes ou avaliação, e o cliente lida com HTTP 429 sem provocar uma tempestade de tentativas?

Perguntas frequentes sobre APIs LLM gratuitas

Qual é a melhor API LLM gratuita no geral?

O Google AI Studio atende bem a protótipos gerais; a Groq é indicada para maior volume gratuito de requisições; e o OpenRouter, para variedade de modelos.

Posso usar uma API LLM gratuita sem cartão de crédito?

Sim. Google, Groq, a rota básica do OpenRouter, a alocação básica da Cloudflare e o Free Tier da SambaNova são listados como opções sem cartão no comparativo verificado. A Cerebras exige uma forma de pagamento verificada em seu Free Trial.

As APIs LLM gratuitas são realmente permanentes?

Alguns níveis recorrentes continuam disponíveis enquanto seus termos permanecerem válidos, mas testes, preços promocionais e rotas :free rotativas não são franquias permanentes para todo o provedor. Consulte a documentação e o status atual do modelo antes de depender de um deles.

Posso usar uma API LLM gratuita em produção?

Não a use como seu único backend, a menos que os termos, a cota e a disponibilidade atual do modelo atendam aos requisitos de produção.

O que acontece quando atinjo o limite gratuito?

Normalmente, os provedores retornam um erro de limitação ou de cota. A Groq documenta o tratamento de HTTP 429, a Cloudflare informa que operações adicionais falham após a alocação diária do plano Free, e a Cerebras interrompe o acesso de teste quando seu crédito expira ou acaba.

>_Diretório de modelos AIReiter

Acesso API rápido aos modelos relacionados a este guia

Gemini 3.6 Flash

Chat

Um modelo Gemini rápido para raciocínio avançado, codificação e tarefas agentivas.

GoogleCriar API Key >

Gemini 2.5 Pro

Chat
GoogleCriar API Key >

Claude Fable 5

Chat

Um modelo premium Claude para raciocínio profundo e trabalhos complexos de longo formato.

AnthropicCriar API Key >

Claude Fable 5.1

Chat

Mythos-class model for long-horizon coding, research, and knowledge work.

AnthropicCriar API Key >

Claude Opus 4.8

Chat

Um modelo Claude de alta capacidade para raciocínio exigente e trabalho profissional.

AnthropicCriar API Key >

Posts recentes

Como usar o DeepSeek no Janitor AI (configuração em 2026)

2026-09-08

Preços da API Muse Spark 1.3: Standard vs. Contributor

2026-09-08

Review da API do GPT-6 Astra (2026): feito para agentes, não para substituição direta

2026-09-07

API do Kling: guia de integração oficial e por agregadores (2026)

2026-09-07
AIREITER

Dúvidas? Entre em contato em
[email protected]

新速率有限公司NEWRATE LIMITED香港九龍花園街 2-16 號好景商業中心 2304 室Room 2304, Haojing Commercial Center, 2-16 Garden Street, Kowloon, Hong Kong

LLM

GPT-6 AstraGemini 3.8 FlashClaude Fable 5.1GLM-5.3 FlashGemini 3.6 Flash

Vídeo IA

Gemini Omni 1.1 Flash ExtMiniMax H3Kling 3.0 Motion ControlKling 3.0 TurboKling 3.0

Imagem IA

Grok Imagine Image 2.0Midjourney V8.1Midjourney V7Z-Image TurboKrea 2 Turbo

Blog

Ver Tudo →

Empresa

Política de PrivacidadeTermos de ServiçoPolítica de Reembolso

© 2026 AIReiter. Todos os direitos reservados.