Limites das APIs de IA gratuitas em um só lugar
No universo das APIs de IA, “gratuito” quase nunca significa uso ilimitado. Normalmente, trata-se de uma faixa com limites de velocidade: às vezes uma cota permanente, às vezes créditos promocionais que acabam. Todos os provedores abaixo liberam chaves de API sem exigir cartão de crédito, mas o volume útil varia de algumas solicitações por dia a dezenas de milhares.
Os números deste guia foram conferidos na documentação oficial de cada provedor em agosto de 2026. Como os limites mudam com frequência, confirme sempre as condições no console do serviço antes de usar qualquer número no planejamento de produção.
| Provedor | Principais pontos do plano gratuito | Destaque da política de dados | Melhor para |
|---|---|---|---|
| Google AI Studio | Sem cartão ou conta de cobrança; modelos Gemini; cotas por projeto redefinidas à meia-noite do horário do Pacífico | Prompts do plano gratuito treinam produtos do Google | Variedade de modelos, prototipagem |
| Groq | 14.400 RPD no Llama 3.1 8B; 70K TPM nos modelos Compound | Sem retenção por padrão; ZDR disponível | Prompts curtos em alta frequência |
| OpenRouter | 50 solicitações gratuitas por dia; mais de 25 modelos gratuitos; BYOK compatível | Varia conforme o provedor upstream | Testar vários modelos |
| GitHub Models | 15 RPM / 150 RPD (nível baixo); 8.000 tokens de entrada + 4.000 de saída | Termos de dados da Microsoft | Experimentos rápidos com um PAT |
| Cloudflare Workers AI | 10.000 Neurons/dia (~280 mil tokens de saída no Llama 3.1 8B Fast) | Compromisso explícito de não treinar com os dados | Trabalhos sensíveis do ponto de vista da privacidade |
| Cohere | 20 solicitações/min; 1.000 chamadas/mês | Licença de avaliação | Testes de embeddings e reranking |
| NVIDIA NIM | 1.000 créditos no cadastro; até 5.000 com e-mail corporativo | O uso do endpoint gratuito é registrado | Testes pontuais de modelos |
| Hugging Face | US$ 0,10/mês distribuídos entre mais de 200 modelos | Alocação sujeita a alterações | Inferência em escala de demonstração |
| Mistral | Modo de chave de API gratuita; limites no Admin Panel | Opção de retenção zero mencionada | Modelos hospedados na Europa |
Nove provedores liberam chaves sem cartão de crédito. Sete oferecem planos gratuitos recorrentes, enquanto NVIDIA e Hugging Face fornecem créditos consumíveis que não são renovados. A diferença é enorme: o GitHub Models libera 8 solicitações do DeepSeek-R1 por dia, enquanto a Groq oferece 14.400 solicitações diárias no Llama 3.1 8B.
Google AI Studio: o plano gratuito mais óbvio para começar
O Google AI Studio é um ponto de partida natural para quem quer acessar modelos de nível avançado sem informar dados de cobrança. Não é preciso ter cartão de crédito nem conta de faturamento: basta entrar com uma conta Google, gerar uma chave de API e começar a fazer chamadas.
O plano gratuito dá acesso à família de modelos Gemini, incluindo Gemini 3.6 Flash, 3.5 Flash, 2.5 Pro e outros. Os endpoints de texto e embeddings estão incluídos; as cotas são definidas por projeto e zeradas à meia-noite, no horário do Pacífico.
A cota só aparece depois do cadastro
Ao contrário da Groq ou do OpenRouter, o Google não publica uma tabela única com os limites do plano gratuito. Os limites reais — solicitações por minuto, tokens por minuto e tokens por dia — só aparecem no console do AI Studio depois que você cria um projeto. Isso dificulta o planejamento antecipado. Na prática, o caminho é criar o projeto, consultar a página Quotas e desenhar a aplicação em torno do teto exibido.
No plano gratuito, seus prompts podem treinar produtos do Google
Esta é a principal ressalva. Os termos do plano gratuito do Google dizem que seus prompts e o conteúdo gerado podem ser usados para melhorar os produtos da empresa. Se você lida com dados sensíveis, proprietários ou pessoais, isso elimina o plano gratuito como opção. O uso pago da Gemini API — pelo Google Cloud, com uma conta de faturamento — não inclui essa cláusula de treinamento, mas exige cartão de crédito.
A geração gratuita de imagens pelo Gemini também não está disponível; o escopo sem custo cobre apenas texto e embeddings.
Groq: limites diários claros e generosos
O plano gratuito da Groq é o mais generoso para cargas com prompts curtos e alta frequência. Os limites aparecem de forma explícita na documentação da empresa e são aplicados por organização, não por usuário. Tokens armazenados em cache não entram no cálculo dos limites de uso.
| Modelo | RPM | RPD | TPM | TPD |
|---|---|---|---|---|
| Llama 3.1 8B Instant | 30 | 14.400 | 6.000 | 500.000 |
| Llama 3.3 70B Versatile | 30 | 1.000 | 12.000 | 100.000 |
| GPT-OSS-120B | 30 | 1.000 | 8.000 | 200.000 |
| GPT-OSS-20B | 30 | 1.000 | 8.000 | 200.000 |
| Qwen 3.6-27B | 30 | 1.000 | 8.000 | 200.000 |
| Groq Compound | 30 | 250 | 70.000 | — |
| Groq Compound Mini | 30 | 250 | 70.000 | — |
| Whisper Large V3 | 20 | 2.000 | — | 28.800 segundos de áudio/dia |
O grande destaque é o Llama 3.1 8B, com 14.400 solicitações por dia — volume suficiente para prototipagem séria ou um endpoint de produção com pouco tráfego. Os modelos Compound oferecem a maior franquia de tokens por minuto, com 70.000 TPM, mas têm um limite diário mais apertado, de 250 RPD.
Por padrão, a Groq não retém dados de inferência e oferece uma opção de Zero Data Retention (ZDR), o que a coloca entre as alternativas gratuitas mais interessantes para quem se preocupa com privacidade. A principal limitação está no teto de tokens por minuto do modelo 8B: 6.000 TPM podem estrangular contextos longos ou gerações de alto volume.
OpenRouter: 50 solicitações gratuitas por dia
O OpenRouter é um gateway de APIs, não um host de modelos. Seu plano gratuito permite chamar uma seleção rotativa de modelos subsidiados pela própria plataforma. Para isso, basta acrescentar :free ao nome do modelo ou usar o roteador automático openrouter/free.
Limites de uso: Os modelos gratuitos têm limite de 20 RPM e 50 solicitações por dia. Uma compra única de US$ 10 em créditos eleva permanentemente o teto diário dos modelos gratuitos para 1.000 solicitações. Esses limites são aplicados além de qualquer restrição imposta pelo provedor upstream.
Catálogo de modelos gratuitos: Em agosto de 2026, o OpenRouter lista mais de 25 modelos gratuitos — eram 15 em julho — cobrindo geração de texto, embeddings e reranking. A seleção inclui modelos da NVIDIA (as famílias Nemotron 3 Ultra, Super e Nano, com contexto de até 1 milhão de tokens), do Google (Gemma 4), da Cohere (North Mini Code), da OpenAI (gpt-oss-20b) e de várias outras empresas. O catálogo muda constantemente à medida que provedores adicionam ou retiram endpoints gratuitos.
BYOK (Bring Your Own Key): O OpenRouter oferece BYOK para mais de 60 provedores de inferência. Ao informar suas próprias chaves de API, o custo da inferência é cobrado diretamente pelo provedor escolhido, enquanto o OpenRouter cobra apenas pela camada de roteamento. A franquia gratuita do BYOK agora depende do plano e é calculada pelo custo de inferência baseado na tabela de preços, não por uma quantidade fixa de solicitações. Consulte a página de preços do OpenRouter para conhecer as condições atuais.
O ponto mais importante é que “gratuito” no OpenRouter significa não pagar pelos tokens, e não necessariamente não ter retenção de dados. Cada provedor upstream define sua própria política, e alguns — incluindo NVIDIA e Poolside — registram explicitamente o uso dos endpoints gratuitos ou podem usar prompts para treinamento. Se necessário, configure filtros de privacidade por provedor.
Mais seis opções gratuitas
GitHub Models
O GitHub Models oferece um playground e um endpoint de API para modelos populares, usando um GitHub Personal Access Token (PAT). O nível baixo oferece 15 RPM e 150 RPD; o nível alto reduz esses números para 10 RPM e 50 RPD. Cada solicitação é limitada a 8.000 tokens de entrada e 4.000 tokens de saída. O DeepSeek-R1 está disponível, mas limitado a 8 solicitações por dia.
O GitHub Models é prático para experimentos rápidos, já que a autenticação por PAT dispensa um cadastro separado. Ainda assim, os limites rígidos de tokens e solicitações fazem dele uma opção apenas para prototipagem.
Cloudflare Workers AI
O Workers AI, da Cloudflare, oferece 10.000 Neurons por dia para cada conta, com renovação às 00:00 UTC. No Llama 3.1 8B Fast, isso equivale a aproximadamente 280 mil tokens de saída por dia. A Cloudflare também hospeda o FLUX para geração gratuita de imagens — a principal opção de imagem sem cartão de crédito desta lista.
A posição em relação à privacidade é a mais forte entre todos os provedores analisados: a Cloudflare assume explicitamente o compromisso de não usar prompts nem resultados dos clientes para treinamento ou melhoria dos serviços sem consentimento. Por isso, o Workers AI é a principal recomendação para cargas que envolvem dados sensíveis.
A abstração de Neurons é menos intuitiva do que uma contagem direta de solicitações ou tokens. Para saber quantos Neurons cada modelo consome por token, é preciso consultar o painel do Workers AI.
Cohere, NVIDIA, Hugging Face e Mistral
Cohere oferece 20 solicitações por minuto e 1.000 chamadas de API por mês no plano gratuito. É um limite adequado para avaliação e testes, não para volume operacional. Os modelos Command e os endpoints de embeddings da Cohere estão incluídos.
NVIDIA NIM fornece 1.000 créditos no cadastro, ou até 5.000 com um e-mail corporativo. São créditos consumíveis distribuídos uma única vez, não uma franquia mensal recorrente, e não existe uma conversão publicada entre créditos e solicitações. Os modelos gratuitos da NVIDIA no OpenRouter vêm acompanhados de um alerta: o uso do endpoint gratuito é registrado, e a empresa recomenda não enviar dados confidenciais ou pessoais.
Hugging Face oferece aproximadamente US$ 0,10 por mês em créditos gratuitos de inferência para mais de 200 modelos por meio da Serverless Inference API. A própria plataforma informa que essa alocação pode mudar. É uma opção voltada apenas a demonstrações — suficiente para experimentar um modelo, não para construir uma aplicação sobre ele.
Mistral conta com um modo de chave de API gratuita cujos limites só aparecem no Admin Panel. A documentação da Mistral menciona uma opção de retenção zero, mas não a apresenta como uma política padrão clara do plano gratuito. Isso dificulta a avaliação do serviço para usos sensíveis do ponto de vista da privacidade.
Além do texto: imagem, voz e embeddings
Dois provedores cobrem modalidades além de texto:
- Cloudflare Workers AI hospeda o FLUX para geração de imagens sem custo — é a única opção desta lista que não exige cartão de crédito. Os modelos de imagem do Gemini não estão disponíveis no plano gratuito.
- Groq Whisper oferece conversão de fala em texto com 2.000 solicitações por dia e 28.800 segundos de áudio por dia no plano gratuito.
O catálogo gratuito do OpenRouter também cresceu e passou a incluir modelos de embeddings e reranking da NVIDIA, levando recursos de recuperação e RAG para o plano gratuito.
Quando os dados são importantes, a lista se resume a dois
Para trabalhos com dados sensíveis, proprietários ou regulamentados, a maioria dos provedores desta lista fica de fora:
- Google AI Studio usa prompts do plano gratuito para treinar seus produtos.
- NVIDIA registra o uso dos endpoints gratuitos e alerta contra o envio de dados confidenciais.
- OpenRouter herda a política de dados definida pelo provedor upstream de cada modelo. Alguns, como Poolside e Liquid, treinam explicitamente com prompts gratuitos.
- Hugging Face e Mistral têm termos de retenção pouco claros ou sujeitos a alterações.
Sobram dois provedores com compromissos de privacidade claros e explícitos:
- Cloudflare Workers AI — compromisso explícito de não usar os dados para treinamento ou melhoria do serviço sem consentimento.
- Groq — sem retenção de inferência por padrão e com opção de Zero Data Retention.
Se a carga envolve dados sensíveis e tem volume baixo ou moderado, a Cloudflare é a escolha mais segura. Se você precisa de maior vazão e consegue trabalhar dentro dos limites de tokens por minuto da Groq, a combinação Groq com ZDR é a alternativa.
Quando o plano gratuito deixa de dar conta
Mais cedo ou mais tarde, todos os planos gratuitos desta lista vão limitar seu uso. A questão é o que fazer quando isso acontecer.
A recomendação é migrar para o uso pago conforme o consumo em um único provedor, em vez de ficar alternando entre vários serviços gratuitos. Trocar de provedor para contornar limites cria uma complexidade operacional — SDKs diferentes, políticas de dados diferentes e modos de falha diferentes — que normalmente custa mais tempo de engenharia do que a economia na API.
Quatro dos provedores listados oferecem endpoints compatíveis com OpenAI: Groq, OpenRouter, Cloudflare Workers AI e Google AI Studio (por meio do wrapper compatível com OpenAI). Assim, você pode passar do plano gratuito ao pago em qualquer um deles alterando a URL base e a chave de API, sem reescrever o código da aplicação.
O caminho mais prático é começar gratuitamente no Google AI Studio, pela variedade de modelos, ou na Groq, pela vazão. Quando os limites diários começarem a ser atingidos com frequência, adicione uma conta de cobrança ao mesmo provedor e migre para o preço conforme o consumo. Deixe o OpenRouter para testes com vários modelos e escolha a Cloudflare quando a privacidade dos dados for inegociável.
Perguntas frequentes
Qual API de IA gratuita não exige cartão de crédito? Todos os nove provedores listados acima liberam chaves de API sem cartão: Google AI Studio, Groq, OpenRouter, GitHub Models, Cloudflare Workers AI, Cohere, NVIDIA, Hugging Face e Mistral.
Qual API gratuita tem o maior limite diário de solicitações? A Groq oferece 14.400 solicitações por dia no Llama 3.1 8B Instant — o maior volume recorrente de solicitações em um plano gratuito entre os provedores listados aqui.
O OpenRouter é realmente gratuito? As variantes de modelos :free do OpenRouter não custam nada por token, mas são limitadas a 50 solicitações por dia, ou 1.000 depois da compra de US$ 10 em créditos. O modo BYOK permite rotear as chamadas usando suas próprias chaves de provedor, com uma franquia gratuita que depende do plano. Nenhuma das opções é realmente ilimitada.
Posso usar uma API de IA gratuita em produção? Sim, desde que você respeite os limites de uso. Groq e Cloudflare são os planos gratuitos mais preparados para produção em suas respectivas especialidades: vazão e privacidade. Quando os limites gratuitos começarem a interromper sua carga com frequência, migre para o plano pago do mesmo provedor.
Qual API gratuita é melhor para dados sensíveis? Cloudflare Workers AI e Groq são os únicos provedores com compromissos explícitos de não treinamento e não retenção em seus planos gratuitos. Os demais treinam com prompts gratuitos (Google), registram o uso (NVIDIA) ou seguem políticas que dependem do provedor (OpenRouter).