Ainda dá para colocar um projeto real no ar usando uma API de IA grátis em 2026? Dá. Só a Groq oferece 14.400 requisições gratuitas por dia em um modelo Llama de 8B. Mas a distância entre os limites dos provedores chega a três ordens de grandeza, e o Google já nem publica mais os números do plano gratuito. Todos os dados abaixo vêm da documentação oficial dos provedores, consultada em 29 de julho de 2026.
Limites das APIs de IA grátis em resumo, verificados em 29 de julho de 2026
Nove provedores liberam chaves de API sem exigir cartão de crédito. Sete oferecem planos gratuitos recorrentes; NVIDIA e Hugging Face distribuem créditos únicos, que acabam.
| Provedor | Plano grátis (números oficiais) | Cartão de crédito | Treina com seus dados (plano grátis) |
|---|---|---|---|
| Google Gemini API | Tokens gratuitos nos modelos de texto flash/pro; RPM/RPD por modelo aparecem apenas na sua conta do AI Studio | Não | Sim ("Usado para melhorar nossos produtos: Sim") |
| Groq | llama-3.1-8b: 30 RPM / 14.400 RPD; llama-3.3-70b: 30 RPM / 1.000 RPD / 100K TPD | Não | Sem retenção por padrão; ZDR disponível |
| OpenRouter | Modelos :free: 20 RPM, 50 req/dia — 1.000 req/dia após uma recarga única de US$ 10 | Não (recarga opcional) | Depende do provedor de origem; há opção de opt-out |
| GitHub Models | Modelos de faixa baixa: 15 RPM / 150 RPD; DeepSeek-R1: 1 RPM / 8 RPD | Não (somente PAT) | Não informado na documentação |
| Cloudflare Workers AI | 10.000 Neurons/dia, com reinício às 00:00 UTC | Não | Não (compromisso explícito) |
| Cohere | Chave de teste: 20 req/min, 1.000 chamadas/mês | Não | Não informado na página de limites |
| Mistral | Há modo gratuito; os limites aparecem apenas no seu Admin Panel | Não | Não informado; opção gratuita de retenção zero anunciada |
| Hugging Face Inference Providers | US$ 0,10/mês em créditos (marcado como "sujeito a alterações") | Não | Conforme a política do provedor roteado |
| NVIDIA NIM | 1.000 créditos no cadastro, até 5.000 com e-mail corporativo | Não | Não informado |
Os tetos diários vão de 8 requisições, no DeepSeek-R1 do GitHub Models, a 14.400, no endpoint 8B da Groq. Compare as linhas com cuidado: requisições, tokens, Neurons e créditos em dólar não são a mesma unidade.
Google AI Studio: o plano grátis padrão, com duas ressalvas
O Google AI Studio continua sendo o ponto de partida gratuito para a maioria dos desenvolvedores: você tem acesso sem custo ao Gemini 3.6 Flash, Gemini 3.5 Flash, Gemini 2.5 Pro e outros oito modelos de texto, sem precisar de conta de faturamento. Para se qualificar ao plano gratuito, basta ter "um projeto ativo ou teste gratuito"; vincular o faturamento é exigência do Tier 1 pago.
A sua cota só aparece depois do cadastro
A página de limites de taxa do Google deixou de listar os limites de requisições por modelo; agora ela direciona você ao projeto no AI Studio. Duas regras continuam valendo para todos: as cotas são contabilizadas por projeto, não por chave de API, e os contadores diários reiniciam à meia-noite no horário do Pacífico. Portanto, trate qualquer número específico de RPM encontrado em outro lugar como desatualizado até confirmá-lo no seu painel.
No plano grátis, seus prompts ajudam a treinar os produtos do Google
Todas as linhas do plano gratuito na página de preços do Google trazem a indicação "Usado para melhorar nossos produtos: Sim"; no tráfego pago, a indicação é Não. Se você envia dados de clientes ou qualquer informação sob NDA, essa cláusula elimina o plano gratuito, independentemente do tamanho da cota. A geração de imagens também fica de fora: o Gemini grátis cobre apenas texto e embeddings.
Groq: limites diários claros e publicados
A Groq publica os limites do plano gratuito por modelo, sem exigir login:
| Modelo | RPM | Requisições/dia | Tokens/dia |
|---|---|---|---|
| llama-3.1-8b-instant | 30 | 14.400 | 500K |
| llama-3.3-70b-versatile | 30 | 1.000 | 100K |
| openai/gpt-oss-120b | 30 | 1.000 | 200K |
| whisper-large-v3 | 20 | 2.000 | 28.800 seg. de áudio |
O ponto de atenção são os tokens por minuto: o llama-3.3-70b é limitado a 12K TPM. Assim, trabalhos com contexto longo sofrem limitação mesmo quando a contagem diária de requisições parece generosa. Quanto aos dados, a Groq não retém entradas nem saídas de inferência por padrão e disponibiliza Zero Data Retention mediante solicitação.
Para prompts curtos em alta frequência — classificação, extração e enriquecimento de webhooks — o endpoint 8B da Groq, com 14.400 requisições diárias, é a melhor oferta gratuita desta lista. Isso desde que um modelo de 8B seja suficiente e você permaneça abaixo de 6K tokens por minuto.
OpenRouter: 50 requisições grátis por dia — ou 1.000 com US$ 10 parados na conta
Em vez de oferecer o catálogo de um único fornecedor, a OpenRouter libera os modelos com o sufixo :free. Em 29 de julho de 2026, esse conjunto tinha 15 modelos de texto, incluindo NVIDIA Nemotron 3 Ultra e Ling-3.0-flash.
Os limites valem para toda a conta e são compartilhados entre todos os modelos gratuitos: 20 requisições por minuto e 50 por dia. Comprar US$ 10 em créditos uma única vez eleva permanentemente o teto diário para 1.000, e esses US$ 10 continuam disponíveis para uso em modelos pagos. Na prática, o plano grátis utilizável da OpenRouter custa US$ 10 uma vez.
O tráfego dos modelos gratuitos é encaminhado a provedores de origem, sob as políticas deles. A configuração padrão não bloqueia aqueles que treinam com suas entradas, mas as configurações de privacidade permitem bloqueá-los, com controles separados para modelos grátis e pagos. Sobre o que esse catálogo entrega na prática, um desenvolvedor no r/ChatGPTCoding comentou:
"Recomendo usar a chave de API da OpenRouter com o modelo gratuito Deepseek/Deepseek R1 0528, sem limite e sem rate limit. Ele é inteligente e tem raciocínio forte."
O catálogo muda todo mês; as recomendações atuais para programação analisam os modelos individualmente.
Outros seis planos gratuitos que merecem atenção
GitHub Models: ambiente de testes gratuito com API de verdade
Qualquer conta do GitHub recebe acesso à API usando apenas um personal access token: sem cartão e sem cadastro separado. Sem assinatura do Copilot, você fica na coluna Copilot Free: 15 RPM / 150 requisições por dia para modelos de faixa baixa, 10 RPM / 50 RPD para os de faixa alta, com cada requisição limitada a 8.000 tokens de entrada + 4.000 de saída. Os modelos de raciocínio têm limites bem menores; o DeepSeek-R1 permite 8 requisições diárias. O GitHub informa que esses limites podem mudar sem aviso prévio.
Cloudflare Workers AI: 10.000 Neurons por dia e garantia de não usar dados para treinamento
A Cloudflare mede o uso em Neurons: 10.000 por dia, reiniciados às 00:00 UTC, tanto nos planos Free quanto Paid do Workers. Pela tabela de conversão da Cloudflare, isso equivale aproximadamente a 280K tokens de saída diários no llama-3.1-8b-fast. A empresa também afirma por escrito que não usará conteúdo de clientes para treinar modelos ou melhorar serviços sem consentimento — o compromisso de dados mais forte entre os nove e o motivo para priorizá-la em trabalhos sensíveis à privacidade.
Cohere, NVIDIA, Hugging Face e Mistral: opções menores ou pouco transparentes
| Provedor | Cota gratuita | O porém |
|---|---|---|
| Cohere | Chave de teste: 20 req/min | 1.000 chamadas/mês no total: serve para avaliação, não para operação |
| NVIDIA build.nvidia.com | 1.000 créditos no cadastro; até 5.000 com e-mail corporativo | Créditos únicos, não um plano recorrente, e sem taxa publicada de conversão entre créditos e requisições |
| Hugging Face Inference Providers | US$ 0,10/mês em créditos para mais de 200 modelos | Suficiente apenas para demonstrações e marcado como "sujeito a alterações" |
| Mistral | Modo gratuito para chaves de API | Os limites não são publicados; aparecem apenas no Admin Panel |
Além de texto: imagem, voz e embeddings por US$ 0
Fora do texto, os planos gratuitos são mais restritos. A geração de imagens é o exemplo mais claro: os modelos de imagem do Gemini aparecem como "Não disponível" no plano grátis, deixando a implementação de FLUX da Cloudflare, dentro dos mesmos 10.000 Neurons diários, como a principal opção sem cartão. Para fala em texto, o cenário é melhor: a Groq reserva ao whisper-large-v3 uma cota gratuita própria de 2.000 requisições e 28.800 segundos de áudio por dia. Em embeddings, tanto o Gemini, com gemini-embedding-001 no plano gratuito, quanto o GitHub Models, com 15 RPM / 150 RPD, funcionam sem pagamento.
Se os dados importam, a lista se reduz a dois
Cloudflare e Groq são os únicos dois provedores desta lista que assumem por escrito o compromisso de não treinar com nem reter entradas do plano gratuito. O Google declara o oposto sem rodeios, e os outros cinco não dizem nada nas páginas em que você procuraria essa informação — o que, para dados reais de usuários, significa uma questão em aberto, não segurança.
Uma chave compartilhada ou intermediada, encontrada em um repositório do GitHub ou servidor do Discord, nem deveria entrar na lista: seu tráfego passa pela conta de um desconhecido, e o acesso termina quando a conta dele terminar.
Quando o plano gratuito deixa de bastar
Você superou os planos gratuitos quando qualquer uma destas situações passa a ser rotina:
- Um teto diário interrompe trabalho de verdade: os 100K tokens/dia do Groq 70B equivalem a um único job em lote moderado.
- Você precisa de uma categoria de modelo que nenhum plano gratuito oferece. Modelos de raciocínio de ponta e geração de imagens estão ausentes ou restritos nos nove planos acima.
- Você gasta tempo de engenharia alternando entre provedores para escapar dos limites.
O excedente custa menos do que parece: modelos medidos da classe flash são cobrados por milhão de tokens, então um dia além dos 100K gratuitos da Groq custa centavos em um agregador como o AIReiter. Groq, OpenRouter, Cloudflare e Gemini oferecem endpoints compatíveis com OpenAI, portanto a troca normalmente se resume a mudar a URL base.
| Sua situação | Continuar no grátis ou pagar? |
|---|---|
| Protótipo, sem dados reais de usuários | Grátis: Google AI Studio (variedade) ou Groq (volume) |
| Dados sensíveis à privacidade, baixo volume | Grátis: Cloudflare Workers AI (garantia de não treinamento) |
| Testar muitos modelos gastando pouco | OpenRouter: 50 req/dia grátis; uma compra única de US$ 10 libera 1.000/dia |
| Limites diários interrompem trabalho real | Pagamento conforme o uso; planos gratuitos como contingência |
Perguntas frequentes
Existe uma API de IA totalmente grátis?
Sim. Google AI Studio, Groq, GitHub Models e Cloudflare Workers AI oferecem acesso funcional à API sem método de pagamento cadastrado, em 29 de julho de 2026. Todos aplicam limites diários ou por minuto. O plano gratuito do Google também usa seus prompts para melhorar os produtos da empresa.
Qual API de IA é grátis sem cartão de crédito?
Os nove provedores da tabela comparativa acima emitem chaves sem cartão. O que os diferencia é o tamanho da cota e a política de dados: compare as 14.400 requisições/dia da Groq com as 1.000 chamadas/mês da Cohere, ou o compromisso de não treinamento da Cloudflare com a posição oposta do Google.
Qual API do GPT é grátis?
A API da própria OpenAI não tem plano gratuito, mas os modelos gpt-oss de pesos abertos da OpenAI são gratuitos em três plataformas: Groq, com gpt-oss-120b e 1.000 requisições/dia; Cloudflare Workers AI, dentro dos 10.000 Neurons diários; e OpenRouter, com openai/gpt-oss-20b:free. O GitHub Models também disponibiliza modelos OpenAI GPT hospedados no Azure em seu plano grátis, excluindo a série o e a classe GPT-5.
Qual é o plano gratuito de API de IA mais generoso?
Depende do critério. Em número bruto de requisições, o llama-3.1-8b-instant da Groq, com 14.400/dia. Em volume de tokens, os 10.000 Neurons/dia da Cloudflare. Em qualidade de modelo sem custo, o Google AI Studio, que inclui Gemini 2.5 Pro, embora com a contrapartida do uso de dados para treinamento.
