Em julho de 2026, já é possível usar algumas das APIs de LLM mais baratas por menos de um décimo de centavo de dólar a cada milhão de tokens de entrada. A Llama 3.1 8B Instant da Groq, por exemplo, custa US$ 0,05 por milhão de tokens de entrada e US$ 0,08 por milhão de tokens de saída, segundo a página de preços da própria empresa, consultada neste mês.
Mas esse valor de tabela não é necessariamente o que chega na sua fatura. O cache de prompt pode derrubar o preço efetivo de entrada da DeepSeek em 50 a 120 vezes, enquanto APIs em lote reduzem mais 50% nos serviços da Gemini, Mistral e Groq. Comparar apenas os preços nominais pode levar você a pagar mais ou a escolher o provedor errado para sua carga de trabalho. A seguir, veja o custo das opções econômicas, com todos os valores conferidos nas páginas de preços dos provedores em 30 de julho de 2026, e em quais cenários cada uma faz mais sentido.
As APIs de LLM mais baratas em julho de 2026
As menores tarifas vêm de modelos compactos ou otimizados para eficiência, operados por especialistas em inferência — não dos endpoints principais dos laboratórios de fronteira. Os preços abaixo são os valores padrão sob demanda, no modelo pay-as-you-go, dos principais provedores diretos. A coluna de plano gratuito indica onde há uma opção sem custo. Ficaram de fora self-hosting e promoções temporárias.
| Modelo (provedor) | Entrada / 1M | Saída / 1M | Entrada com acerto de cache | Plano gratuito | Mais barato para |
|---|---|---|---|---|---|
| Llama 3.1 8B Instant (Groq) | US$ 0,05 | US$ 0,08 | US$ 0,025 | Sim | Menor preço padrão |
| GPT-OSS 20B (Groq) | US$ 0,075 | US$ 0,30 | US$ 0,0375 | Sim | Barato, 1000 tok/s |
| Gemini 2.5 Flash-Lite (Google) | US$ 0,10 | US$ 0,40 | — | Sim | Mais barata em lote (US$ 0,05 entrada) |
| Ministral 3B (Mistral) | US$ 0,10 | US$ 0,10 | — | Leanstral (limitado) | Preço baixo e uniforme |
| DeepSeek V4 Flash (DeepSeek) | US$ 0,14 | US$ 0,28 | US$ 0,0028 | Não | Mais barata para raciocínio |
| Mistral Small 4 (Mistral) | US$ 0,15 | US$ 0,60 | −90% | Não | Uso geral equilibrado |
| Gemini 3.5 Flash-Lite (Google) | US$ 0,30 | US$ 2,50 | — | Sim | Multimodal em escala |
O menor patamar é o da Llama 3.1 8B da Groq, a US$ 0,05/US$ 0,08; nenhum outro modelo desta tabela iguala seu preço de saída. A Gemini 2.5 Flash-Lite chega a US$ 0,05 na entrada apenas na modalidade separada de processamento em lote — no preço padrão, são US$ 0,10. Para tarefas de raciocínio com orçamento apertado, a DeepSeek V4 Flash é a escolha indicada.
Por que custam menos que GPT ou Claude
Há três razões principais para esses preços baixos: modelos menores ou ajustados para eficiência, como Llama 3.1 8B, Ministral 3B e a linha Flash-Lite; especialistas em inferência que operam infraestrutura mais barata, como Groq e DeepSeek; e descontos para processamento em lote e tokens em cache. A maioria dos modelos listados tem pesos abertos — Llama, DeepSeek e Mistral. Já a Gemini Flash-Lite é uma linha proprietária do Google, precificada de forma agressiva para disputar volume. Hospedar pesos abertos por conta própria pode sair ainda mais barato com volumes muito altos e constantes, mas somente depois de absorver custos de hardware e operação. Para a maioria das equipes, APIs hospedadas continuam sendo a referência.
Plano gratuito: o menor custo possível
Se "mais barata" significa gratuita, vários provedores desta lista oferecem alguma alternativa sem custo: as famílias Groq e Gemini Flash-Lite do Google são gratuitas dentro dos limites de taxa; a Mistral disponibiliza o Leanstral gratuitamente por um período limitado; e o GitHub Models oferece acesso gratuito com um token. O plano gratuito do Google usa as solicitações no treinamento de produtos, o que não ocorre no plano pago. Em todos os casos, os limites de taxa são restritivos e não há SLA. Reunimos essas alternativas em um detalhamento separado no nosso guia de APIs de IA gratuitas; para qualquer uso além de protótipos, as opções pagas da tabela acima são as que importam.
O erro de olhar só o preço por token: cache e lote reduzem a conta real
Uma tabela ordenada pelo preço nominal de entrada esconde mais do que revela. Três fatores podem alterar o custo efetivo em várias ordens de grandeza, e muitos comparativos omitem ou deixam todos eles em segundo plano.
"A grande ilusão dos preços baixos nas APIs de LLM." — discussão no r/LocalLLaMA sobre como o preço de destaque de um modelo ocultava uma fatura dominada pelos custos de leitura de cache.
Os provedores cobram separadamente pela entrada em cache, pela entrada nova e pela saída. E a linha de entrada que parece barata costuma ser a menor parte da fatura. Veja os três pontos que precisam entrar na comparação:
- Cache de prompt. Quando o provedor consegue reutilizar um prefixo enviado anteriormente, a parcela armazenada em cache passa a custar uma fração do preço de entrada. A DeepSeek cobra US$ 0,0028 por milhão pela entrada em cache na V4 Flash, contra US$ 0,14 para entrada nova: desconto de 50 vezes. Na V4 Pro, são US$ 0,0036 contra US$ 0,435, um desconto de 120 vezes. A Groq reduz a entrada em cache pela metade, e a Mistral oferece 90% de desconto. Se seus prompts compartilham um prompt de sistema longo ou o prefixo de um documento, mas seu provedor não lida bem com cache, você paga o preço cheio a cada solicitação.
- API em lote. Google, Mistral e Groq oferecem cerca de 50% de desconto para trabalhos não em tempo real, processados em uma janela de 24 horas a 7 dias. Na modalidade em lote, a entrada da Gemini 2.5 Flash-Lite cai para US$ 0,05. Tudo que não exige resposta em menos de um segundo — sumarização noturna, classificação em massa e rotulagem de datasets — deve passar por lote.
- Cargas com muita saída. Geração de código, textos longos e loops agênticos produzem muito mais tokens do que consomem. Nesses casos, os US$ 0,08 de saída da Llama 3.1 8B superam os US$ 0,40 da Gemini 2.5 Flash-Lite, apesar do custo de entrada parecido. Quando a geração é o gargalo, ordene os modelos pelo preço de saída, não pelo de entrada.
Antes de decidir pelo preço de tabela, faça três perguntas: seus prompts aproveitam bem o cache? A tarefa precisa ser em tempo real? Você gera mais tokens do que lê? Essas respostas mudam a ordem da tabela acima com mais frequência do que os valores de destaque.
A opção mais barata para cada caso de uso
Estas escolhas partem do princípio de que você precisa de um nível mínimo de capacidade acima dos modelos menores; se fosse apenas pelo preço bruto, a Llama 3.1 8B apareceria em todas as linhas. A avaliação equilibra o custo real, incluindo cache e lote quando aplicáveis, com esse patamar de capacidade.
| Caso de uso | Opção mais barata | Motivo |
|---|---|---|
| Chat geral / classificação | Mistral Small 4 | Modelo de uso geral intermediário acima do patamar 3B/8B; US$ 0,15/US$ 0,60 |
| Programação e loops agênticos | Groq GPT-OSS 20B ou Llama 3.1 8B | Saída abaixo de US$ 0,08, com 840–1000 tok/s para manter os loops rápidos |
| Raciocínio / prompts difíceis | DeepSeek V4 Flash | US$ 0,14/US$ 0,28, ajustada para raciocínio; usa cache de forma agressiva |
| Documentos de contexto longo | Gemini 3.5 Flash-Lite | Janela de contexto ampla e plano gratuito para testar |
| Tempo real / foco em baixa latência | Groq (qualquer modelo) | Provedor barato que também lidera em throughput, 840–1000 tok/s |
| Processamento em massa / noturno | Gemini 2.5 Flash-Lite (lote) | US$ 0,05 de entrada em lote, 50% de desconto para processamento assíncrono |
Agregador ou integração direta: quando um revendedor realmente sai mais barato
Integrar diretamente com DeepSeek, Google, Groq ou Mistral garante o menor valor por token para um determinado modelo. O custo aparece na operação: chaves de API e cobranças separadas, failover manual quando um provedor limita suas requisições e a necessidade de reimplementar cache e lógica de retentativa em quatro SDKs diferentes.
É essa lacuna que os agregadores vendem. O OpenRouter cobra o preço do provedor de origem acrescido de uma taxa de plataforma de 5,5%, sem markup adicional, e entrega uma única chave, uma única fatura e failover automático entre os modelos desta lista. Segundo a análise do próprio OpenRouter, o ponto de virada fica em torno de US$ 50/mês: abaixo disso, a taxa de 5,5% custa menos do que o tempo de engenharia para conectar vários provedores; acima desse valor, integrar diretamente com o único provedor mais barato normalmente vence em custo bruto. O ponto de equilíbrio real depende de quantos provedores você integraria de outra forma e da volatilidade do seu tráfego.
A mesma lógica vale para um gateway revendedor como o AIReiter: um endpoint compatível com OpenAI diante de DeepSeek, Gemini, Groq e Mistral. Assim, você troca de modelo alterando o nome dele, em vez de reescrever o cliente.
Perguntas frequentes
Qual é a API de LLM mais barata?
A Llama 3.1 8B Instant da Groq, por US$ 0,05/US$ 0,08 por milhão de tokens, tem a menor tarifa padrão sob demanda desta comparação em julho de 2026. A Gemini 2.5 Flash-Lite iguala os US$ 0,05 de entrada apenas na modalidade em lote — o preço padrão é US$ 0,10.
Qual é a API de LLM mais barata para programação?
O GPT-OSS 20B da Groq (US$ 0,075/US$ 0,30) ou a Llama 3.1 8B (US$ 0,05/US$ 0,08) vencem em preço de saída e velocidade para geração de código e loops agênticos. A Devstral Small 2 da Mistral, por US$ 0,10/US$ 0,30, é a opção econômica se você precisa de um modelo ajustado para programação fora da Groq.
Um plano gratuito de API de LLM é suficiente para produção?
Normalmente, não. Os planos gratuitos da Groq, Gemini Flash-Lite e GitHub Models limitam requisições por minuto e não oferecem garantia de disponibilidade. Eles funcionam bem para protótipos. Depois dos testes iniciais, passe para as opções pagas da tabela acima.
APIs de agregadores ou revendedores são mais caras que integrar direto?
Por token, sim, um pouco. O OpenRouter acrescenta 5,5% sobre o preço do provedor, e gateways revendedores embutem uma sobrecarga semelhante. No total, porém, podem sair mais baratos quando seu gasto é baixo ou quando você teria de manter várias integrações de provedores. Tornam-se mais caros quando a taxa supera o valor da conveniência.
Quanto custa por mês a API de LLM mais barata?
Para 10 milhões de tokens de entrada e 5 milhões de tokens de saída por mês, a Llama 3.1 8B da Groq custa cerca de US$ 0,90 (US$ 0,50 de entrada + US$ 0,40 de saída). A Gemini 2.5 Flash-Lite fica em cerca de US$ 3,00 nas tarifas padrão ou US$ 1,50 em lote. O mesmo volume em um modelo proprietário de fronteira (US$ 5+/M de entrada) custa muitas vezes mais.
O que escolher
Ative o cache de prompt sempre que o provedor oferecer suporte e envie tarefas não em tempo real para processamento em lote. Essas duas decisões economizam mais do que trocar de provedor jamais economizará.
