Uma chamada do Gemini 3.8 Flash pode parecer barata a $0.75 por milhão de tokens de entrada — mas esse é só o preço promocional. O Google informa que as tarifas padrão dobrarão a partir de 1º de janeiro de 2027, e tokens de raciocínio somados a novas tentativas podem elevar bastante o custo de cada tarefa aceita. Para planejar o orçamento, use a tabela de janeiro e a sua taxa de sucesso, não apenas o preço de token exibido hoje.
O que importa no orçamento de agentes
Para quem desenvolve agentes, a métrica relevante não é o custo por chamada de API. É o custo por tarefa bem-sucedida: todo o gasto com modelo e ferramentas dividido pelas execuções aprovadas no seu teste de aceitação.
O Gemini 3.8 Flash faz mais sentido em trabalhos complexos, de várias etapas, nos quais o raciocínio adicional evita novas tentativas ou melhora a taxa de resultados aceitos. Ele não precisa ser a escolha padrão para toda extração de formato fixo ou rota simples de classificação.
“se você está escolhendo o flash para loops de agentes, precifique a fatura de janeiro, não a página da api de hoje.” — Vraj (@vraj_ai), 3 de setembro de 2026
Quanto custará a API Gemini 3.8 Flash a partir de janeiro de 2027
A documentação de preços da API Gemini e a documentação do modelo do Google mostram tarifas promocionais até 31 de dezembro de 2026. As tarifas padrão passam a valer em 1º de janeiro de 2027.
| Modalidade de cobrança | Entrada até 31 de dez. de 2026 | Saída até 31 de dez. de 2026 | Entrada a partir de 1º de jan. de 2027 | Saída a partir de 1º de jan. de 2027 |
|---|---|---|---|---|
| Padrão | $0.75 / 1M | $3.75 / 1M | $1.50 / 1M | $7.50 / 1M |
| Lote | $0.375 / 1M | $1.875 / 1M | $0.75 / 1M | $3.75 / 1M |
| Flex | $0.375 / 1M | $1.875 / 1M | $0.75 / 1M | $3.75 / 1M |
| Prioridade | $1.35 / 1M | $6.75 / 1M | $2.70 / 1M | $13.50 / 1M |
| Entrada em cache | $0.075 / 1M | — | $0.15 / 1M | — |
Essas são tarifas por token, não a fatura completa de um agente. Grounding documentado, armazenamento de cache, ferramentas externas, hospedagem e taxas de provedores podem gerar cobranças adicionais. A cobrança de saída inclui os tokens de pensamento, e não apenas a resposta visível.
Para trabalhos que toleram espera, Batch é a alavanca mais útil de orçamento. Depois da mudança, o preço de Batch será igual ao preço atual da modalidade Padrão, desde que a carga de trabalho se qualifique e a superfície da API realmente aplique a tarifa de Batch.
A fórmula do custo por tarefa bem-sucedida
Em vez de multiplicar tokens por uma única tarifa, trabalhe com quatro camadas:
- Custo do modelo por tentativa =
(tokens de entrada × tarifa de entrada) + (tokens de saída × tarifa de saída). - Custo da tentativa = custo do modelo mais cobranças de ferramentas, grounding, armazenamento e infraestrutura.
- Custo esperado por tarefa bem-sucedida = custo da tentativa ÷ probabilidade de sucesso.
- Custo observado por tarefa bem-sucedida = gasto total ÷ tarefas aceitas.
Em um loop de agente, inclua cada turno do modelo e cada nova tentativa. Se uma execução faz três chamadas antes de devolver uma resposta, os tokens de entrada e saída serão a soma das três chamadas. Inclua os tokens de pensamento no uso de saída; o Google expõe campos de uso como promptTokenCount, thoughtsTokenCount e candidatesTokenCount nas respostas do Gemini.
Exemplo prático: 20.000 tokens de entrada e 5.000 de saída
Considere que uma tentativa completa consome 20.000 tokens de entrada e 5.000 tokens de saída. Neste exemplo, ignore as cobranças de ferramentas.
| Período | Cálculo | Custo por tentativa | Com 70% de sucesso, custo por tarefa bem-sucedida |
|---|---|---|---|
| Até 31 de dez. de 2026 | 0.02 × $0.75 + 0.005 × $3.75 | $0.03375 | $0.0482 |
| A partir de 1º de jan. de 2027 | 0.02 × $1.50 + 0.005 × $7.50 | $0.06750 | $0.0964 |
A mudança de tarifas dobra o custo se o consumo de tokens e a probabilidade de sucesso permanecerem iguais. Se o agente fizer uma nova tentativa em parte das falhas, a média real ficará acima dessa estimativa simples, pois as tentativas que falham também consomem tokens.
O denominador faz toda a diferença. Um agente que custa $0.05 por chamada, mas tem sucesso em metade das execuções, custa $0.10 por tarefa aceita antes das cobranças de ferramentas; já uma chamada de $0.08 com 90% de sucesso custa cerca de $0.0889 por tarefa aceita.
Três cenários de orçamento que mudam a conclusão
Extração com formato fixo
Uma rota de PDF para JSON com esquema estável geralmente tem um teste de aceitação claro: os campos obrigatórios existem, os tipos são validados e não há texto extra. Comece com raciocínio low e meça se a tarefa passa. Pagar pelo esforço high quando a validação já é aprovada aumenta o custo sem melhorar o denominador.
A documentação do modelo do Google descreve os níveis de raciocínio low, medium e high para o Gemini 3.8 Flash; minimal não é suportado. Trate o nível de raciocínio como uma configuração de custo por rota, e não como um padrão único para toda a aplicação.
Trabalho de agente com contexto longo
Um agente de programação ou pesquisa pode reproduzir um contexto extenso ao longo de vários turnos e, depois, gerar mais raciocínio e chamadas de ferramentas. Nesse caso, entrada em cache, menos tentativas e uma taxa de sucesso maior podem importar mais do que a tarifa nominal de saída.
Em uma tarefa longa, registre separadamente a repetição de contexto e a entrada nova. Uma janela de contexto de 1 milhão de tokens não torna esses tokens gratuitos. Se a rota for interativa, Padrão ou Prioridade podem ser adequados; se puder executar durante a noite, compare Batch ou Flex com a exigência de prazo.
Automação com muitas novas tentativas
Suponha que uma rota custe $0.0675 por tentativa após 1º de janeiro e tenha sucesso em 70% dos casos. Considerando tentativas independentes e sem limite de repetições, o número esperado de tentativas por sucesso é aproximadamente 1 ÷ 0.70 = 1.43, ou cerca de $0.0964 em custo de modelo por tarefa aceita.
Se as falhas acionarem operações caras no navegador, chamadas de busca ou revisão humana, inclua esses custos no numerador. Um agente pode ser barato em tokens e caro na operação.
Quando o Gemini 3.8 Flash ainda justifica o preço maior
Use o Gemini 3.8 Flash quando o raciocínio extra realmente muda o resultado: menos patches rejeitados, menos sequências de ferramentas que falham, melhor verificação em múltiplas etapas ou maior taxa de aceitação em tarefas difíceis. Mantenha uma rota mais barata para transformações repetitivas, roteamento, extração e outros trabalhos cujos testes de aceitação já passam com baixo esforço.
Números independentes divulgados pela Artificial Analysis e resumidos pela Apidog situam o Gemini 3.8 Flash em cerca de $0.58 por tarefa de benchmark em uma configuração de alto raciocínio, contra aproximadamente $0.40 para o Gemini 3.7 Flash, com pontuação de 59 contra 56 no Intelligence Index. São números específicos de benchmark, não uma previsão universal de fatura; use-os como evidência de que o consumo de tokens pode alterar a economia, e não como cotação para a sua carga de trabalho.
Relatos da comunidade apontam na mesma direção. Jan (@jan_volad) informou cerca de 120 milhões de tokens de saída em uma comparação do Gemini 3.8 Flash, ante 29–35 milhões dos concorrentes, e descreveu um custo combinado de $0.58 por tarefa; trata-se de uma observação de usuário, não de uma fatura de produção auditada de forma independente. A publicação é útil por mostrar como uma tarifa baixa por milhão de tokens pode superestimar a economia.
Uma regra prática de roteamento é:
- Tarefa difícil de agente: teste o Gemini 3.8 Flash em
mediumouhighe meça o custo por tarefa aceita. - Tarefa rotineira: teste primeiro em
low; mantenha a rota apenas se ela passar pelo controle de qualidade. - Trabalho em volume que tolera espera: compare Batch com Padrão após 1º de janeiro.
- Qualquer rota com qualidade incerta: não otimize a tarifa por token antes de medir a probabilidade de sucesso.
Perguntas frequentes sobre os preços do Gemini 3.8 Flash
Batch é sempre mais barato?
Batch é mais barato na tabela de tarifas divulgada, mas foi pensado para cargas de trabalho que podem tolerar processamento adiado. Não é uma substituição direta para um agente interativo que precisa responder imediatamente.
Como calculo o custo por tarefa bem-sucedida de um agente?
Some as cobranças de modelo, ferramentas, grounding e infraestrutura na janela de execução e divida pelas execuções aprovadas no seu teste de aceitação. Para uma previsão, divida o custo esperado por tentativa pela probabilidade estimada de sucesso e inclua as novas tentativas esperadas.
Na prática: faça o orçamento da rota, não do modelo
Registre, por rota, os tokens de entrada, pensamento e saída visível, os turnos de ferramentas, as novas tentativas, a latência, o gasto e o status de aceitação. Teste os níveis de raciocínio relevantes e projete tanto a tabela de dezembro quanto a de janeiro.
A decisão é simples: use o Gemini 3.8 Flash onde o raciocínio adicional gera resultados bem-sucedidos, use menor esforço em trabalhos que já passam e leve tarefas em lote elegíveis para Batch. A alteração de preços de janeiro de 2027 está atualmente programada na tabela publicada; a viabilidade econômica do modelo depende dos tokens e das falhas por trás de cada resultado bem-sucedido.