Gemini 3.5 Flash-Lite: preço, velocidade e quando usar

Última Atualização: 2026-07-22 07:16:40

Para processar grandes volumes sem estourar o orçamento, o Gemini 3.5 Flash-Lite é hoje a porta de entrada mais barata da linha Gemini: $0.30 por milhão de tokens de entrada e $2.50 por milhão de tokens de saída. Em uma comparação rápida com o Gemini 3.6 Flash, ele custou 94% menos nas mesmas tarefas, começou a responder antes e acertou tudo. A contrapartida é clara: ele foi feito para escala e baixa latência, não para raciocínio profundo. Para cargas de trabalho diretas e de alto volume, é a escolha natural.

O que é o Gemini 3.5 Flash-Lite

O Flash-Lite ocupa a faixa mais básica dos modelos rápidos do Gemini. Ele foi projetado para tarefas simples e frequentes, nas quais o custo por chamada e a latência pesam mais do que inteligência bruta. Estes são os pontos principais:

  • Preço: $0.30 por 1M de tokens de entrada e $2.50 por 1M de tokens de saída.
  • Contexto: 1M de tokens, o mesmo dos modelos Flash maiores.
  • Velocidade: o Google informa cerca de 350 tokens de saída por segundo.
  • Inteligência: 36 no Artificial Analysis Index, contra 50 do mais caro 3.6 Flash. Essa diferença é o preço da economia.

Ele foi lançado ao lado do 3.6 Flash e do 3.5 Flash Cyber, voltado a segurança, mas atende a uma proposta bem diferente: classificação, extração, roteamento, aplicação de tags e chat simples em escala.

Preço: a opção mais econômica do Gemini

Na comparação com o restante da linha, o Flash-Lite é muito mais barato. Todos os valores abaixo vêm da página oficial de preços do Google:

ModeloEntrada /1MSaída /1M
Gemini 3.5 Flash-Lite$0.30$2.50
Gemini 3.6 Flash$1.50$7.50
Gemini 3.5 Flash (anterior)$1.50$9.00

Antes mesmo de considerar quantos tokens cada modelo de fato consome, o Flash-Lite já custa 5x menos na entrada e 3x menos na saída que o 3.6 Flash. É no consumo real de tokens, porém, que a diferença fica ainda maior.

Teste prático contra o 3.6 Flash

Em 22 de julho de 2026, enviei os mesmos três prompts para ambos os modelos pelo OpenRouter, com temperatura 0: uma tarefa de programação, um problema de raciocínio e uma extração em JSON.

Métrica (3 tarefas, temp. 0)Gemini 3.5 Flash-LiteGemini 3.6 Flash
Tokens de entrada147148
Tokens de saída5433,058
Custo total$0.0014$0.023
Tempo médio até o primeiro token1.2s4.5s
Velocidade de geraçãomais de 400 tok/s
Respostas corretas3 / 33 / 3

O Flash-Lite foi 94% mais barato e acertou as três tarefas, incluindo o problema de horários de trem com várias etapas. Dois fatores explicam a diferença. Ele transmitiu mais de 400 tokens por segundo — acima dos 350 informados — e entregou o primeiro token mais rápido porque não para para “pensar” como o 3.6 Flash. Além disso, foi muito mais conciso: algumas centenas de tokens de saída, em vez de vários milhares. O 3.6 Flash consome muitos tokens ocultos de raciocínio, que entram na sua conta. Em tarefas simples, esse raciocínio adicional é um custo desnecessário.

Gráfico de barras mostrando que o Gemini 3.5 Flash-Lite custa cerca de 6 por cento do Gemini 3.6 Flash nas mesmas três tarefas

A diferença de resposta também é perceptível no uso. Em média, o Flash-Lite devolveu o primeiro token em cerca de 1.2 segundos, contra 4.5 segundos do 3.6 Flash. Em um chat ou pipeline de alto volume, ele simplesmente parece mais ágil.

Gráfico de barras do tempo médio até o primeiro token: Gemini 3.5 Flash-Lite em 1.2 segundos contra Gemini 3.6 Flash em 4.5 segundos

Há duas ressalvas importantes. Primeiro, este foi um único teste com temperatura 0, e os modelos variam entre execuções; por isso, trate os números exatos como indicativos, não como benchmark. Segundo, as três tarefas eram fáceis. A diferença no Intelligence Index, de 36 contra 50, é real e aparece em problemas mais difíceis, agentes complexos com múltiplas etapas, programação mais sutil ou qualquer cenário que exija raciocínio cuidadoso. Nesses casos, o orçamento limitado de raciocínio do Flash-Lite deixa de ser economia e vira uma limitação.

Quando usar o Flash-Lite — e quando subir de nível

  • Use o Gemini 3.5 Flash-Lite em tarefas de menor complexidade, alto volume e sensíveis à latência: classificação, extração de entidades, roteamento e triagem, tags, resumo de textos curtos e chat simples. Nesse preço, dá para operá-lo em uma escala que seria desconfortável no 3.6 Flash.
  • Prefira o 3.6 Flash quando a tarefa exigir raciocínio de verdade: programação com agentes, uso de computador, fluxos de trabalho com várias etapas ou qualquer situação em que errar saia caro. O guia completo do Gemini 3.6 Flash detalha os benchmarks e preços dessa opção.

Um padrão comum é combinar os dois: encaminhar o grande volume de chamadas simples e baratas para o Flash-Lite e escalar apenas os casos difíceis para o 3.6 Flash. Como ambos têm contexto de 1M de tokens e usam a mesma API, a troca se resume a alterar o ID do modelo em uma linha.

Como acessar o Gemini 3.5 Flash-Lite

O modelo já está disponível na Gemini API e no Google AI Studio com o ID gemini-3.5-flash-lite. O AI Studio também oferece uma camada gratuita para testes. Se você usa um agregador, tanto o OpenRouter quanto o AIReiter disponibilizam o modelo pelo preço de tabela do Google — uma opção prática para combinar modelos Gemini ou Claude usando uma única chave.

Perguntas frequentes

Quanto custa o Gemini 3.5 Flash-Lite?

$0.30 por 1M de tokens de entrada e $2.50 por 1M de tokens de saída. É a faixa mais barata da linha Gemini.

O Gemini 3.5 Flash-Lite é gratuito?

Há uma camada gratuita no Google AI Studio para prototipagem. Em produção, valem os preços sob demanda informados acima.

Qual é a velocidade do Gemini 3.5 Flash-Lite?

O Google informa cerca de 350 tokens de saída por segundo. No meu teste de streaming, ele passou de 400, com o primeiro token chegando em aproximadamente 1.2 segundos.

O Flash-Lite é suficiente ou devo usar o 3.6 Flash?

Para tarefas simples e de alto volume, o Flash-Lite acerta e custa muito menos. Para trabalho intensivo em raciocínio ou com agentes, a inteligência superior do 3.6 Flash, com Index 50 contra 36, justifica o custo extra.

Leituras relacionadas