Gemini 3.6 Flash: preços, benchmarks e acesso à API

Última Atualização: 2026-07-22 07:21:40

Lançado pelo Google em 21 de julho de 2026, o Gemini 3.6 Flash traz duas mudanças que fazem diferença para quem opera agentes em escala: o preço dos tokens de saída caiu de US$ 9,00 para US$ 7,50 por milhão, e o modelo realiza o mesmo trabalho com cerca de 17% menos tokens de saída. Somando os dois fatores, a conta por tarefa em cargas intensivas em saída pode cair aproximadamente um terço. Ele também supera o antigo 3.5 Flash — e, na maior parte dos testes, até o maior Gemini 3.1 Pro — em benchmarks de programação e agentes. Para quem já usa o 3.5 Flash, a atualização é quase gratuita, embora seu preço de tabela não seja o menor da categoria.

O que o Google lançou em 21 de julho

Foram três modelos lançados de uma vez, cada um voltado a um tipo de necessidade:

  • Gemini 3.6 Flash (gemini-3.6-flash): o modelo principal para quem busca rapidez sem abrir mão de inteligência. Tem contexto de 1 milhão de tokens, saída máxima de 64 mil tokens e corte de conhecimento atualizado para março de 2026, ante janeiro de 2025.
  • Gemini 3.5 Flash-Lite: modelo de alto throughput, com cerca de 350 tokens de saída por segundo e preço bem menor para tarefas simples e de alto volume.
  • Gemini 3.5 Flash Cyber: variante ajustada para segurança, capaz de encontrar, validar e corrigir vulnerabilidades. Ela roda dentro do CodeMender e está em um piloto de acesso limitado para governos e parceiros confiáveis; não é um lançamento aberto ao público.
Página oficial de preços da API Gemini mostrando o Gemini 3.6 Flash por US$ 1,50 de entrada e US$ 7,50 de saída por 1 milhão de tokens

A página oficial do modelo descreve o 3.6 Flash como "nosso modelo mais inteligente criado para velocidade", e os valores estão publicados na página de preços da API Gemini do Google.

Esse lançamento não aconteceu isoladamente. O Gemini 3.5 Pro, modelo principal da empresa, teve seu cronograma adiado, enquanto a DeepMind afirmou já ter iniciado o pré-treinamento do Gemini 4. A renovação da linha Flash preenche esse intervalo até a chegada dos lançamentos maiores.

Preço do Gemini 3.6 Flash: por que o corte parece maior do que é

Na API padrão, o Gemini 3.6 Flash custa US$ 1,50 por 1 milhão de tokens de entrada e US$ 7,50 por 1 milhão de tokens de saída — e os tokens de saída incluem os tokens de raciocínio. O cache de contexto custa US$ 0,15 por 1 milhão, com taxa de armazenamento de US$ 1,00 por 1 milhão por hora.

Há um detalhe que boa parte da cobertura do lançamento deixa passar: a redução vale apenas para a saída. O Gemini 3.5 Flash anterior cobrava US$ 1,50 na entrada e US$ 9,00 na saída. A entrada não mudou; a saída caiu de US$ 9,00 para US$ 7,50, uma redução de 16,7%, e não um desconto geral. Em uma carga dominada por entrada — documentos longos enviados para respostas curtas, por exemplo — a economia de tabela será modesta. O principal ganho aparece em outro lugar.

O que importa é o custo por tarefa, não o preço de tabela

Comparar gerações de modelos apenas pelo preço por token é usar a unidade errada. O custo real é preço × tokens consumidos. Aqui, dois fatores mudaram: a taxa de saída está 16,7% menor, e o Google, via o Artificial Analysis Index, informa cerca de 17% menos tokens de saída para o mesmo trabalho. No melhor cenário, a conta fica em torno de 0.833 × 0.83 ≈ 0.69, ou aproximadamente 31% menos na saída.

Quanto disso aparece na prática depende da carga de trabalho. Por isso, executei os mesmos três prompts — uma tarefa de programação, um problema de raciocínio e uma extração de JSON — nos dois modelos pelo OpenRouter, com temperatura 0, em 22 de julho de 2026:

Métrica (3 tarefas, temp 0)Gemini 3.6 FlashGemini 3.5 Flash
Tokens de entrada146145
Tokens de saída2,7362,593
Custo totalUS$ 0,0207US$ 0,0236
Latência total5,20s5,19s

Os dois modelos entregaram respostas corretas e comparáveis. Nessa amostra pequena, o 3.6 Flash saiu cerca de 12% mais barato, praticamente na mesma velocidade, apesar de emitir alguns pontos percentuais a mais de tokens por investir mais em raciocínio. A conclusão é simples: a economia mais confiável vem do corte no preço de saída, de US$ 9,00 para US$ 7,50. O ganho de eficiência de tokens é real no agregado, mas varia conforme a tarefa e nem sempre aparece. Na prática, planeje uma redução de 12% a 17% na saída; os 31% são o melhor caso.

Gráfico de barras do custo de saída por tarefa: Gemini 3.5 Flash em 100, Gemini 3.6 Flash em 88 na medição de três tarefas e 69 no melhor caso com 17% menos tokens

(Amostra pequena: três tarefas, temperatura 0; não é um benchmark formal.)

Gemini 3.6 Flash frente a outros modelos rápidos

O modelo mais barato por token não é necessariamente o que entrega melhor valor. Para colocar a faixa de modelos rápidos em perspectiva, veja os preços lado a lado. Todos os valores são da modalidade padrão, sem batch, por 1 milhão de tokens e extraídos das páginas oficiais de cada fornecedor.

ModeloEntrada /1MSaída /1MContexto
Gemini 3.6 FlashUS$ 1,50US$ 7,501M
Gemini 3.5 Flash (anterior)US$ 1,50US$ 9,001M
Gemini 3.5 Flash-LiteUS$ 0,30US$ 2,501M
Claude Haiku 4.5US$ 1,00US$ 5,00200k
GPT-5.6 LunaUS$ 1,00US$ 6,00
DeepSeek V4 FlashUS$ 0,14US$ 0,281M

O 3.6 Flash não vence no preço de tabela. O Claude Haiku 4.5 e o GPT-5.6 Luna cobram menos pela saída, enquanto o DeepSeek V4 Flash está em outro patamar de custo. A proposta do 3.6 Flash é inteligência por dólar: ele registra 50 no Intelligence Index do Artificial Analysis, bem acima da mediana da categoria rápida, com cerca de 304 tokens de saída por segundo e uma janela de contexto completa de 1 milhão de tokens. Para quem precisa de qualidade de ponta em agentes e programação sem pagar preço de modelo flagship, esse é o argumento a favor dele. Para tarefas simples em que o objetivo é o menor custo possível, os modelos mais baratos da tabela levam vantagem.

Quanto o Gemini 3.6 Flash evoluiu sobre o 3.5 Flash?

O salto de geração é real — e aparece sobretudo justamente onde a linha Flash tinha mais dificuldade: programação de longo horizonte e trabalho com agentes.

BenchmarkGemini 3.5 FlashGemini 3.6 Flash
DeepSWE v1.137%49%
MLE-Bench49.7%63.9%
OSWorld-Verified (uso de computador)78.4%83.0%
SWE-Bench Pro55.1%58.7%
Terminal-Bench 2.176.2%78.0%
Gráfico de barras agrupadas comparando Gemini 3.6 Flash e 3.5 Flash em DeepSWE, MLE-Bench, OSWorld-Verified, SWE-Bench Pro e Terminal-Bench 2.1, com o 3.6 Flash à frente nos cinco

As pontuações vêm da página de modelos Flash do Google DeepMind e do Artificial Analysis. Os avanços em DeepSWE e MLE-Bench chamam mais atenção: 12 e 14 pontos, respectivamente. O Google também informa nota de 1421 no GDPval-AA para trabalho de conhecimento, acima dos 1349 anteriores. Em vários desses testes, o 3.6 Flash supera até o maior e mais caro 3.1 Pro, algo incomum para um modelo Flash.

Gemini 3.6 Flash vs. 3.1 Pro

A surpresa é que este modelo da faixa rápida supera o maior e mais caro Gemini 3.1 Pro em tarefas de agentes e programação. O Gemini 3.1 Pro Preview custa US$ 2,00–US$ 4,00 na entrada e US$ 12,00–US$ 18,00 na saída por 1 milhão de tokens, com valores escalonados pelo tamanho do prompt. Já o 3.6 Flash tem preço fixo de US$ 1,50/US$ 7,50.

Gemini 3.6 FlashGemini 3.1 Pro
Entrada /1MUS$ 1,50US$ 2,00–US$ 4,00
Saída /1MUS$ 7,50US$ 12,00–US$ 18,00
DeepSWE v1.149%12%
SWE-Bench Pro58.7%54.2%
Terminal-Bench 2.178.0%73.8%

O 3.1 Pro continua sendo o modelo maior e mais caro, voltado aos trabalhos mais difíceis de raciocínio e contexto longo. Mas, para a maioria das cargas de programação e agentes, o 3.6 Flash agora é mais barato e obtém notas superiores nos benchmarks acima. Por isso, vale comparar os dois antes de optar automaticamente pela categoria Pro. O comparativo completo entre Gemini 3.6 Flash e 3.1 Pro traz os benchmarks diretos, preços escalonados e um teste prático de velocidade.

Vale migrar do Gemini 3.5 Flash?

Para a maioria das equipes que já usa o 3.5 Flash, sim. A matemática é quase estritamente favorável:

  • Mesmo preço de entrada (US$ 1,50/1M) e menor preço de saída (US$ 7,50 contra US$ 9,00).
  • Menos tokens de saída para a mesma tarefa, cerca de 17% a menos.
  • Corte de conhecimento mais recente: março de 2026, contra janeiro de 2025.
  • Notas superiores em todos os benchmarks de agentes e programação listados acima.

Antes de trocar o modelo em produção, verifique dois pontos. Primeiro, confirme se suas cargas cabem no limite máximo de 64 mil tokens de saída; se você dependia de respostas únicas mais longas, teste esse limite. Segundo, execute seu próprio conjunto de avaliações. Os ganhos de eficiência de tokens e as mudanças no raciocínio podem alterar o comportamento em prompts que já foram ajustados, então avalie latência e qualidade de saída no seu tráfego antes de mudar o padrão.

Flash, Flash-Lite ou Cyber: qual escolher?

Três modelos, três funções:

  • Gemini 3.6 Flash é a escolha padrão. Use-o quando quiser qualidade de ponta para agentes, programação e multimodalidade a preço de modelo rápido.
  • Gemini 3.5 Flash-Lite (US$ 0,30/US$ 2,50, ~350 tokens/s) é indicado para tarefas de alto volume, sensíveis à latência e menos complexas: classificação, extração, roteamento e chat simples. É a maneira mais barata de operar Gemini em escala.
  • Gemini 3.5 Flash Cyber só é relevante para governos ou parceiros de segurança avaliados. É um piloto dentro do CodeMender, não um modelo disponível pela API padrão.

Como acessar o Gemini 3.6 Flash

O modelo já está disponível na API Gemini e no Google AI Studio. O AI Studio oferece uma camada gratuita para prototipagem; depois, você migra para o modelo de pagamento conforme o uso com o ID gemini-3.6-flash, seguindo o mesmo fluxo de Google AI Studio gratuito e depois pago aplicado ao restante da linha Gemini. As superfícies empresariais Antigravity, Android Studio e Gemini Enterprise Agent Platform também estão listadas. Se você precisa especificamente do Vertex AI, confirme a disponibilidade no console do Vertex, pois ela ainda estava sendo liberada em 22 de julho de 2026.

Uma chamada REST mínima para a API Gemini é assim:

curl "https://generativelanguage.googleapis.com/v1beta/models/gemini-3.6-flash:generateContent" \
  -H "x-goog-api-key: $GEMINI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"contents":[{"parts":[{"text":"Summarize agentic AI in one sentence."}]}]}'

Equipes que trabalham com mais de um fornecedor às vezes roteiam os modelos por um agregador, em vez de manter chaves separadas. Tanto o OpenRouter quanto o AIReiter disponibilizam o modelo gemini-3.6-flash pelo preço de tabela do Google; a diferença está no que mais existe por trás da mesma chave. O OpenRouter distribui chamadas entre muitos provedores, enquanto o AIReiter é compatível com Anthropic e roteia Gemini ao lado de Claude. Isso pode ajudar ao comparar o 3.6 Flash com os preços da API Claude em uma única fatura. Para uma implantação com um único modelo, ir direto ao Google é mais simples.

Perguntas frequentes

O Gemini 3.6 Flash é gratuito?

Há uma camada gratuita no Google AI Studio para prototipagem, com limites de uso. Em produção, vale a cobrança conforme o uso: US$ 1,50 na entrada e US$ 7,50 na saída por 1 milhão de tokens.

O Gemini 3.6 Flash é melhor que o 3.5 Flash?

Sim. Nos benchmarks publicados, ele supera o 3.5 Flash em DeepSWE, MLE-Bench, OSWorld-Verified, SWE-Bench Pro e Terminal-Bench, além de custar menos por token de saída e usar menos tokens por tarefa.

O Gemini 3.6 Flash é melhor que o Gemini 3.1 Pro?

Em benchmarks de agentes e programação, como DeepSWE, SWE-Bench Pro e Terminal-Bench, sim — e por um preço menor: US$ 1,50/US$ 7,50 contra US$ 2,00–US$ 4,00/US$ 12,00–US$ 18,00. O Gemini 3.1 Pro é o modelo maior e continua à frente nas tarefas mais difíceis de raciocínio em contexto longo e multimodais, portanto a escolha certa depende da sua carga de trabalho.

Quanto custa o Gemini 3.6 Flash?

US$ 1,50 por 1 milhão de tokens de entrada e US$ 7,50 por 1 milhão de tokens de saída na modalidade padrão. O cache de contexto custa US$ 0,15 por 1 milhão de tokens.

Qual é o corte de conhecimento do Gemini 3.6 Flash?

Março de 2026, acima de janeiro de 2025 no Gemini 3.5 Flash anterior.

O Gemini 3.6 Flash está disponível no Vertex AI?

Ele está confirmado na API Gemini e no Google AI Studio, além de várias superfícies empresariais. A disponibilidade no Vertex AI não foi confirmada explicitamente no lançamento, então consulte o catálogo de modelos do Vertex antes de construir algo sobre ele nessa plataforma.

O que é o Gemini 3.5 Flash Cyber?

É uma variante focada em segurança, ajustada para detectar, validar e corrigir vulnerabilidades de software. Ela roda dentro do agente CodeMender do Google DeepMind e é um piloto de acesso limitado para governos e parceiros confiáveis, não um modelo público.

Leituras relacionadas