Lançado pelo Google em 21 de julho de 2026, o Gemini 3.6 Flash traz duas mudanças que fazem diferença para quem opera agentes em escala: o preço dos tokens de saída caiu de US$ 9,00 para US$ 7,50 por milhão, e o modelo realiza o mesmo trabalho com cerca de 17% menos tokens de saída. Somando os dois fatores, a conta por tarefa em cargas intensivas em saída pode cair aproximadamente um terço. Ele também supera o antigo 3.5 Flash — e, na maior parte dos testes, até o maior Gemini 3.1 Pro — em benchmarks de programação e agentes. Para quem já usa o 3.5 Flash, a atualização é quase gratuita, embora seu preço de tabela não seja o menor da categoria.
O que o Google lançou em 21 de julho
Foram três modelos lançados de uma vez, cada um voltado a um tipo de necessidade:
- Gemini 3.6 Flash (
gemini-3.6-flash): o modelo principal para quem busca rapidez sem abrir mão de inteligência. Tem contexto de 1 milhão de tokens, saída máxima de 64 mil tokens e corte de conhecimento atualizado para março de 2026, ante janeiro de 2025. - Gemini 3.5 Flash-Lite: modelo de alto throughput, com cerca de 350 tokens de saída por segundo e preço bem menor para tarefas simples e de alto volume.
- Gemini 3.5 Flash Cyber: variante ajustada para segurança, capaz de encontrar, validar e corrigir vulnerabilidades. Ela roda dentro do CodeMender e está em um piloto de acesso limitado para governos e parceiros confiáveis; não é um lançamento aberto ao público.
A página oficial do modelo descreve o 3.6 Flash como "nosso modelo mais inteligente criado para velocidade", e os valores estão publicados na página de preços da API Gemini do Google.
Esse lançamento não aconteceu isoladamente. O Gemini 3.5 Pro, modelo principal da empresa, teve seu cronograma adiado, enquanto a DeepMind afirmou já ter iniciado o pré-treinamento do Gemini 4. A renovação da linha Flash preenche esse intervalo até a chegada dos lançamentos maiores.
Preço do Gemini 3.6 Flash: por que o corte parece maior do que é
Na API padrão, o Gemini 3.6 Flash custa US$ 1,50 por 1 milhão de tokens de entrada e US$ 7,50 por 1 milhão de tokens de saída — e os tokens de saída incluem os tokens de raciocínio. O cache de contexto custa US$ 0,15 por 1 milhão, com taxa de armazenamento de US$ 1,00 por 1 milhão por hora.
Há um detalhe que boa parte da cobertura do lançamento deixa passar: a redução vale apenas para a saída. O Gemini 3.5 Flash anterior cobrava US$ 1,50 na entrada e US$ 9,00 na saída. A entrada não mudou; a saída caiu de US$ 9,00 para US$ 7,50, uma redução de 16,7%, e não um desconto geral. Em uma carga dominada por entrada — documentos longos enviados para respostas curtas, por exemplo — a economia de tabela será modesta. O principal ganho aparece em outro lugar.
O que importa é o custo por tarefa, não o preço de tabela
Comparar gerações de modelos apenas pelo preço por token é usar a unidade errada. O custo real é preço × tokens consumidos. Aqui, dois fatores mudaram: a taxa de saída está 16,7% menor, e o Google, via o Artificial Analysis Index, informa cerca de 17% menos tokens de saída para o mesmo trabalho. No melhor cenário, a conta fica em torno de 0.833 × 0.83 ≈ 0.69, ou aproximadamente 31% menos na saída.
Quanto disso aparece na prática depende da carga de trabalho. Por isso, executei os mesmos três prompts — uma tarefa de programação, um problema de raciocínio e uma extração de JSON — nos dois modelos pelo OpenRouter, com temperatura 0, em 22 de julho de 2026:
| Métrica (3 tarefas, temp 0) | Gemini 3.6 Flash | Gemini 3.5 Flash |
|---|---|---|
| Tokens de entrada | 146 | 145 |
| Tokens de saída | 2,736 | 2,593 |
| Custo total | US$ 0,0207 | US$ 0,0236 |
| Latência total | 5,20s | 5,19s |
Os dois modelos entregaram respostas corretas e comparáveis. Nessa amostra pequena, o 3.6 Flash saiu cerca de 12% mais barato, praticamente na mesma velocidade, apesar de emitir alguns pontos percentuais a mais de tokens por investir mais em raciocínio. A conclusão é simples: a economia mais confiável vem do corte no preço de saída, de US$ 9,00 para US$ 7,50. O ganho de eficiência de tokens é real no agregado, mas varia conforme a tarefa e nem sempre aparece. Na prática, planeje uma redução de 12% a 17% na saída; os 31% são o melhor caso.
(Amostra pequena: três tarefas, temperatura 0; não é um benchmark formal.)
Gemini 3.6 Flash frente a outros modelos rápidos
O modelo mais barato por token não é necessariamente o que entrega melhor valor. Para colocar a faixa de modelos rápidos em perspectiva, veja os preços lado a lado. Todos os valores são da modalidade padrão, sem batch, por 1 milhão de tokens e extraídos das páginas oficiais de cada fornecedor.
| Modelo | Entrada /1M | Saída /1M | Contexto |
|---|---|---|---|
| Gemini 3.6 Flash | US$ 1,50 | US$ 7,50 | 1M |
| Gemini 3.5 Flash (anterior) | US$ 1,50 | US$ 9,00 | 1M |
| Gemini 3.5 Flash-Lite | US$ 0,30 | US$ 2,50 | 1M |
| Claude Haiku 4.5 | US$ 1,00 | US$ 5,00 | 200k |
| GPT-5.6 Luna | US$ 1,00 | US$ 6,00 | — |
| DeepSeek V4 Flash | US$ 0,14 | US$ 0,28 | 1M |
O 3.6 Flash não vence no preço de tabela. O Claude Haiku 4.5 e o GPT-5.6 Luna cobram menos pela saída, enquanto o DeepSeek V4 Flash está em outro patamar de custo. A proposta do 3.6 Flash é inteligência por dólar: ele registra 50 no Intelligence Index do Artificial Analysis, bem acima da mediana da categoria rápida, com cerca de 304 tokens de saída por segundo e uma janela de contexto completa de 1 milhão de tokens. Para quem precisa de qualidade de ponta em agentes e programação sem pagar preço de modelo flagship, esse é o argumento a favor dele. Para tarefas simples em que o objetivo é o menor custo possível, os modelos mais baratos da tabela levam vantagem.
Quanto o Gemini 3.6 Flash evoluiu sobre o 3.5 Flash?
O salto de geração é real — e aparece sobretudo justamente onde a linha Flash tinha mais dificuldade: programação de longo horizonte e trabalho com agentes.
| Benchmark | Gemini 3.5 Flash | Gemini 3.6 Flash |
|---|---|---|
| DeepSWE v1.1 | 37% | 49% |
| MLE-Bench | 49.7% | 63.9% |
| OSWorld-Verified (uso de computador) | 78.4% | 83.0% |
| SWE-Bench Pro | 55.1% | 58.7% |
| Terminal-Bench 2.1 | 76.2% | 78.0% |
As pontuações vêm da página de modelos Flash do Google DeepMind e do Artificial Analysis. Os avanços em DeepSWE e MLE-Bench chamam mais atenção: 12 e 14 pontos, respectivamente. O Google também informa nota de 1421 no GDPval-AA para trabalho de conhecimento, acima dos 1349 anteriores. Em vários desses testes, o 3.6 Flash supera até o maior e mais caro 3.1 Pro, algo incomum para um modelo Flash.
Gemini 3.6 Flash vs. 3.1 Pro
A surpresa é que este modelo da faixa rápida supera o maior e mais caro Gemini 3.1 Pro em tarefas de agentes e programação. O Gemini 3.1 Pro Preview custa US$ 2,00–US$ 4,00 na entrada e US$ 12,00–US$ 18,00 na saída por 1 milhão de tokens, com valores escalonados pelo tamanho do prompt. Já o 3.6 Flash tem preço fixo de US$ 1,50/US$ 7,50.
| Gemini 3.6 Flash | Gemini 3.1 Pro | |
|---|---|---|
| Entrada /1M | US$ 1,50 | US$ 2,00–US$ 4,00 |
| Saída /1M | US$ 7,50 | US$ 12,00–US$ 18,00 |
| DeepSWE v1.1 | 49% | 12% |
| SWE-Bench Pro | 58.7% | 54.2% |
| Terminal-Bench 2.1 | 78.0% | 73.8% |
O 3.1 Pro continua sendo o modelo maior e mais caro, voltado aos trabalhos mais difíceis de raciocínio e contexto longo. Mas, para a maioria das cargas de programação e agentes, o 3.6 Flash agora é mais barato e obtém notas superiores nos benchmarks acima. Por isso, vale comparar os dois antes de optar automaticamente pela categoria Pro. O comparativo completo entre Gemini 3.6 Flash e 3.1 Pro traz os benchmarks diretos, preços escalonados e um teste prático de velocidade.
Vale migrar do Gemini 3.5 Flash?
Para a maioria das equipes que já usa o 3.5 Flash, sim. A matemática é quase estritamente favorável:
- Mesmo preço de entrada (US$ 1,50/1M) e menor preço de saída (US$ 7,50 contra US$ 9,00).
- Menos tokens de saída para a mesma tarefa, cerca de 17% a menos.
- Corte de conhecimento mais recente: março de 2026, contra janeiro de 2025.
- Notas superiores em todos os benchmarks de agentes e programação listados acima.
Antes de trocar o modelo em produção, verifique dois pontos. Primeiro, confirme se suas cargas cabem no limite máximo de 64 mil tokens de saída; se você dependia de respostas únicas mais longas, teste esse limite. Segundo, execute seu próprio conjunto de avaliações. Os ganhos de eficiência de tokens e as mudanças no raciocínio podem alterar o comportamento em prompts que já foram ajustados, então avalie latência e qualidade de saída no seu tráfego antes de mudar o padrão.
Flash, Flash-Lite ou Cyber: qual escolher?
Três modelos, três funções:
- Gemini 3.6 Flash é a escolha padrão. Use-o quando quiser qualidade de ponta para agentes, programação e multimodalidade a preço de modelo rápido.
- Gemini 3.5 Flash-Lite (US$ 0,30/US$ 2,50, ~350 tokens/s) é indicado para tarefas de alto volume, sensíveis à latência e menos complexas: classificação, extração, roteamento e chat simples. É a maneira mais barata de operar Gemini em escala.
- Gemini 3.5 Flash Cyber só é relevante para governos ou parceiros de segurança avaliados. É um piloto dentro do CodeMender, não um modelo disponível pela API padrão.
Como acessar o Gemini 3.6 Flash
O modelo já está disponível na API Gemini e no Google AI Studio. O AI Studio oferece uma camada gratuita para prototipagem; depois, você migra para o modelo de pagamento conforme o uso com o ID gemini-3.6-flash, seguindo o mesmo fluxo de Google AI Studio gratuito e depois pago aplicado ao restante da linha Gemini. As superfícies empresariais Antigravity, Android Studio e Gemini Enterprise Agent Platform também estão listadas. Se você precisa especificamente do Vertex AI, confirme a disponibilidade no console do Vertex, pois ela ainda estava sendo liberada em 22 de julho de 2026.
Uma chamada REST mínima para a API Gemini é assim:
curl "https://generativelanguage.googleapis.com/v1beta/models/gemini-3.6-flash:generateContent" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H "Content-Type: application/json" \
-d '{"contents":[{"parts":[{"text":"Summarize agentic AI in one sentence."}]}]}'
Equipes que trabalham com mais de um fornecedor às vezes roteiam os modelos por um agregador, em vez de manter chaves separadas. Tanto o OpenRouter quanto o AIReiter disponibilizam o modelo gemini-3.6-flash pelo preço de tabela do Google; a diferença está no que mais existe por trás da mesma chave. O OpenRouter distribui chamadas entre muitos provedores, enquanto o AIReiter é compatível com Anthropic e roteia Gemini ao lado de Claude. Isso pode ajudar ao comparar o 3.6 Flash com os preços da API Claude em uma única fatura. Para uma implantação com um único modelo, ir direto ao Google é mais simples.
Perguntas frequentes
O Gemini 3.6 Flash é gratuito?
Há uma camada gratuita no Google AI Studio para prototipagem, com limites de uso. Em produção, vale a cobrança conforme o uso: US$ 1,50 na entrada e US$ 7,50 na saída por 1 milhão de tokens.
O Gemini 3.6 Flash é melhor que o 3.5 Flash?
Sim. Nos benchmarks publicados, ele supera o 3.5 Flash em DeepSWE, MLE-Bench, OSWorld-Verified, SWE-Bench Pro e Terminal-Bench, além de custar menos por token de saída e usar menos tokens por tarefa.
O Gemini 3.6 Flash é melhor que o Gemini 3.1 Pro?
Em benchmarks de agentes e programação, como DeepSWE, SWE-Bench Pro e Terminal-Bench, sim — e por um preço menor: US$ 1,50/US$ 7,50 contra US$ 2,00–US$ 4,00/US$ 12,00–US$ 18,00. O Gemini 3.1 Pro é o modelo maior e continua à frente nas tarefas mais difíceis de raciocínio em contexto longo e multimodais, portanto a escolha certa depende da sua carga de trabalho.
Quanto custa o Gemini 3.6 Flash?
US$ 1,50 por 1 milhão de tokens de entrada e US$ 7,50 por 1 milhão de tokens de saída na modalidade padrão. O cache de contexto custa US$ 0,15 por 1 milhão de tokens.
Qual é o corte de conhecimento do Gemini 3.6 Flash?
Março de 2026, acima de janeiro de 2025 no Gemini 3.5 Flash anterior.
O Gemini 3.6 Flash está disponível no Vertex AI?
Ele está confirmado na API Gemini e no Google AI Studio, além de várias superfícies empresariais. A disponibilidade no Vertex AI não foi confirmada explicitamente no lançamento, então consulte o catálogo de modelos do Vertex antes de construir algo sobre ele nessa plataforma.
O que é o Gemini 3.5 Flash Cyber?
É uma variante focada em segurança, ajustada para detectar, validar e corrigir vulnerabilidades de software. Ela roda dentro do agente CodeMender do Google DeepMind e é um piloto de acesso limitado para governos e parceiros confiáveis, não um modelo público.
