AIREITER

Gemini 3.7 Flash vs. 3.6 Flash: Código Melhor pelo Mesmo Preço

Última Atualização: 2026-08-14 07:45:32

Três semanas depois do Gemini 3.6 Flash, o Google lançou o Gemini 3.7 Flash com um salto relevante de capacidade. No DeepSWE v1.1, o resultado passou de 48,6% para 65,3%. Os dois modelos mantêm o preço promocional de US$ 0,75/US$ 3,75 por milhão de tokens até dezembro de 2026, portanto a migração não eleva o custo por token. Ainda assim, o retorno varia conforme o tipo de carga de trabalho.

Gemini 3.7 Flash vs. 3.6 Flash: comparação dos benchmarks

Os números de destaque na página oficial dos modelos do Google DeepMind apontam ganhos do 3.7 Flash em todas as frentes, especialmente nos benchmarks de agentes de código e automação empresarial. A tabela reúne as 18 métricas que o Google divulga para ambos os modelos. Claude Sonnet 5 e GPT-5.6 Terra aparecem apenas como referência.

Comparação de benchmarks entre Gemini 3.7 Flash e 3.6 Flash em seis métricas principais
BenchmarkGemini 3.7 FlashGemini 3.6 FlashDiferença
Artificial Analysis Intelligence Index (composto)5652+4
FrontierCode 1.1 (qualidade de código em produção)43.6%34.4%+9.2
DeepSWE v1.1 (engenharia de software de longo horizonte)65.3%48.6%+16.7
Code Arena (Elo em desenvolvimento web)15881538+50
Terminal-Bench 2.1 (programação em terminal com agentes)85.8%78.0%+7.8
Terminal-Bench 3.0 (capacidades gerais de agentes)14.9%5.4%+9.5
AutomationBench (automação de fluxos empresariais)30.4%17.0%+13.4
GDPVal-AA v2 (Elo de trabalho baseado em conhecimento)15251422+103
Harvey LAB-AA (fluxos jurídicos complexos)90.7%85.1%+5.6
GDP.pdf (compreensão especializada de PDFs)34.0%22.0%+12.0
CharXiv, sem ferramentas (raciocínio sobre gráficos)84.5%85.2%−0.7
CharXiv, com ferramentas88.7%89.4%−0.7
LVBench (compreensão de vídeos longos)85.4%84.2%+1.2
GDM-MRCR v2, 128k (recuperação em contexto longo)97.0%91.8%+5.2
OSWorld-2.0 (uso de computador por agentes)47.9%33.8%+14.1
Agent's Last Exam (tarefas de agentes de desktop)26.3%24.2%+2.1
HLE-Verified (raciocínio especializado multidisciplinar)53.6%51.2%+2.4
LABBench2 (tarefas de pesquisa em biologia)82.1%76.1%+6.0

Todos os resultados foram informados pelo fornecedor, o Google DeepMind, na página do modelo 3.7 Flash. A maior parte desses benchmarks ainda não conta com reprodução independente publicada; por isso, trate as diferenças como indicativas, e não como garantia para a sua carga de trabalho.

Código e agentes: onde o 3.7 Flash mais avança

É nos benchmarks de programação e agentes que a distância entre os modelos fica mais evidente. O DeepSWE v1.1, que avalia engenharia de software de longo horizonte em tarefas reais de repositórios, avançou 16,7 pontos percentuais: de 48,6% para 65,3%. No mesmo indicador, esse resultado supera o Claude Sonnet 5, com 53,8%, e fica entre ele e o GPT-5.6 Terra, com 69,6% — todos os números vêm da tabela de benchmarks do DeepMind.

Outros benchmarks voltados a agentes mostram saltos semelhantes:

  • Terminal-Bench 3.0 (capacidades de agentes com múltiplas ferramentas): 5,4% → 14,9%, quase o triplo
  • AutomationBench (automação de fluxos empresariais): 17,0% → 30,4%
  • FrontierCode 1.1 (qualidade de código em produção): +9,2 pontos
  • OSWorld-2.0 (uso de computador por agentes): 33,8% → 47,9%

As primeiras impressões de usuários no Reddit resumem bem a diferença entre vencer benchmarks e a experiência diária de desenvolvimento:

É eficaz para implementação, mas pode ser mais fraco em planejamento, revisão de código e decomposição de problemas difíceis.

— Discussão de usuário em r/google_antigravity

As evidências de clientes publicadas pelo Google na página do modelo do DeepMind reforçam esse cenário. A Browser Use relatou que "o agente Gemini 3.7 Flash foi 35% mais barato que o 3.6 Flash, com uma taxa de acerto de cache de prompt observada 8% maior e menos erros de ferramentas". A Harvey mediu um ganho de 2,6 pontos na taxa de aprovação total do Legal Agent Bench. Já a Nunu.ai encontrou desempenho equivalente ao GPT-5.6-Terra "por cerca de metade do custo". Nos três casos, a economia é atribuída a menos etapas no loop do agente, não a descontos por token.

Trabalho de conhecimento e multimodalidade: avanços menores, mas concretos

Fora do código, os ganhos diminuem. O Artificial Analysis Intelligence Index subiu de 52 para 56, colocando o 3.7 Flash entre o Claude Sonnet 5, com 55, e o GPT-5.6 Terra, com 57, de acordo com a tabela comparativa do DeepMind. O maior avanço fora de programação está na compreensão de documentos: o GDP.pdf foi de 22,0% para 34,0%, um ganho de 12 pontos para pipelines que processam documentos complexos, relatórios financeiros ou registros jurídicos. No GDM-MRCR v2, que mede recuperação em contexto longo de 128K tokens, o resultado passou de 91,8% para 97,0%.

O Harvey LAB-AA, que avalia fluxos jurídicos complexos, avançou de 85,1% para 90,7%. A compreensão de vídeos longos no LVBench e as tarefas de pesquisa em biologia do LABBench2 também melhoraram cerca de 6 pontos. São ganhos relevantes para usos especializados, mas dificilmente justificam uma migração sozinhos.

Preço: a tarifa promocional é igual nos dois modelos

ModeloEntrada (US$/1M de tokens)Saída (US$/1M de tokens)Tarifa padrão (a partir de 1º de janeiro de 2027)
Gemini 3.7 Flash$0.75\*$3.75\*$1.50 / $7.50
Gemini 3.6 Flash$0.75\*$3.75\*$1.50 / $7.50
Claude Sonnet 5$2.00$10.00—
GPT-5.6 Terra$2.00$12.00—

\*O preço promocional expira em 31 de dezembro de 2026. Todos os preços foram obtidos na página do modelo do DeepMind.

Quando o 3.7 foi lançado, em 13 de agosto de 2026, o Google aplicou a tarifa promocional de US$ 0,75/US$ 3,75 aos dois modelos Flash. Antes disso, o 3.6 Flash cobrava sua tarifa padrão de US$ 1,50/US$ 7,50. A partir de 1º de janeiro de 2027, ambos voltam a US$ 1,50/US$ 7,50, salvo se o Google estender a promoção. Como o preço por token é idêntico, a diferença de custo vem da eficiência nas tarefas: a redução de 35% no custo de agentes relatada pela Browser Use foi medida nas mesmas cargas de trabalho e atribuída a menos chamadas de ferramentas e taxas maiores de acerto de cache, não a preços diferentes.

Para uma análise detalhada dos custos da API do 3.7 Flash, incluindo cache, Batch API e cobranças de grounding, consulte nosso guia de preços da API Gemini 3.7 Flash.

Em que o 3.6 Flash ainda leva vantagem

O 3.6 Flash mantém uma vantagem estreita no raciocínio sobre gráficos. No CharXiv sem ferramentas, o 3.6 alcança 85,2%, contra 84,5% do 3.7. Com as ferramentas ativadas, a diferença é a mesma: 89,4% contra 88,7%. Como as margens são inferiores a 1 ponto, ambos podem ter desempenho semelhante em tarefas individuais com gráficos. Antes de definir um modelo padrão, valide no seu próprio workload de gráficos.

Nenhum outro benchmark da tabela comparativa do Google mostra o 3.6 à frente do 3.7. A diferença no índice de inteligência, 52 contra 56, é a disputa mais próxima fora do raciocínio sobre gráficos, mas mesmo nela o 3.7 lidera.

Migração: o que muda além do nome do modelo

A migração mecânica exige apenas trocar o ID do modelo: substitua gemini-3.6-flash por gemini-3.7-flash. Segundo a página do modelo do DeepMind, os dois compartilham a mesma janela de contexto — 1M de entrada e 64K de saída —, as mesmas modalidades de entrada — texto, imagem, vídeo, áudio e PDF — e os mesmos recursos de uso de ferramentas: function calling, search grounding e computer use. A página classifica o 3.7 Flash como de disponibilidade geral.

Há uma ressalva importante: a transição do 3.5 para o 3.6 introduziu mudanças silenciosas no comportamento da API e pegou desenvolvedores de surpresa. Conforme documentado em testes independentes, temperature, top_p e top_k passaram a ser ignorados silenciosamente, thinking_budget virou o enum em string thinking_level, e o preenchimento prévio de respostas foi removido. O Google ainda não publicou se o 3.7 Flash traz mudanças semelhantes. Até essa documentação existir, execute sua suíte de avaliação usando os dois IDs antes de migrar tráfego de produção. Mantenha o 3.6 como alternativa.

Vale migrar para o 3.7 Flash?

A decisão depende do tipo de carga de trabalho:

  • Migre agora se você usa agentes de código. O DeepSWE v1.1 ganhou 16,7 pontos, e o Terminal-Bench 3.0 quase triplicou. Com o mesmo preço por token, não há motivo financeiro para continuar no 3.6 em workloads de agentes de programação.
  • Migre agora se você processa documentos complexos. A compreensão no GDP.pdf subiu 12 pontos, de 22,0% para 34,0%. A recuperação em contexto longo de 128K tokens chega a 97,0%, quase perfeita.
  • Teste antes se raciocínio sobre gráficos for sua tarefa principal. As pontuações do CharXiv favorecem o 3.6 por menos de 1 ponto. Faça uma avaliação lado a lado antes de se comprometer.
  • Permaneça no 3.6 se o seu pipeline já foi validado e está estável. A página do modelo do DeepMind não informa uma data de descontinuação do 3.6 Flash. Se seu fluxo passa nos testes de regressão e você não precisa imediatamente dos ganhos em código, o custo de depurar mudanças de comportamento pode superar o benefício. Migre um fluxo por vez.
  • Considere o ritmo de lançamentos. O Google lançou o 3.7 três semanas após o 3.6. Migre agora os fluxos em que os ganhos do 3.7 são maiores, mantenha o 3.6 fixado como alternativa e trate cada versão Flash como uma atualização incremental a ser avaliada, não como uma mudança de plataforma.

Você pode comparar os dois modelos lado a lado nas interfaces de chat do Gemini 3.7 Flash e do Gemini 3.6 Flash.

O Gemini 3.7 Flash é uma arquitetura nova ou uma atualização de pós-treinamento?

O Google não caracterizou publicamente o 3.7 Flash nem como arquitetura nova nem como ajuste de pós-treinamento. O Artificial Analysis Intelligence Index passou de 52 para 56, enquanto testes independentes confirmaram que tanto o 3.5 quanto o 3.6 Flash obtiveram 50 no mesmo índice. Não há documentação indicando se o avanço do 3.7 decorre de mudanças arquiteturais ou de dados de treinamento melhores.

O Gemini 3.7 Flash custa mais que o 3.6 Flash?

Não. Os dois modelos custam US$ 0,75 por milhão de tokens de entrada e US$ 3,75 por milhão de tokens de saída até 31 de dezembro de 2026. Depois disso, ambos passam para US$ 1,50/US$ 7,50. A economia da atualização vem de menos chamadas de ferramentas e etapas de raciocínio por tarefa, não de um preço menor por token.

Onde o Gemini 3.7 Flash está disponível?

Segundo a página do modelo do DeepMind, o 3.7 Flash está disponível via Gemini API, Google AI Studio, Google Antigravity, Vertex AI, Gemini Enterprise e Gemini App, com status de disponibilidade geral.

Devo esperar a próxima versão do Flash em vez de migrar agora?

O 3.7 Flash é um modelo GA, com benchmarks publicados e adoção por clientes. Se a sua carga de trabalho se beneficia dos avanços em código e agentes, migre esses fluxos agora e reavalie quando a próxima versão for lançada. Esperar gera um custo de oportunidade pelos ganhos que você já poderia estar aproveitando.