Gemini 3.5 Flash vs Gemini 3.1 Pro: A Comparação Completa

Última Atualização: 2026-07-15 02:21:56

Gemini 3.5 Flash gera 2,6x mais tokens de saída por segundo do que o Gemini 3.1 Pro, custa 25% menos por token e supera ligeiramente o Pro no Intelligence Index da Artificial Analysis (50 vs 46). O Gemini 3.1 Pro ainda lidera por 5 pontos no ARC-AGI-2 (77,1% vs 72,1%), e a pontuação do Flash em recuperação de contexto longo cai de 84,9% para 77,3% quando você ultrapassa 128k tokens. Qual modelo usar depende da tarefa: o Flash é otimizado para throughput e latência de tool-calling, o Pro é otimizado para profundidade de raciocínio em várias etapas, e os benchmarks agregados fazem a média dessas duas prioridades em uma única pontuação que oculta de qual delas sua carga de trabalho realmente precisa.

Placar de benchmark: onde cada modelo realmente lidera

Gemini 3.5 Flash vs Gemini 3.1 Pro benchmark comparison chart
MétricaGemini 3.5 FlashGemini 3.1 ProVencedor
Índice de Inteligência (Artificial Analysis)5046Flash
ARC-AGI-2, raciocínio abstrato (BenchLM)72.1%77.1%Pro
MRCR v2 no contexto de 128k (nxcode)77.3% (queda em relação a 84.9% em contexto menor)não relatado publicamente no mesmo comprimentoDados insuficientes
Pontuação média multimodal (BenchLM)83.882.6Flash
Velocidade de saída (BenchLM)284.2 tok/s109 tok/sFlash (2.6x)
GDPval-AA Elo, tarefas de agente do mundo real (apiyi)16561314Flash

Flash vence nas métricas que medem throughput e o tratamento de tarefas de uso geral. O Pro tem uma vantagem clara e documentada em profundidade de raciocínio no ARC-AGI-2; em recuperação de contexto longo, o Flash apresenta uma regressão documentada além de 128k tokens, mas a pontuação equivalente do Pro não está disponível publicamente, então considere esse ponto inconclusivo, em vez de uma vitória do Pro. Essa divisão se alinha diretamente ao tipo de tarefa que você está executando, o que é mais útil do que o número agregado único do Intelligence Index.

Uma ressalva metodológica da própria comparação da BenchLM: dos cerca de 34 benchmarks em que ambos os modelos têm resultados publicados, apenas 3 categorias são diretamente comparáveis — o Pro tem resultados exclusivos em 14 benchmarks, o Flash em 17, e as configurações de thinking-budget nem sempre correspondem entre os dois. Considere a tabela acima como confiável em termos de tendência; as diferenças em ARC-AGI-2 e MRCR v2 são grandes o suficiente para serem confiáveis, mas uma diferença de 1 a 2 pontos em uma métrica compartilhada não deve ser interpretada como निर्णsiva.

Onde a liderança do Flash se desfaz

A diferença no ARC-AGI-2 (5 pontos) é a maior diferença em uma única categoria que a comparação do BenchLM encontrou entre os dois modelos. O ARC-AGI-2 foi criado especificamente para resistir a atalhos de correspondência de padrões, então uma diferença de 5 pontos ali é um sinal mais forte sobre profundidade de raciocínio do que uma diferença semelhante em um benchmark mais convencional. O resultado do MRCR v2 do nxcode acrescenta um segundo ponto de dados na mesma direção: a precisão de recuperação do próprio Flash cai de 84,9% para 77,3% à medida que o contexto cresce em direção a 128k tokens. A pontuação do Pro no mesmo comprimento não é divulgada publicamente, então isso não é uma perda documentada no confronto direto para o Pro — mas é uma regressão documentada para o Flash que a tabela de benchmarks do Pro não mostra.

Observação anedótica, não evidência de benchmark: um fio do Reddit r/GeminiAI perguntando aos usuários qual modelo eles preferem para tarefas difíceis fez com que comentaristas descrevessem o Flash como superior ao Pro "em tudo, exceto contexto longo, [raciocínio] abstrato." São algumas opiniões, não dados — mas por acaso isso descreve as mesmas duas exceções que os benchmarks mostram, o que é uma verificação de sanidade levemente útil, em vez de prova de qualquer coisa por si só.

Preços e cache: a verdadeira visão dos custos

A precificação base reduz a vantagem de preço mais do que parece à primeira vista:

  • Gemini 3.5 Flash: US$1,50 / milhão de tokens de entrada, US$9 / milhão de tokens de saída
  • Gemini 3.1 Pro: US$2 / milhão de tokens de entrada, US$12 / milhão de tokens de saída

Isso representa um desconto de 25% no papel, não a diferença de 4 a 8x que o Flash antes tinha sobre modelos Pro mais antigos. A alavanca maior é o cache:

  • As gravações no Flash cache são gratuitas; a entrada em cache custa US$ 0,15/milhão de tokens
  • As gravações no Pro cache custam US$ 0,38/milhão de tokens; a entrada em cache custa US$ 0,50/milhão de tokens — mais de 3x a taxa de entrada em cache do Flash

Para qualquer fluxo de trabalho que reenvie o mesmo prompt do sistema ou contexto de documento em várias interações — agentes de chat, assistentes de programação com um contexto persistente da base de código, bots de suporte com múltiplas interações — essa lacuna de cache se acumula rapidamente. Uma única solicitação mal mostra a diferença; uma sessão de agente com mil interações mostra.

A diferença também não é constante. a análise de preços da apiyi observa que, após cerca de 200 mil tokens de contexto, a diferença de preço entre os dois modelos se reduz para 25-50%, porque a economia por token de ambos os modelos converge nessa escala. Se sua carga de trabalho é dominada por documentos únicos muito longos, em vez de chamadas curtas repetidas, o argumento de preço a favor do Flash enfraquece.

Um exemplo concreto: um fluxo de trabalho de bot de suporte que envia 1M de tokens de entrada em cache e gera 500K de tokens de saída por dia. No Flash, isso custa $0 pela gravação do cache mais $0.15 x 1 (entrada em cache) + $9 x 0.5 (saída) = $4.65/dia. No Pro, a mesma carga de trabalho custa $0.38 (gravação do cache, uma única vez) + $0.50 x 1 (entrada em cache) + $12 x 0.5 (saída) = aproximadamente $6.88/dia no primeiro dia, estabilizando em $6.50/dia após a primeira gravação. Ao longo de um mês, isso representa a diferença entre cerca de $140 e $195 — sem contar o raciocínio mais profundo do Pro em qualquer solicitação que realmente precise disso.

Loops de agentes: por que Flash vence em velocidade, nem sempre em confiabilidade

o benchmark de loop de agente da nxcode executou um loop de agente de 8 etapas e registrou o Flash concluindo a sequência completa em cerca de 25 segundos, contra 100 segundos do Pro — uma diferença de 4x que se acumula a cada etapa adicional. No GDPval-AA, um benchmark construído em torno de tarefas reais de trabalho do conhecimento com agentes, a pontuação Elo do Flash (1656) supera a do Pro (1314) por 342 pontos, a maior diferença individual em toda a tabela do benchmark.

A ressalva: essa vantagem de velocidade e pontuação pressupõe que o loop do agente execute sem problemas. As mesmas lacunas do ARC-AGI-2 e do MRCR v2 que aparecem em tarefas de raciocínio e de contexto longo são uma base razoável para esperar que o Flash também seja menos tolerante quando uma chamada de ferramenta retorna algo inesperado no meio do loop e o agente precisa replanejar — isso é uma inferência dos dados de profundidade de raciocínio acima, não uma दावा avaliadas separadamente. Se o seu agente funciona de forma supervisionada, com um humano verificando a saída entre as etapas, a velocidade do Flash é praticamente uma vitória grátis. Se ele funciona sem supervisão por muitas etapas, sem um humano no loop, a margem de raciocínio do Pro é a aposta mais segura até que alguém publique dados de taxa de falha para ambos.

Qual você deve usar: uma matriz de decisão baseada em tarefas

Tipo de tarefaModelo recomendadoPor quê
Programação cotidiana (testes, revisão de PR, tradução entre idiomas)FlashVelocidade e custo vencem, a profundidade de raciocínio não é o gargalo
Refatorações profundas, projeto de algoritmos novosProA lacuna do ARC-AGI-2 aparece diretamente no raciocínio lógico em várias etapas
Recuperação de documentos longos (contratos, corpora de pesquisa além de 128k tokens)ProO Flash tem uma regressão documentada no MRCR v2 nesse comprimento; a do Pro não foi publicada, mas a opção mais segura é o modelo sem um ponto fraco conhecido
Geração em lote de alto volumeFlashEscritas de cache gratuitas e throughput 2.6x importam mais em escala
Fluxos de trabalho de agentes supervisionados com um humano verificando a saídaFlashVantagem de velocidade sem o risco de confiabilidade sem supervisão
Cadeias de agentes sem supervisão, de alto riscoProA margem de profundidade de raciocínio é a aposta mais segura sem um humano capturando erros no meio do ciclo
Chamadas frequentes de vários turnos reutilizando o mesmo contextoFlashO preço de entrada em cache é aproximadamente um terço do Pro

Uma regra padrão simples cobre a maior parte da matriz acima: envie solicitações para o Flash, a menos que uma de três condições seja verdadeira — o contexto ultrapassa 128k tokens e a precisão da recuperação importa, a tarefa é raciocínio abstrato/multietapas (novos algoritmos, síntese jurídica ou de pesquisa), ou o agente executa sem supervisão por mais do que algumas etapas. Qualquer uma dessas três condições pende a decisão para o Pro; se nenhuma delas estiver presente, a velocidade e o preço de cache do Flash o tornam a opção padrão mais barata.

Perguntas Frequentes

O Gemini 3.5 Flash é melhor que o 3.1 Pro?

Em velocidade, custo e benchmarks de uso geral, sim. Em raciocínio abstrato (ARC-AGI-2), o Gemini 3.1 Pro ainda lidera por 5 pontos. Em recuperação de contexto longo acima de 128k tokens, o Flash tem uma regressão documentada e a pontuação equivalente do Pro não foi publicada, então trate essa comparação como não resolvida, em vez de uma vitória confirmada do Pro. Qual deles é "melhor" depende de em qual dessas categorias a sua tarefa se encaixa.

Quanto mais barato é o Gemini 3.5 Flash do que o 3.1 Pro?

Cerca de 25% mais barato no preço base de entrada/saída ($1.50/$9 vs $2/$12 por milhão de tokens). A maior economia aparece no cache: as gravações de cache do Flash são gratuitas e a entrada em cache custa aproximadamente um terço da taxa do Pro, o que é mais relevante para cargas de trabalho com múltiplas interações ou de alto volume.

O Gemini 3.5 Flash é bom para programação?

Sim, para o trabalho do dia a dia — geração de testes, revisão de PR, tradução de código entre linguagens. Para refatorações profundas ou projeto de algoritmos novos, a vantagem do Pro em benchmarks de raciocínio abstrato tende a aparecer na qualidade da saída.

O Gemini 3.5 Flash lida bem com contexto longo?

Em comprimentos de contexto mais curtos, sim — a precisão de recuperação do MRCR v2 se mantém em 84,9%. Além de 128 mil tokens, isso cai para 77,3%, o que é uma diferença significativa para tarefas como revisão de contratos com múltiplos documentos. A pontuação do Gemini 3.1 Pro no mesmo comprimento ainda não foi publicada, então trate isso como uma limitação conhecida do Flash, e não como uma vantagem confirmada do Pro.

Conclusão

Gemini 3.5 Flash é o melhor padrão para a maioria do trabalho do dia a dia e de alto volume — é mais rápido, mais barato no cache e, em benchmarks gerais, suficientemente próximo para que a compensação raramente importe. Gemini 3.1 Pro justifica seu custo mais alto em raciocínio abstrato e cadeias de agentes não supervisionadas; em documentos longos com mais de 128 mil tokens, os próprios números do Flash mostram um ponto fraco que os do Pro não confirmam nem descartam, então considere isso como algo que vale testar por conta própria antes de se comprometer com qualquer um dos dois.

Esta comparação foi construída a partir de dados públicos de benchmark (Artificial Analysis, BenchLM, nxcode e apiyi), não de testes práticos de API. Gemini 3.1 Pro foi lançado com um posicionamento focado em raciocínio, distinto do foco em velocidade do Flash. No momento em que escrevo, o Gemini 3.5 Pro ainda não foi lançado — relatos apontam para um lançamento em julho de 2026 — então considere isto como um retrato momentâneo que tanto os dois modelos quanto esta comparação precisarão ser revisitados assim que a próxima versão do Pro chegar.

Leitura relacionada