Nem sempre o modelo Pro é a escolha óbvia. O Gemini 3.6 Flash custa menos que o Gemini 3.1 Pro, entrega mais que o dobro da velocidade e vence em quase todos os benchmarks de programação e uso com agentes. Ao 3.1 Pro resta uma vantagem específica: resultados um pouco melhores nos testes mais exigentes de raciocínio puro. Rodei os dois modelos nas mesmas tarefas e conferi novamente todos os preços e especificações abaixo nas documentações do Google e da Artificial Analysis em 23 de julho de 2026.
Veredito rápido
Gemini 3.6 Flash | Gemini 3.1 Pro | Vencedor | |
|---|---|---|---|
Preço da API (entrada/saída por 1M, ≤200k) | $1.50 / $7.50 | $2.00 / $12.00 | Flash |
Prompts longos (>200k tokens) | mesmo preço fixo | $4.00 / $18.00 | Flash |
Velocidade de saída | 261 tokens/s | 112 tokens/s | Flash |
Benchmarks de código e agentes | vence os 4 confrontos diretos | — | Flash |
Raciocínio mais difícil (GPQA, HLE) | — | lidera por 1.3–6.4 pontos | 3.1 Pro |
Corte de conhecimento | março de 2026 | janeiro de 2025 | Flash |
Status de lançamento | disponibilidade geral | Preview desde fevereiro de 2026 | Flash |
Se você quer só a recomendação: use o Gemini 3.6 Flash como padrão e recorra ao 3.1 Pro apenas quando a tarefa exigir o teto máximo de raciocínio. Também dá para pular a leitura e colocar o Gemini 3.6 Flash e o Gemini 3.1 Pro frente a frente em um chat no navegador, com seus próprios prompts e sem precisar de chave de API. O restante do artigo traz as evidências, incluindo um teste de três tarefas que você pode reproduzir.
Quanto custa cada um
O Gemini 3.6 Flash mantém o mesmo preço independentemente do tamanho do prompt. O Gemini 3.1 Pro já começa mais caro e ainda adiciona uma faixa para prompts longos. Preços padrão da API por 1M de tokens, verificados em 23 de julho de 2026:
Gemini 3.6 Flash | Gemini 3.1 Pro | |
|---|---|---|
Entrada (≤200k) | $1.50 | $2.00 |
Saída (≤200k) | $7.50 | $12.00 |
Entrada (>200k) | $1.50 | $4.00 |
Saída (>200k) | $7.50 | $18.00 |
Leitura de cache de contexto (≤200k) | $0.15 | $0.20 |
Batch (entrada/saída, ≤200k) | $0.75 / $3.75 | $1.00 / $6.00 |
É na saída que a diferença pesa: em prompts curtos, cada token de saída do 3.1 Pro custa 60% mais. Quando o prompt passa de 200k tokens, essa diferença chega a 140%.
A distância se mantém até nos descontos. O modo Batch reduz as tarifas dos dois modelos pela metade, portanto o Pro continua 60% mais caro. O *armazenamento* de cache, cobrado por hora além do preço de leitura por token, custa $4.50 por 1M de tokens por hora no Pro, contra $1.00 no Flash. Pelos preços públicos de tabela do Google, não há modalidade — padrão, Batch, Priority ou cache — em que o Pro seja a opção mais barata.
Teste prático: as mesmas três tarefas
Tabelas de preço pressupõem consumo idêntico de tokens. Por isso, em 22 de julho de 2026, enviei os mesmos três prompts aos dois modelos pelo OpenRouter, usando os IDs google/gemini-3.6-flash e google/gemini-3.1-pro-preview, com temperatura 0 e uma execução de cada:
1. Código: criar uma função Python merge_intervals com docstring e exemplo de uso 2. Raciocínio: um problema textual de dois trens que exige álgebra de tempo e velocidade 3. Extração: extrair itens de ação de uma mensagem confusa de equipe em um array JSON
Tarefa | Latência do Flash | Latência do Pro | Custo do Flash | Custo do Pro |
|---|---|---|---|---|
Código | 2.4s | 4.5s | $0.0085 | $0.0102 |
Raciocínio | 1.9s | 2.4s | $0.0082 | $0.0118 |
Extração | 1.3s | 2.6s | $0.0049 | $0.0057 |
Total | 5.65s | 9.48s | $0.0215 | $0.0277 |
*Os totais foram calculados a partir dos logs brutos de milissegundos e tokens. Como as linhas de cada tarefa são arredondadas, a soma de uma coluna pode variar em um centésimo.*
Os dois modelos acertaram as três tarefas: os intervalos foram mesclados corretamente, o tempo de alcance dos trens estava certo e o JSON saiu limpo. A diferença apareceu no custo de cada resposta.
O Flash gerou *mais* tokens que o Pro — 2,843 contra 2,285 nos metadados de uso do OpenRouter, em sua maioria tokens internos de raciocínio nos dois casos — e, mesmo assim, terminou 22% mais barato e 40% mais rápido de ponta a ponta. A tarifa de saída mais alta e a geração mais lenta do Pro anulam o efeito de suas respostas mais curtas. Em loops de agentes, nos quais cada etapa volta a pagar essa latência, a diferença se acumula.

Três prompts pequenos são uma verificação pontual, não um benchmark. Portanto, trate os percentuais exatos como ilustrativos. Ainda assim, a tendência coincide com medições em escala maior, que são o próximo passo da análise.
Em código e agentes, o Flash vence tudo
Nos números públicos de confronto direto da Artificial Analysis, o 3.6 Flash supera o antigo 3.1 Pro em programação, engenharia de ML e uso de terminal:
Benchmark | Gemini 3.1 Pro | Gemini 3.6 Flash |
|---|---|---|
DeepSWE v1.1 | 12% | 49% |
MLE-Bench | 42.6% | 63.9% |
SWE-Bench Pro | 54.2% | 58.7% |
Terminal-Bench 2.1 | 73.8% | 78.0% |

A maior distância está no DeepSWE: 49% contra 12%. O Flash também supera levemente o Pro em raciocínio multimodal, no MMMU-Pro, com 83.2% contra 82.4%, e vence no índice composto Artificial Analysis Intelligence Index, por 50 a 46.
A velocidade repete o padrão. Em 23 de julho de 2026, a Artificial Analysis mediu 261 tokens/segundo para o Flash e 112 para o 3.1 Pro, uma diferença de 2.3x. O tempo até o primeiro token também foi menor: 12.8s contra 31.2s na carga de trabalho padrão deles. Esses números de primeiro token incluem o tempo de raciocínio de cada modelo antes de a resposta começar, por isso minhas tarefas curtas terminaram muito antes. No panorama completo do ranking, o Flash aparece perto do topo nos três critérios ao mesmo tempo:

Há uma nuance importante em contexto longo. Os dois modelos aceitam entradas de 1M de tokens, mas, no limite extremo, o Flash é muito melhor para *encontrar* informações: no retrieval MRCR com 1M de tokens, faz 54% contra menos de 27%. Já o Pro é ligeiramente melhor para *raciocinar sobre* entradas longas, como veremos a seguir.
Onde o Gemini 3.1 Pro ainda leva vantagem
Para fazer justiça ao modelo de ponta, o 3.1 Pro lidera em três benchmarks — todos eles testes difíceis de conhecimento e raciocínio.
Benchmark | Gemini 3.1 Pro | Gemini 3.6 Flash |
|---|---|---|
GPQA Diamond (ciência em nível de PhD) | 94.1% | 92.8% |
Humanity's Last Exam (sem ferramentas) | 44.7% | 38.3% |
AA-LCR (raciocínio com contexto longo) | 72.7% | 69.7% |
As margens são pequenas no GPQA e no raciocínio de contexto longo, mas maiores no Humanity's Last Exam. O Google posiciona o 3.1 Pro exatamente para isso: "tarefas complexas que exigem amplo conhecimento de mundo e raciocínio avançado entre modalidades". Se sua carga de trabalho está nessa fronteira — perguntas científicas de nível de pesquisa ou raciocínio em várias etapas sobre um documento extenso —, essa margem extra existe e pode justificar o custo.
Na prática, porém, há duas ressalvas importantes:
Conhecimento menos atual. O corte de conhecimento do Pro é janeiro de 2025, catorze meses anterior ao março de 2026 do Flash. Em outras palavras, o modelo de ponta sabe menos sobre o mundo atual do que o modelo mais barato.
Ainda em Preview. Cinco meses após seu lançamento, em fevereiro de 2026, o 3.1 Pro continua marcado como Preview na página de preços do Google — o próprio ID do modelo é
gemini-3.1-pro-preview—, enquanto o Flash é distribuído como a opção estável padrão atual.
Qual modelo usar em cada caso
Escolha o Gemini 3.6 Flash para agentes de código, automação de terminal e uso de computador, tarefas de engenharia de ML, extração ou classificação em alto volume, aplicações sensíveis à latência e busca em documentos longos. Nos dados publicados, ele é mais barato, rápido, atualizado e tem pontuação superior em todos esses casos.
Escolha o Gemini 3.1 Pro quando a tarefa exigir raciocínio de fronteira — ciência em nível de PhD ou análise em várias etapas sobre entradas longas — e alguns pontos de benchmark valerem mais do que custo, velocidade ou atualização do conhecimento. Planeje-se para mudanças típicas da fase Preview: IDs de modelos em preview podem ser renomeados ou descontinuados quando a versão estável chega.
Há duas questões que esta comparação não resolve por você: a confiabilidade nos seus padrões específicos de chamadas de ferramentas e a qualidade das respostas nos casos extremos do seu domínio.
Os dois modelos usam a mesma Gemini API, então a forma mais barata de decidir é rodar seus dez prompts mais importantes em cada um. Meu script de três tarefas levou cerca de um minuto para executar.
Como acessar os dois modelos
Os dois modelos estão na Gemini API e no Google AI Studio, com os IDs gemini-3.6-flash e gemini-3.1-pro-preview. O plano gratuito do AI Studio é suficiente para testá-los lado a lado antes de assumir um compromisso.
Se você já usa um agregador, tanto o OpenRouter quanto o AIReiter disponibilizam os dois modelos pelos preços de tabela do Google com uma única chave — foi assim que executei o teste A/B acima.
Perguntas frequentes
O Gemini 3.6 Flash é melhor que o 3.1 Pro?
Para a maior parte do trabalho em produção, sim. Ele vence em benchmarks de programação, agentes, ML, uso de computador e multimodalidade, além de custar menos e rodar 2.3x mais rápido. O 3.1 Pro permanece à frente apenas no GPQA Diamond, Humanity's Last Exam e raciocínio com contexto longo, por 1.3 a 6.4 pontos.
O Gemini 3.6 Flash é mais barato que o 3.1 Pro?
Sim, em todos os modos. A saída padrão da API custa $7.50 contra $12.00 por 1M de tokens, a diferença aumenta depois de prompts de 200k tokens, para $7.50 contra $18.00, e o modo Batch mantém o Pro 60% mais caro. O armazenamento de cache é 4.5x mais caro no Pro.
Qual é mais rápido: Gemini 3.6 Flash ou 3.1 Pro?
O Flash gera cerca de 261 tokens/segundo, contra 112 do 3.1 Pro, segundo a Artificial Analysis em 23 de julho de 2026. Ele também começa a responder antes: 12.8s contra 31.2s até o primeiro token em cargas de trabalho pesadas em raciocínio. No meu teste de três tarefas, isso resultou em uma execução 40% mais rápida de ponta a ponta.
O Gemini 3.1 Pro ainda vale a pena?
Somente quando você precisa do teto de raciocínio dele e aceita um modelo em fase Preview com corte de conhecimento em janeiro de 2025. Para tarefas abaixo desse nível de dificuldade, os números publicados não indicam que o custo extra compre resultados melhores que os do Flash.
