Gemini 3.5 Flash genera 2,6x i token di output al secondo di Gemini 3.1 Pro, costa il 25% in meno per token e supera di poco Pro nell'Indice di Intelligenza di Artificial Analysis (50 contro 46). Gemini 3.1 Pro è ancora in vantaggio di 5 punti su ARC-AGI-2 (77,1% contro 72,1%), e il punteggio di Flash nel recupero a lungo contesto scende dall'84,9% al 77,3% una volta che si supera la soglia di 128k token. Quale modello usare dipende dal compito: Flash ottimizza il throughput e la latenza nelle chiamate agli strumenti, Pro ottimizza la profondità del ragionamento multi-step, e i benchmark aggregati mediano queste due priorità in un unico punteggio che nasconde quale delle due il tuo carico di lavoro richieda davvero.
Punteggio di benchmark: dove ogni modello è davvero in vantaggio
| Metric | Gemini 3.5 Flash | Gemini 3.1 Pro | Winner |
|---|---|---|---|
| Indice di Intelligenza (Artificial Analysis) | 50 | 46 | Flash |
| ARC-AGI-2, ragionamento astratto (BenchLM) | 72.1% | 77.1% | Pro |
| MRCR v2 a contesto 128k (nxcode) | 77.3% (in calo rispetto a 84.9% a un contesto più breve) | non riportato pubblicamente alla stessa lunghezza | dati insufficienti |
| Punteggio medio multimodale (BenchLM) | 83.8 | 82.6 | Flash |
| Velocità di output (BenchLM) | 284.2 tok/s | 109 tok/s | Flash (2.6x) |
| Elo GDPval-AA, task agent nel mondo reale (apiyi) | 1656 | 1314 | Flash |
Flash vince sulle metriche che misurano il throughput e la gestione di attività generiche. Pro ha un vantaggio chiaro e documentato sulla profondità di ragionamento di ARC-AGI-2; nel retrieval a lungo contesto, Flash mostra una regressione documentata oltre i 128k token, ma il punteggio equivalente di Pro non è disponibile pubblicamente, quindi considererei quel punto inconclusivo anziché una vittoria di Pro. Questa distinzione si allinea direttamente con il tipo di attività che stai eseguendo, il che è più utile del singolo numero aggregato dell’Intelligence Index.
Una precisazione metodologica dalla stessa comparazione di BenchLM: dei circa 34 benchmark in cui entrambi i modelli hanno risultati pubblicati, solo 3 categorie sono direttamente confrontabili — Pro ha risultati esclusivi su 14 benchmark, Flash su 17, e le impostazioni di thinking-budget non sono sempre allineate tra i due. Considera la tabella sopra come affidabile in linea di massima; i divari su ARC-AGI-2 e MRCR v2 sono abbastanza ampi da essere degni di fiducia, ma una differenza di 1-2 punti su una metrica condivisa non dovrebbe essere interpretata come निर्णisiva.
Dove il vantaggio di Flash si riduce
Il divario ARC-AGI-2 (5 punti) è la differenza di categoria singola più ampia che il confronto di BenchLM ha riscontrato tra i due modelli. ARC-AGI-2 è costruito appositamente per resistere a scorciatoie basate sul riconoscimento di pattern, quindi un divario di 5 punti lì è un segnale più forte della profondità del ragionamento rispetto a un divario simile in un benchmark più convenzionale. Il risultato MRCR v2 di nxcode aggiunge un secondo dato nella stessa direzione: l'accuratezza di recupero di Flash scende dal 84.9% al 77.3% man mano che il contesto cresce verso 128k token. Il punteggio di Pro alla stessa lunghezza non è riportato pubblicamente, quindi non si tratta di una perdita documentata testa a testa per Pro — ma è una regressione documentata per Flash che la tabella dei benchmark di Pro non mostra.
Nota aneddotica, non evidenza di benchmark: un thread di Reddit r/GeminiAI che chiedeva agli utenti quale modello preferissero per i compiti difficili ha visto commentatori descrivere Flash come superiore a Pro "in tutto tranne il contesto lungo, [ragionamento] astratto." Si tratta di una manciata di opinioni, non di dati — ma casualmente descrive le stesse due eccezioni che mostrano i benchmark, il che è un controllo di sanità mentale leggermente utile piuttosto che una prova di qualcosa di per sé.
Prezzi e caching: il quadro reale dei costi
Il prezzo base riduce il vantaggio di prezzo più di quanto sembri a prima vista:
- Gemini 3.5 Flash: $1.50 / million input tokens, $9 / million output tokens
- Gemini 3.1 Pro: $2 / million input tokens, $12 / million output tokens
Questo è uno sconto del 25% sulla carta, non il divario 4-8x che Flash in precedenza aveva rispetto ai vecchi modelli Pro. La leva più importante è la cache:
- Le scritture della cache Flash sono gratuite; l'input nella cache costa $0.15/million tokens
- Le scritture della cache Pro costano $0.38/million tokens; l'input nella cache costa $0.50/million tokens — oltre 3 volte il tasso di input nella cache di Flash
Per qualsiasi workflow che re-invia lo stesso system prompt o il contesto del documento attraverso più turni — chat agent, coding assistant con un contesto persistente del codebase, support bot multi-turno — quel gap di caching si amplifica rapidamente. Una singola richiesta mostra a malapena la differenza; una sessione di agent di mille turni sì.
Il divario inoltre non è costante. la ripartizione dei prezzi di apiyi osserva che, oltre circa 200k token di contesto, la differenza di prezzo tra i due modelli si riduce al 25-50%, perché l’economia per token di entrambi i modelli converge a quella scala. Se il tuo carico di lavoro è dominato da documenti singoli molto lunghi anziché da chiamate ripetute brevi, l’argomento legato al prezzo a favore di Flash si indebolisce.
Un esempio concreto: un flusso di lavoro di un support-bot che invia 1M token di input memorizzati nella cache e genera 500K token di output al giorno. Su Flash, questo costa $0 per la scrittura della cache più $0.15 x 1 (input memorizzato nella cache) + $9 x 0.5 (output) = $4.65/giorno. Su Pro, lo stesso carico di lavoro costa $0.38 (scrittura della cache, una tantum) + $0.50 x 1 (input memorizzato nella cache) + $12 x 0.5 (output) = circa $6.88/giorno il primo giorno, stabilizzandosi a $6.50/giorno dopo la prima scrittura. Su un mese, la differenza è tra circa $140 e $195 — prima di considerare il ragionamento più approfondito di Pro su qualsiasi richiesta che ne abbia effettivamente bisogno.
Loop di agenti: perché Flash vince in velocità, non sempre in affidabilità
Il benchmark agent-loop di nxcode ha eseguito un ciclo agentico di 8 passaggi e ha rilevato che Flash completava l’intera sequenza in circa 25 secondi contro i 100 secondi di Pro — una differenza di 4x che si amplifica a ogni passaggio aggiuntivo. Su GDPval-AA, un benchmark costruito attorno ad attività di knowledge work nel mondo reale, il punteggio Elo di Flash (1656) supera quello di Pro (1314) di 342 punti, il divario singolo più grande dell’intera tabella del benchmark.
La precisazione: quel vantaggio in termini di velocità e punteggio presuppone che il loop dell’agente si svolga senza intoppi. Gli stessi divari ARC-AGI-2 e MRCR v2 che emergono nei task di ragionamento e di lungo contesto sono una base ragionevole per aspettarsi che Flash sia anche meno tollerante quando una chiamata a uno strumento restituisce qualcosa di inatteso a metà del loop e l’agente deve ripianificare — questa è un’inferenza dai dati sulla profondità di ragionamento sopra, non un’affermazione misurata separatamente in benchmark. Se il tuo agente gira in modo supervisionato, con una persona che controlla l’output tra un passaggio e l’altro, la velocità di Flash è quasi una vittoria gratuita. Se gira non supervisionato per molti passaggi, senza una persona nel loop, il margine di ragionamento di Pro è la scommessa più sicura finché qualcuno non pubblica dati sul tasso di fallimento per entrambi.
Quale dovresti usare: una matrice decisionale basata sui compiti
| Tipo di attività | Modello consigliato | Perché |
|---|---|---|
| Programmazione quotidiana (test, revisione PR, traduzione tra lingue) | Flash | La velocità e il costo vincono, la profondità del ragionamento non è il collo di bottiglia |
| Refactoring approfonditi, progettazione di algoritmi innovativi | Pro | Il divario di ARC-AGI-2 emerge direttamente nel ragionamento logico multistep |
| Recupero da documenti lunghi (contratti, corpora di ricerca oltre 128k token) | Pro | Flash ha una regressione MRCR v2 documentata a questa lunghezza; quella di Pro non è pubblicata, ma la scelta predefinita più sicura è il modello senza un punto debole noto |
| Generazione batch ad alto volume | Flash | Scritture della cache gratuite e throughput 2.6x contano di più su larga scala |
| Workflow agentici supervisionati con un umano che controlla l'output | Flash | Vantaggio di velocità senza il rischio di affidabilità in modalità non supervisionata |
| Catene agentiche non supervisionate e ad alto rischio | Pro | Il margine di profondità del ragionamento è la scelta più sicura senza un umano che intercetti gli errori a metà ciclo |
| Chiamate multi-turn frequenti che riutilizzano lo stesso contesto | Flash | Il prezzo dell'input in cache è all'incirca un terzo di quello di Pro |
Una semplice regola predefinita copre la maggior parte della matrice sopra: invia le richieste a Flash a meno che non sia vera una delle tre condizioni — il contesto supera 128k token e l'accuratezza del retrieval è importante, il compito richiede ragionamento astratto/multistep (nuovi algoritmi, sintesi legale o di ricerca), oppure l'agente funziona senza supervisione per più di pochi passaggi. Ciascuna di queste tre condizioni orienta la scelta verso Pro; se non ne è presente nessuna, la velocità di Flash e il prezzo della cache lo rendono l'opzione predefinita più economica.
FAQ
Gemini 3.5 Flash è migliore di 3.1 Pro?
Su velocità, costo e benchmark generici, sì. Sul ragionamento astratto (ARC-AGI-2), Gemini 3.1 Pro è ancora in testa di 5 punti. Sul recupero di contesto lungo oltre 128k token, Flash ha una regressione documentata e il punteggio equivalente di Pro non è pubblicato, quindi considera quel confronto non risolto piuttosto che una vittoria confermata di Pro. Quale sia "migliore" dipende da quale di queste categorie rientra il tuo compito.
Quanto è più economico Gemini 3.5 Flash rispetto a 3.1 Pro?
Circa il 25% più economico sui prezzi base di input/output ($1.50/$9 contro $2/$12 per milione di token). I maggiori risparmi si vedono nella cache: le scritture in cache di Flash sono gratuite e l’input memorizzato in cache costa circa un terzo della tariffa di Pro, cosa che conta soprattutto per carichi di lavoro multi-turno o ad alto volume.
Gemini 3.5 Flash è buono per programmare?
Sì, per il lavoro quotidiano — generazione di test, revisione delle PR, traduzione di codice tra linguaggi. Per refactoring profondi o progettazione di nuovi algoritmi, il vantaggio di Pro nei benchmark di ragionamento astratto tende a emergere nella qualità dell’output.
Gemini 3.5 Flash gestisce bene il contesto lungo?
A lunghezze di contesto più brevi, sì — l'accuratezza di recupero di MRCR v2 si mantiene all'84,9%. Oltre 128k token, però, scende al 77,3%, il che rappresenta un divario significativo per attività come la revisione di contratti multi-documento. Il punteggio di Gemini 3.1 Pro alla stessa lunghezza non è stato pubblicato, quindi considera questo un limite noto di Flash piuttosto che un vantaggio confermato di Pro.
In sintesi
Gemini 3.5 Flash è la scelta predefinita migliore per la maggior parte del lavoro quotidiano e ad alto volume — è più veloce, meno costoso per la cache, e abbastanza vicino nei benchmark generali da rendere raramente rilevante il compromesso. Gemini 3.1 Pro si guadagna il suo costo più elevato nel ragionamento astratto e nelle catene di agenti non supervisionate; sui documenti lunghi oltre 128k token, i numeri di Flash mostrano un punto debole che quelli di Pro non confermano né smentiscono, quindi considera questo aspetto come qualcosa che vale la pena testare personalmente prima di scegliere in un senso o nell'altro.
Questo confronto è basato su dati di benchmark pubblici (Artificial Analysis, BenchLM, nxcode e apiyi), non su test API eseguiti direttamente. Gemini 3.1 Pro è stato lanciato con un posizionamento focalizzato sul ragionamento, distinto dalla focalizzazione sulla velocità di Flash. Al momento della stesura, Gemini 3.5 Pro non è ancora stato rilasciato — le segnalazioni indicano un rilascio a luglio 2026 — quindi consideratelo come una snapshot che sia i due modelli, sia questo confronto, dovranno essere rivisti una volta che arriverà la prossima versione di Pro.
