Gemini 3.6 Flash vs 3.1 Pro: prezzi, velocità e verdetto

Ultimo Aggiornamento: 2026-07-23 09:44:06

Di norma il modello Pro è quello da battere. Stavolta no. Gemini 3.6 Flash costa meno di Gemini 3.1 Pro, genera a una velocità più che doppia e lo supera in quasi tutti i benchmark di coding e utilizzo agentic. Il più vecchio 3.1 Pro conserva un solo vantaggio: un margine ristretto nei test di reasoning puro più difficili. Ho sottoposto entrambi agli stessi task e ho ricontrollato prezzi e specifiche nelle documentazioni Google e su Artificial Analysis il 23 luglio 2026.

Il verdetto, in 30 secondi

Gemini 3.6 Flash

Gemini 3.1 Pro

Vincitore

Prezzo API (input/output per 1M, ≤200k)

$1.50 / $7.50

$2.00 / $12.00

Flash

Prompt lunghi (>200k token)

stesso prezzo fisso

$4.00 / $18.00

Flash

Velocità di output

261 token/s

112 token/s

Flash

Benchmark di coding e agentic

vince tutti e 4 gli scontri diretti

Flash

Reasoning più difficile (GPQA, HLE)

avanti di 1.3–6.4 punti

3.1 Pro

Cutoff della conoscenza

marzo 2026

gennaio 2025

Flash

Stato di rilascio

disponibilità generale

Preview da febbraio 2026

Flash

Se vi basta la sintesi: scegliete Gemini 3.6 Flash come impostazione predefinita e passate a 3.1 Pro solo quando serve il massimo livello di reasoning. Potete anche saltare l'articolo e provare direttamente Gemini 3.6 Flash e Gemini 3.1 Pro uno contro l'altro in una chat del browser, con i vostri prompt e senza chiave API. Il resto dell'articolo raccoglie le prove, incluso un test su tre task che potete riprodurre.

Prezzi: Flash allunga il distacco

Gemini 3.6 Flash applica lo stesso listino a qualunque lunghezza del prompt; Gemini 3.1 Pro non solo costa di più, ma introduce anche una fascia per i prompt lunghi. Questi sono i prezzi standard dell'API per 1M di token, verificati il 23 luglio 2026:

Gemini 3.6 Flash

Gemini 3.1 Pro

Input (≤200k)

$1.50

$2.00

Output (≤200k)

$7.50

$12.00

Input (>200k)

$1.50

$4.00

Output (>200k)

$7.50

$18.00

Lettura cache del contesto (≤200k)

$0.15

$0.20

Batch (input/output, ≤200k)

$0.75 / $3.75

$1.00 / $6.00

È soprattutto sull'output che la differenza si sente: per i prompt brevi 3.1 Pro costa il 60% in più per token generato, fino ad arrivare al 140% oltre i 200k token.

Il divario resta anche con gli sconti. La modalità Batch dimezza le tariffe di entrambi, quindi Pro rimane più caro del 60%. Lo *storage* della cache, fatturato a ore oltre al prezzo di lettura per token, costa $4.50 per 1M di token all'ora su Pro contro $1.00 su Flash. Ai prezzi pubblici di listino di Google, nessuna modalità — standard, Batch, Priority o caching — rende Pro l'opzione più economica.

Test pratico: gli stessi tre task per entrambi

Le tabelle dei prezzi presuppongono un consumo identico di token. Per verificare cosa accade nella pratica, il 22 luglio 2026 ho inviato gli stessi tre prompt a entrambi i modelli via OpenRouter, usando gli ID google/gemini-3.6-flash e google/gemini-3.1-pro-preview, temperatura 0 e una singola esecuzione per task:

1. Codice: scrivere una funzione Python merge_intervals con docstring ed esempio d'uso 2. Reasoning: un problema testuale su due treni che richiede algebra di tempo e velocità 3. Estrazione: ricavare le attività da svolgere da un messaggio di team disordinato, come array JSON

Task

Latenza Flash

Latenza Pro

Costo Flash

Costo Pro

Codice

2.4s

4.5s

$0.0085

$0.0102

Reasoning

1.9s

2.4s

$0.0082

$0.0118

Estrazione

1.3s

2.6s

$0.0049

$0.0057

Totale

5.65s

9.48s

$0.0215

$0.0277

*I totali sono calcolati sui log grezzi in millisecondi e token; le righe dei singoli task sono arrotondate, quindi la somma di una colonna può differire di un centesimo.*

Entrambi i modelli hanno risolto correttamente tutti e tre i task: intervalli uniti nel modo giusto, tempo di ricongiungimento corretto e JSON pulito. La differenza sta nel costo di ciascuna risposta.

Flash ha generato *più* token di Pro (2,843 contro 2,285 nei metadati di utilizzo di OpenRouter, in gran parte token di reasoning interno per entrambi) eppure è risultato il 22% più economico e il 40% più rapido end-to-end. Il prezzo di output più alto e la generazione più lenta di Pro pesano più delle sue risposte più concise. Nei loop agentic, dove ogni step paga nuovamente quella latenza, il divario si amplifica.

Grafico a barre che confronta Gemini 3.6 Flash e 3.1 Pro per costo per task e latenza, con 3.1 Pro impostato a 100; Flash è a 78 per il costo e a 60 per la latenza

Tre prompt piccoli sono una verifica puntuale, non un benchmark: considerate quindi le percentuali esatte come indicative. La tendenza, però, coincide con le misurazioni su scala più ampia, che vediamo ora.

Benchmark di coding e agentic: Flash fa l'en plein

Nei confronti pubblici testa a testa di Artificial Analysis, 3.6 Flash supera il precedente 3.1 Pro in coding, ML engineering e uso del terminale:

Benchmark

Gemini 3.1 Pro

Gemini 3.6 Flash

DeepSWE v1.1

12%

49%

MLE-Bench

42.6%

63.9%

SWE-Bench Pro

54.2%

58.7%

Terminal-Bench 2.1

73.8%

78.0%

Grafico a barre raggruppate dei benchmark di coding e agentic, con Gemini 3.6 Flash davanti a 3.1 Pro in DeepSWE, MLE-Bench, SWE-Bench Pro e Terminal-Bench 2.1

Il distacco maggiore è su DeepSWE: 49% contro 12%. Flash supera Pro di poco anche nel reasoning multimodale (MMMU-Pro 83.2% contro 82.4%) e si aggiudica l'indice composito Artificial Analysis Intelligence Index, 50 a 46.

Anche la velocità racconta la stessa storia. Al 23 luglio 2026, Artificial Analysis misura Flash a 261 token al secondo contro i 112 di 3.1 Pro, cioè 2.3x, con un time-to-first-token di 12.8s contro 31.2s sul proprio carico di lavoro standard. I valori del primo token includono il tempo di ragionamento di ciascun modello prima che inizi la risposta, ed è per questo che i miei task brevi qui sopra si sono conclusi molto prima. Allargando lo sguardo alla classifica completa, Flash si colloca vicino ai vertici contemporaneamente su tutti e tre gli assi:

Grafici della classifica Artificial Analysis con Gemini 3.6 Flash evidenziato: Intelligence Index 50, velocità di output di 261 token al secondo e costo ponderato di $0.50 per task

C'è una sfumatura importante sul contesto lungo. Entrambi accettano input da 1M di token, ma all'estremo Flash è nettamente più efficace nel *trovare* le informazioni, con recupero MRCR a 1M token del 54% contro meno del 27%; Pro è invece leggermente migliore nel *ragionare su* input lunghi, come vedremo nella prossima sezione.

I casi in cui Gemini 3.1 Pro resta avanti

Per correttezza verso il modello di punta: 3.1 Pro è in testa in tre benchmark, tutti test impegnativi di conoscenza e reasoning.

Benchmark

Gemini 3.1 Pro

Gemini 3.6 Flash

GPQA Diamond (scienze a livello PhD)

94.1%

92.8%

Humanity's Last Exam (senza strumenti)

44.7%

38.3%

AA-LCR (reasoning su contesto lungo)

72.7%

69.7%

I margini sono ridotti su GPQA e sul reasoning a contesto lungo, mentre diventano più ampi su Humanity's Last Exam. Google posiziona 3.1 Pro proprio per questo scenario: "attività complesse che richiedono un'ampia conoscenza del mondo e reasoning avanzato tra più modalità". Se il vostro carico di lavoro opera su questa frontiera, con domande scientifiche di livello ricerca o analisi multistep su documenti lunghi, quel margine esiste e può giustificare la spesa.

Ci sono però due aspetti pratici a suo sfavore:

  • Conoscenza meno aggiornata. Il cutoff di Pro è gennaio 2025, quattordici mesi prima di marzo 2026 per Flash: il modello di punta sa meno del mondo attuale rispetto a quello più economico.

  • Stato Preview. Cinque mesi dopo il lancio di febbraio 2026, 3.1 Pro è ancora indicato come Preview nella pagina prezzi di Google — e il suo model ID è gemini-3.1-pro-preview — mentre Flash è distribuito come opzione stabile predefinita.

Quale modello scegliere

  • Scegliete Gemini 3.6 Flash per agent di coding, automazione da terminale e computer-use, task di ML engineering, estrazione o classificazione ad alto volume, app sensibili alla latenza e recupero di informazioni da documenti lunghi. Nei dati pubblicati costa meno, è più rapido, più aggiornato e ottiene punteggi superiori in tutti questi scenari.

  • Scegliete Gemini 3.1 Pro quando il task richiede reasoning di frontiera — scienza a livello PhD o analisi multistep su input lunghi — e pochi punti di benchmark contano più di costo, velocità e aggiornamento della conoscenza. Mettete in conto la variabilità di un modello Preview: gli ID dei modelli in anteprima possono essere rinominati o ritirati all'arrivo della versione stabile.

Questo confronto non può però decidere al posto vostro due aspetti: l'affidabilità con i vostri specifici schemi di tool calling e la qualità dell'output sui casi limite del vostro dominio.

I due modelli passano dalla stessa Gemini API, quindi il modo meno costoso per scegliere è eseguire su entrambi i vostri dieci prompt più importanti. Il mio script con tre task ha richiesto circa un minuto.

Come accedere a entrambi

Entrambi i modelli sono disponibili nella Gemini API e in Google AI Studio, con gli ID gemini-3.6-flash e gemini-3.1-pro-preview. Il piano gratuito di AI Studio è sufficiente per testarli affiancati prima di impegnarsi.

Se passate già da un aggregatore, OpenRouter e AIReiter espongono entrambi i modelli ai prezzi di listino Google dietro un'unica chiave: è così che ho eseguito il test A/B qui sopra.

FAQ

Gemini 3.6 Flash è migliore di 3.1 Pro?

Per la maggior parte del lavoro in produzione, sì: vince nei benchmark di coding, agentic, ML, computer-use e multimodale, costando meno e funzionando 2.3x più velocemente. 3.1 Pro rimane davanti solo in GPQA Diamond, Humanity's Last Exam e reasoning su contesto lungo, con un vantaggio da 1.3 a 6.4 punti.

Gemini 3.6 Flash costa meno di 3.1 Pro?

Sì, in ogni modalità. L'output API standard costa $7.50 contro $12.00 per 1M di token; il distacco aumenta oltre i prompt da 200k token, con $7.50 contro $18.00, e la modalità Batch conserva lo stesso sovrapprezzo del 60% per Pro. Lo storage della cache è 4.5x più costoso su Pro.

È più veloce Gemini 3.6 Flash o 3.1 Pro?

Flash genera circa 261 token al secondo contro i 112 di 3.1 Pro (Artificial Analysis, 23 luglio 2026), e inizia a rispondere prima: 12.8s contro 31.2s di time-to-first-token sui carichi intensivi di reasoning. Nel mio test su tre task questo si è tradotto in un completamento end-to-end più rapido del 40%.

Vale ancora la pena usare Gemini 3.1 Pro?

Solo quando serve il suo livello massimo di reasoning e potete accettare un modello in fase Preview con cutoff della conoscenza a gennaio 2025. Per task sotto quella soglia di difficoltà, i dati pubblicati non indicano che il costo extra porti output migliori rispetto a Flash.

Approfondimenti correlati