AIREITER

Gemini 3.7 Flash vs 3.6 Flash: stesso prezzo, codice migliore

Ultimo Aggiornamento: 2026-08-14 07:44:03

A sole tre settimane dal lancio di 3.6 Flash, Google ha pubblicato Gemini 3.7 Flash con un salto prestazionale difficile da ignorare: su DeepSWE v1.1 passa dal 48,6% al 65,3%. Il prezzo promozionale resta identico per entrambi, $0.75/$3.75 per milione di token fino a dicembre 2026, quindi l'upgrade non aumenta il costo per token. Il vantaggio, però, varia sensibilmente in base al tipo di carico di lavoro.

Gemini 3.7 Flash e 3.6 Flash: confronto completo dei benchmark

I dati principali riportati da Google DeepMind nella pagina ufficiale dei modelli indicano miglioramenti generalizzati per 3.7 Flash. Gli scarti più marcati riguardano soprattutto gli agenti per il coding e l'automazione aziendale. La tabella raccoglie tutte le 18 metriche pubblicate da Google per entrambi i modelli; Claude Sonnet 5 e GPT-5.6 Terra sono inclusi come riferimento.

Confronto dei benchmark di Gemini 3.7 Flash e 3.6 Flash su sei metriche chiave
BenchmarkGemini 3.7 FlashGemini 3.6 FlashDifferenza
Artificial Analysis Intelligence Index (indice composito)5652+4
FrontierCode 1.1 (qualità del codice di produzione)43.6%34.4%+9.2
DeepSWE v1.1 (software engineering su orizzonti lunghi)65.3%48.6%+16.7
Code Arena (Elo per sviluppo web)15881538+50
Terminal-Bench 2.1 (coding agentico da terminale)85.8%78.0%+7.8
Terminal-Bench 3.0 (capacità generali degli agenti)14.9%5.4%+9.5
AutomationBench (automazione dei workflow aziendali)30.4%17.0%+13.4
GDPVal-AA v2 (Elo per il lavoro della conoscenza)15251422+103
Harvey LAB-AA (workflow legali complessi)90.7%85.1%+5.6
GDP.pdf (comprensione di PDF specialistici)34.0%22.0%+12.0
CharXiv, senza strumenti (ragionamento sui grafici)84.5%85.2%−0.7
CharXiv, con strumenti88.7%89.4%−0.7
LVBench (comprensione di video lunghi)85.4%84.2%+1.2
GDM-MRCR v2, 128k (recupero in contesti lunghi)97.0%91.8%+5.2
OSWorld-2.0 (uso agentico del computer)47.9%33.8%+14.1
Agent's Last Exam (attività desktop per agenti)26.3%24.2%+2.1
HLE-Verified (ragionamento esperto multidisciplinare)53.6%51.2%+2.4
LABBench2 (attività di ricerca biologica)82.1%76.1%+6.0

Tutti i valori sono dichiarati dal fornitore, Google DeepMind, e provengono dalla pagina di 3.7 Flash. Per gran parte di questi benchmark non sono ancora disponibili riproduzioni indipendenti: le differenze vanno quindi lette come un'indicazione, non come una garanzia per il proprio workload.

Coding e agenti: il vero salto di 3.7 Flash

Le distanze maggiori tra i due modelli emergono nei benchmark di coding e agenti. DeepSWE v1.1, che valuta attività di software engineering su repository reali e a lungo orizzonte, cresce di 16,7 punti percentuali: dal 48,6% al 65,3%. Sullo stesso parametro supera Claude Sonnet 5, fermo al 53,8%, e si colloca tra quest'ultimo e GPT-5.6 Terra, al 69,6% (tutti i punteggi comparativi provengono dalla tabella dei benchmark di DeepMind).

Anche gli altri test orientati agli agenti mostrano progressi della stessa portata:

  • Terminal-Bench 3.0 (capacità degli agenti multi-tool): da 5.4% a 14.9%, quasi triplicando
  • AutomationBench (automazione dei workflow aziendali): da 17.0% a 30.4%
  • FrontierCode 1.1 (qualità del codice di produzione): +9.2 punti
  • OSWorld-2.0 (uso agentico del computer): da 33.8% a 47.9%

Le prime reazioni degli utenti su Reddit restituiscono bene la distanza tra vittorie nei benchmark ed esperienza quotidiana degli sviluppatori:

Efficace nell'implementazione, ma potenzialmente più debole nella pianificazione, nella code review e nella scomposizione di problemi difficili.

— Discussione di utenti su r/google_antigravity

La documentazione clienti di Google, pubblicata nella pagina del modello DeepMind, va nella stessa direzione. Browser Use ha segnalato che "l'agente Gemini 3.7 Flash era il 35% meno costoso di 3.6 Flash, con un tasso di cache hit sui prompt osservato superiore dell'8% e meno errori negli strumenti". Harvey ha misurato un incremento di 2,6 punti nel tasso di superamento completo su Legal Agent Bench. Nunu.ai ha rilevato prestazioni alla pari con GPT-5.6-Terra "a circa metà del costo". Tutti e tre attribuiscono il risparmio a un minor numero di passaggi nel loop dell'agente, non a sconti sul prezzo per token.

Lavoro della conoscenza e multimodalità: miglioramenti più contenuti, ma concreti

Al di fuori del coding, i guadagni si riducono. L'Artificial Analysis Intelligence Index passa da 52 a 56, collocando 3.7 Flash tra Claude Sonnet 5, con 55, e GPT-5.6 Terra, con 57, secondo la tabella comparativa di DeepMind. Il miglioramento non legato al codice più rilevante è nella comprensione documentale: GDP.pdf sale dal 22,0% al 34,0%, ossia 12 punti in più per pipeline che elaborano documenti complessi, report finanziari o atti legali. GDM-MRCR v2, che misura il recupero delle informazioni in un contesto di 128K token, migliora dal 91,8% al 97,0%.

Harvey LAB-AA, dedicato ai workflow legali complessi, passa dall'85,1% al 90,7%. La comprensione di video lunghi con LVBench e le attività di ricerca biologica di LABBench2 migliorano entrambe di circa 6 punti. Sono risultati importanti per carichi specializzati, ma difficilmente basteranno da soli a motivare un upgrade.

Prezzi: tariffa promozionale identica per entrambi i modelli

ModelloInput ($/1M token)Output ($/1M token)Tariffa standard (dal 1° gennaio 2027)
Gemini 3.7 Flash$0.75\*$3.75\*$1.50 / $7.50
Gemini 3.6 Flash$0.75\*$3.75\*$1.50 / $7.50
Claude Sonnet 5$2.00$10.00—
GPT-5.6 Terra$2.00$12.00—

\*Il prezzo promozionale scade il 31 dicembre 2026. Tutti i prezzi provengono dalla pagina del modello DeepMind.

Quando 3.7 è stato lanciato il 13 agosto 2026, Google ha esteso a entrambi i modelli Flash la tariffa promozionale di $0.75/$3.75. In precedenza, 3.6 Flash applicava la tariffa standard di $1.50/$7.50. Dal 1° gennaio 2027, entrambi torneranno a $1.50/$7.50, salvo proroga della promozione da parte di Google. A parità di costo per token, la differenza economica dipende dall'efficienza sul compito: la riduzione del 35% dei costi degli agenti riportata da Browser Use è stata misurata sugli stessi workload ed è attribuita a meno chiamate agli strumenti e a tassi di cache hit più alti, non a prezzi diversi.

Per un'analisi dettagliata dei costi API di 3.7 Flash, inclusi caching, Batch API e costi di grounding, consulta la nostra guida ai prezzi API di Gemini 3.7 Flash.

L'unico ambito in cui 3.6 Flash resta avanti

3.6 Flash conserva un vantaggio minimo nel ragionamento sui grafici. Su CharXiv senza strumenti ottiene l'85,2%, contro l'84,5% di 3.7. Con gli strumenti attivi, il divario rimane identico: 89,4% contro 88,7%. Margini inferiori a un punto sono abbastanza ridotti da rendere i due modelli potenzialmente comparabili sulle singole attività relative ai grafici. Prima di scegliere il modello predefinito, va quindi verificato il comportamento sul proprio workload.

Nessun altro benchmark nella tabella comparativa di Google vede 3.6 davanti a 3.7. Il divario nell'indice di intelligenza, 52 contro 56, è l'area più vicina al confronto al di fuori del ragionamento sui grafici, ma anche qui è 3.7 a prevalere.

Migrazione: cosa cambia oltre al model string

Dal punto di vista tecnico, la migrazione richiede soltanto di sostituire l'ID modello gemini-3.6-flash con gemini-3.7-flash. Secondo la pagina del modello DeepMind, entrambi offrono la stessa finestra di contesto, 1M in input e 64K in output, le stesse modalità di input, ovvero testo, immagini, video, audio e PDF, e le stesse capacità di uso degli strumenti: function calling, search grounding e computer use. La pagina indica inoltre 3.7 Flash come generalmente disponibile.

C'è però un'avvertenza. Il passaggio da 3.5 a 3.6 ha introdotto modifiche silenziose al comportamento dell'API che hanno colto di sorpresa diversi sviluppatori. Come rilevato da test indipendenti, temperature, top_p e top_k venivano ignorati senza avviso, thinking_budget è diventato l'enum stringa thinking_level ed è stato rimosso il prefilling delle risposte. Google non ha ancora comunicato se 3.7 Flash introduca cambiamenti analoghi. Finché questa documentazione non sarà disponibile, è prudente eseguire la suite di valutazione con entrambi i model string prima di migrare il traffico di produzione. Conviene anche mantenere 3.6 come fallback.

Conviene passare a Gemini 3.7 Flash?

La risposta dipende soprattutto dal tipo di workload:

  • Passa subito se usi agenti di coding. DeepSWE v1.1 guadagna 16,7 punti e Terminal-Bench 3.0 quasi triplica. Con lo stesso prezzo per token, non c'è una ragione economica per restare su 3.6 nei workload basati su coding agent.
  • Passa subito se elabori documenti complessi. La comprensione su GDP.pdf cresce di 12 punti, dal 22.0% al 34.0%. Il recupero nel contesto lungo a 128K token arriva al 97.0%.
  • Prima testa se il ragionamento sui grafici è l'attività principale. I punteggi CharXiv favoriscono 3.6 per meno di 1 punto. Prima di scegliere, esegui una valutazione affiancata.
  • Resta su 3.6 se la pipeline è già validata e stabile. La pagina del modello DeepMind non riporta una data di ritiro per 3.6 Flash. Se il workflow supera i test di regressione e non servono subito i miglioramenti nel coding, il costo del debugging dovuto a variazioni di comportamento può superare il beneficio. Migra un workflow alla volta.
  • Tieni conto della cadenza dei rilasci. Google ha pubblicato 3.7 appena tre settimane dopo 3.6. Migra ora i workflow che traggono il maggior vantaggio dai progressi di 3.7, mantieni 3.6 fissato come fallback e considera ogni release Flash un aggiornamento incrementale da valutare, non un cambio di piattaforma.

Puoi confrontare direttamente i due modelli tramite le interfacce chat di Gemini 3.7 Flash e Gemini 3.6 Flash.

Gemini 3.7 Flash è una nuova architettura o un aggiornamento post-training?

Google non ha chiarito pubblicamente se 3.7 Flash sia una nuova architettura o una patch post-training. L'Artificial Analysis Intelligence Index passa da 52 a 56, mentre test indipendenti hanno confermato che 3.5 e 3.6 Flash ottenevano entrambi 50 sullo stesso indice. Non è documentato se il miglioramento di 3.7 derivi da modifiche architetturali o da dati di addestramento migliori.

Gemini 3.7 Flash costa più di 3.6 Flash?

No. Entrambi i modelli hanno lo stesso prezzo di $0.75 per milione di token in input e $3.75 per milione di token in output fino al 31 dicembre 2026. Successivamente, entrambi passeranno a $1.50/$7.50. Il risparmio dell'upgrade dipende da meno chiamate agli strumenti e meno passaggi di ragionamento per attività, non da un prezzo per token inferiore.

Dove è disponibile Gemini 3.7 Flash?

Secondo la pagina del modello DeepMind, 3.7 Flash è disponibile tramite Gemini API, Google AI Studio, Google Antigravity, Vertex AI, Gemini Enterprise e Gemini App, con stato di disponibilità generale.

Conviene aspettare la prossima versione Flash invece di migrare ora?

3.7 Flash è un modello GA con benchmark pubblicati e adozione da parte dei clienti. Se il tuo workload beneficia dei miglioramenti nel coding e negli agenti, migra subito quei workflow e ripeti la valutazione quando uscirà la prossima versione. Aspettare comporta un costo opportunità: rinunci ai vantaggi già disponibili.