Gemini 3.6 Flash: prezzi, benchmark e accesso API

Ultimo Aggiornamento: 2026-07-22 07:19:55

Per chi esegue agenti AI su larga scala, il lancio di Gemini 3.6 Flash del 21 luglio 2026 si riduce a due cifre: l'output passa da $9.00 a $7.50 per milione di token e, a parità di lavoro, il modello utilizza circa il 17% di token di output in meno. Insieme, questi fattori possono abbassare di circa un terzo il costo per task nei carichi di lavoro dominati dall'output. Nei benchmark di coding e agentic, inoltre, supera il precedente 3.5 Flash e nella maggior parte dei test anche il più grande 3.1 Pro. Per chi usa già 3.5 Flash, è quasi un upgrade senza controindicazioni, anche se non ha il prezzo di listino più basso della categoria.

Cosa ha lanciato Google il 21 luglio

Google ha rilasciato contemporaneamente tre modelli, pensati per esigenze diverse:

  • Gemini 3.6 Flash (gemini-3.6-flash): il modello principale, rapido ma capace. Offre 1M token di contesto, 64k di output massimo e un cutoff della conoscenza aggiornato a marzo 2026, rispetto a gennaio 2025.
  • Gemini 3.5 Flash-Lite: modello ad alto throughput, con circa 350 token di output al secondo e un prezzo molto più basso per operazioni semplici e ad alto volume.
  • Gemini 3.5 Flash Cyber: variante ottimizzata per la sicurezza, progettata per individuare, convalidare e correggere vulnerabilità. Opera all'interno di CodeMender ed è disponibile in un pilota ad accesso limitato per governi e partner fidati, non come rilascio generalizzato.
Pagina ufficiale dei prezzi delle API Gemini che mostra Gemini 3.6 Flash a $1.50 per l'input e $7.50 per l'output ogni 1M token

La pagina ufficiale presenta 3.6 Flash come "il nostro modello più intelligente pensato per la velocità", mentre i prezzi sono pubblicati nella pagina dei prezzi delle API Gemini di Google.

Questo aggiornamento non arriva isolato dal resto della roadmap. Il flagship Gemini 3.5 Pro ha subito uno slittamento e DeepMind ha dichiarato di aver già avviato il pre-training di Gemini 4: il rinnovamento di Flash colma quindi il divario in attesa dei rilasci più importanti.

Prezzi di Gemini 3.6 Flash: perché il taglio è meno ampio di quanto sembri

Il listino API standard di Gemini 3.6 Flash è di $1.50 per 1M token di input e $7.50 per 1M token di output; nell'output rientrano anche i thinking token. Il context caching costa $0.15 per 1M token, più $1.00 per 1M token/ora di archiviazione.

C'è però un dettaglio che gran parte delle notizie sul lancio trascura: il taglio riguarda esclusivamente l'output. Gemini 3.5 Flash costava $1.50 per l'input e $9.00 per l'output. L'input resta invariato, mentre l'output scende da $9.00 a $7.50: una riduzione del 16.7%, non uno sconto generalizzato. Per i workload con molto input, ad esempio documenti lunghi da analizzare e risposte brevi, il risparmio di listino è limitato. Il vantaggio più rilevante emerge altrove.

Conta il costo per task, non il prezzo per token

Confrontare generazioni di modelli in base al solo listino per token porta fuori strada. Il costo effettivo è prezzo × token utilizzati. Qui cambiano due fattori: la tariffa di output è inferiore del 16.7% e Google, tramite l'Artificial Analysis Index, indica circa il 17% di token di output in meno per lo stesso lavoro. Nel caso migliore, la combinazione porta a 0.833 × 0.83 ≈ 0.69: circa il 31% in meno sull'output.

Il risparmio reale dipende dal workload. Ho quindi eseguito gli stessi tre prompt — un task di coding, un problema di ragionamento e un'estrazione JSON — su entrambi i modelli via OpenRouter, con temperatura 0, il 22 luglio 2026:

Metrica (3 task, temp 0)Gemini 3.6 FlashGemini 3.5 Flash
Token di input146145
Token di output2,7362,593
Costo totale$0.0207$0.0236
Latenza totale5.20s5.19s

Entrambi i modelli hanno fornito risposte corrette e comparabili. In questo piccolo campione, 3.6 Flash è risultato circa il 12% meno costoso a velocità praticamente identica, pur generando qualche punto percentuale di token in più perché ha dedicato più risorse al ragionamento. In sintesi: il risparmio affidabile è il taglio del prezzo di output, da $9.00 a $7.50; il guadagno di efficienza sui token è reale in aggregato, ma varia in base al task e non si manifesta sempre. Nella pratica conviene pianificare un risparmio del 12–17% sull'output, considerando il 31% come scenario migliore.

Grafico a barre del costo di output per task: Gemini 3.5 Flash a 100, Gemini 3.6 Flash misurato a 88 su tre task e a 69 nel caso migliore con il 17% di token in meno

(Campione ridotto: tre task, temperatura 0; non è un benchmark formale.)

Gemini 3.6 Flash a confronto con gli altri modelli veloci

Il modello meno caro per token non è necessariamente quello con il miglior rapporto qualità-prezzo. Ecco quindi un confronto diretto nella fascia dei modelli veloci. Tutte le cifre sono prezzi standard, non batch, per 1M token e provengono dalle pagine ufficiali dei rispettivi fornitori.

ModelloInput /1MOutput /1MContesto
Gemini 3.6 Flash$1.50$7.501M
Gemini 3.5 Flash (precedente)$1.50$9.001M
Gemini 3.5 Flash-Lite$0.30$2.501M
Claude Haiku 4.5$1.00$5.00200k
GPT-5.6 Luna$1.00$6.00
DeepSeek V4 Flash$0.14$0.281M

Guardando solo il listino, 3.6 Flash non vince. Claude Haiku 4.5 e GPT-5.6 Luna costano meno sull'output, mentre DeepSeek V4 Flash gioca in tutt'altra categoria di prezzo. Il valore di 3.6 Flash sta nell'intelligenza per dollaro: ottiene 50 nell'Intelligence Index di Artificial Analysis, ben oltre la mediana della fascia fast, a circa 304 token di output al secondo e con una finestra di contesto completa da 1M token. Se servono qualità agentic, coding e di frontiera senza arrivare ai prezzi flagship, questa è la sua proposta. Per il costo assolutamente minimo su task semplici, vincono invece le righe più economiche.

Quanto migliora rispetto a Gemini 3.5 Flash?

Il salto generazionale c'è, ed è più marcato proprio dove la linea Flash era meno convincente: coding a lungo orizzonte e lavoro agentic.

BenchmarkGemini 3.5 FlashGemini 3.6 Flash
DeepSWE v1.137%49%
MLE-Bench49.7%63.9%
OSWorld-Verified (uso del computer)78.4%83.0%
SWE-Bench Pro55.1%58.7%
Terminal-Bench 2.176.2%78.0%
Grafico a barre raggruppate che confronta Gemini 3.6 Flash e 3.5 Flash su DeepSWE, MLE-Bench, OSWorld-Verified, SWE-Bench Pro e Terminal-Bench 2.1, con 3.6 Flash in vantaggio in tutti e cinque

I punteggi provengono dalla pagina del modello Flash di Google DeepMind e da Artificial Analysis. Spiccano in particolare i miglioramenti su DeepSWE e MLE-Bench: rispettivamente 12 e 14 punti. Google riporta inoltre un punteggio di 1421 nel lavoro cognitivo su GDPval-AA, in aumento da 1349. In diversi di questi test, 3.6 Flash supera di poco anche il più grande e costoso 3.1 Pro: un risultato insolito per un modello Flash.

Gemini 3.6 Flash contro Gemini 3.1 Pro

È qui che il confronto diventa sorprendente: nei task agentic e di coding, questo modello della fascia fast supera il più grande e costoso 3.1 Pro di Google. Gemini 3.1 Pro Preview costa $2.00–$4.00 per l'input e $12.00–$18.00 per l'output ogni 1M token, con fasce determinate dalla lunghezza del prompt; 3.6 Flash ha invece un prezzo fisso di $1.50/$7.50.

Gemini 3.6 FlashGemini 3.1 Pro
Input /1M$1.50$2.00–$4.00
Output /1M$7.50$12.00–$18.00
DeepSWE v1.149%12%
SWE-Bench Pro58.7%54.2%
Terminal-Bench 2.178.0%73.8%

3.1 Pro resta il modello più grande e costoso, rivolto ai compiti di ragionamento più difficili e ai workload con contesto lungo. Per la maggior parte dei carichi di coding e agentic, però, 3.6 Flash è ora sia meno costoso sia più performante nei benchmark riportati sopra. Prima di scegliere automaticamente il tier Pro, vale quindi la pena eseguire il confronto. L'analisi completa di Gemini 3.6 Flash vs 3.1 Pro include benchmark diretti, prezzi a fasce e un test di velocità pratico.

Conviene migrare da Gemini 3.5 Flash?

Per la maggior parte dei team che usano già 3.5 Flash, sì. I numeri rendono la scelta quasi sempre migliore:

  • Stesso prezzo di input ($1.50/1M) e output meno caro ($7.50 contro $9.00).
  • Meno token di output per lo stesso task, circa il 17% in meno.
  • Cutoff della conoscenza più recente: marzo 2026 contro gennaio 2025.
  • Punteggi più alti in tutti i benchmark agentic e di coding elencati sopra.

Prima di sostituirlo in produzione, verificate però due aspetti. Il primo è il limite massimo di output di 64k: se dipendevate da singole risposte più lunghe, testate quel confine. Il secondo è la vostra suite di valutazione. L'efficienza nell'uso dei token e i cambiamenti nel ragionamento possono modificare il comportamento su prompt già ottimizzati; misurate quindi latenza e qualità dell'output sul vostro traffico prima di cambiare il modello predefinito.

Flash, Flash-Lite o Cyber: quale scegliere

Tre modelli, tre scenari d'uso:

  • Gemini 3.6 Flash è la scelta predefinita. Usatelo quando cercate qualità agentic, coding e multimodale di livello frontier al prezzo di un modello fast.
  • Gemini 3.5 Flash-Lite ($0.30/$2.50, ~350 token/sec) è adatto a task ad alto volume, sensibili alla latenza e meno complessi: classificazione, estrazione, routing e chat semplici. È il modo meno costoso per eseguire Gemini su larga scala.
  • Gemini 3.5 Flash Cyber è rilevante solo per governi o partner di sicurezza verificati. È un pilota interno a CodeMender, non un modello richiamabile tramite l'API standard.

Come accedere a Gemini 3.6 Flash

Il modello è disponibile nella Gemini API e in Google AI Studio. AI Studio include un tier gratuito per creare prototipi, poi si passa al pay-as-you-go usando l'ID modello gemini-3.6-flash: lo stesso percorso Google AI Studio da gratuito a pagamento valido per il resto della linea Gemini. Sono elencate anche le superfici enterprise Antigravity, Android Studio e Gemini Enterprise Agent Platform. Se vi serve specificamente su Vertex AI, controllate la presenza nel pannello Vertex, poiché al 22 luglio 2026 la disponibilità era ancora in fase di rollout.

Una chiamata REST essenziale alla Gemini API è questa:

curl "https://generativelanguage.googleapis.com/v1beta/models/gemini-3.6-flash:generateContent" \
  -H "x-goog-api-key: $GEMINI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"contents":[{"parts":[{"text":"Summarize agentic AI in one sentence."}]}]}'

I team che utilizzano più provider talvolta instradano i modelli tramite un aggregatore, anziché gestire chiavi separate. Sia OpenRouter sia AIReiter espongono il modello gemini-3.6-flash al prezzo di listino di Google; la differenza sta nei servizi accessibili con la stessa chiave. OpenRouter distribuisce le richieste tra molti provider, mentre AIReiter è compatibile con Anthropic e instrada Gemini insieme a Claude. Può essere utile se state confrontando 3.6 Flash con i prezzi API di Claude in un'unica fattura. Per un deployment con un solo modello, andare direttamente da Google è più semplice.

FAQ

Gemini 3.6 Flash è gratuito?

Google AI Studio offre un tier gratuito per la prototipazione, con limiti di utilizzo. L'uso in produzione segue il modello pay-as-you-go: $1.50 per l'input e $7.50 per l'output ogni 1M token.

Gemini 3.6 Flash è migliore di 3.5 Flash?

Sì. Nei benchmark pubblicati supera 3.5 Flash su DeepSWE, MLE-Bench, OSWorld-Verified, SWE-Bench Pro e Terminal-Bench, costa meno per token di output e usa meno token per task.

Gemini 3.6 Flash è migliore di Gemini 3.1 Pro?

Sui benchmark agentic e di coding come DeepSWE, SWE-Bench Pro e Terminal-Bench, sì, e a un prezzo inferiore ($1.50/$7.50 contro $2.00–$4.00/$12.00–$18.00). Gemini 3.1 Pro è il modello più grande e mantiene un vantaggio nei task più difficili di ragionamento su contesti lunghi e nelle attività multimodali: la scelta giusta dipende quindi dal workload.

Quanto costa Gemini 3.6 Flash?

Nel tier standard costa $1.50 per 1M token di input e $7.50 per 1M token di output. Il context caching costa $0.15 per 1M token.

Qual è il cutoff della conoscenza di Gemini 3.6 Flash?

Marzo 2026, rispetto a gennaio 2025 del precedente Gemini 3.5 Flash.

Gemini 3.6 Flash è disponibile su Vertex AI?

È confermato nella Gemini API e in Google AI Studio, oltre che in diverse superfici enterprise. Al lancio la disponibilità su Vertex AI non era stata confermata esplicitamente: controllate quindi il catalogo modelli di Vertex prima di sviluppare su quella piattaforma.

Che cos'è Gemini 3.5 Flash Cyber?

È una variante focalizzata sulla sicurezza, ottimizzata per rilevare, convalidare e correggere vulnerabilità software. Opera nell'agente CodeMender di Google DeepMind ed è un pilota ad accesso limitato per governi e partner fidati, non un modello pubblico.

Approfondimenti correlati