AIREITER

Prezzi API Gemini 3.8 Flash: costo per task agente completato

Ultimo Aggiornamento: 2026-09-15 19:14:52

Un agente basato su Gemini 3.8 Flash può sembrare conveniente, con un prezzo di $0.75 per milione di token in input. Ma è una tariffa introduttiva: Google indica prezzi standard doppi a partire dal 1° gennaio 2027 e, tra token di reasoning e retry, il costo di ogni task accettato può salire sensibilmente. Per pianificare il budget conta la tariffa di gennaio e il tasso di successo, non il prezzo token oggi in evidenza.

Il dato che conta per chi sviluppa agenti

Il parametro utile non è il costo della singola chiamata API, ma il costo per task completato con successo: tutta la spesa per modello e strumenti divisa per le esecuzioni che superano il test di accettazione.

Gemini 3.8 Flash è più facile da giustificare nei lavori complessi e composti da più passaggi, quando un reasoning aggiuntivo riduce i retry o aumenta i risultati accettati. Non è invece la scelta predefinita ideale per ogni flusso di estrazione a formato fisso o classificazione semplice.

“se scegli flash per i loop degli agenti, calcola la fattura di gennaio, non la pagina API di oggi.” — Vraj (@vraj_ai), 3 settembre 2026

Tariffe API Gemini 3.8 Flash dal 1° gennaio 2027

La documentazione sui prezzi dell'API Gemini di Google e la documentazione del modello riportano tariffe introduttive fino al 31 dicembre 2026. Le tariffe standard entrano in vigore il 1° gennaio 2027.

Modalità di fatturazioneInput fino al 31 dic. 2026Output fino al 31 dic. 2026Input dal 1° gen. 2027Output dal 1° gen. 2027
Standard$0.75 / 1M$3.75 / 1M$1.50 / 1M$7.50 / 1M
Batch$0.375 / 1M$1.875 / 1M$0.75 / 1M$3.75 / 1M
Flex$0.375 / 1M$1.875 / 1M$0.75 / 1M$3.75 / 1M
Priority$1.35 / 1M$6.75 / 1M$2.70 / 1M$13.50 / 1M
Input in cache$0.075 / 1M$0.15 / 1M

Si tratta di tariffe per token, non del costo completo di un agente. Grounding documentato, archiviazione della cache, strumenti esterni, hosting e commissioni del provider possono aggiungere altre voci. La fatturazione dell'output include i token di thinking, non soltanto la risposta visibile.

Batch è la leva più utile per contenere il budget nei carichi di lavoro che tollerano un ritardo. Dopo il cambiamento, il prezzo Batch sarà pari all'attuale tariffa Standard, purché il carico sia idoneo e l'interfaccia API applichi davvero la tariffa Batch.

La formula del costo per task completato

Meglio ragionare su quattro livelli, anziché limitarsi a moltiplicare i token:

  1. Costo del modello per tentativo = (token input × tariffa input) + (token output × tariffa output).
  2. Costo del tentativo = costo del modello più spese per strumenti, grounding, storage e infrastruttura.
  3. Costo atteso per task completato = costo del tentativo ÷ probabilità di successo.
  4. Costo osservato per task completato = spesa totale ÷ task accettati.

In un loop agente vanno conteggiati tutti i turni del modello e tutti i retry. Se un'esecuzione effettua tre chiamate prima di restituire una risposta, input e output corrispondono alla somma delle tre chiamate. I token di thinking rientrano nell'utilizzo in output; nelle risposte Gemini Google espone campi di utilizzo come promptTokenCount, thoughtsTokenCount e candidatesTokenCount.

Esempio pratico: 20.000 token in input e 5.000 in output

Supponiamo che un tentativo completo utilizzi 20.000 token in input e 5.000 token in output. In questo esempio escludiamo i costi degli strumenti.

PeriodoCalcoloCosto per tentativoCon successo al 70%, costo per task completato
Fino al 31 dic. 20260.02 × $0.75 + 0.005 × $3.75$0.03375$0.0482
Dal 1° gen. 20270.02 × $1.50 + 0.005 × $7.50$0.06750$0.0964

A parità di utilizzo token e probabilità di successo, il cambio tariffario raddoppia il costo. Se l'agente ritenta dopo alcuni fallimenti, la media reale supera questa stima semplificata, perché anche i tentativi falliti consumano token.

Il denominatore è decisivo. Un agente che costa $0.05 per chiamata ma riesce solo nella metà dei casi costa $0.10 per task accettato, prima dei costi degli strumenti; una chiamata da $0.08 con un successo del 90% costa circa $0.0889 per task accettato.

Tre scenari di budget che cambiano la scelta

Estrazione con struttura fissa

Un flusso da PDF a JSON con schema stabile ha di norma un test di accettazione chiaro: i campi richiesti sono presenti, i tipi sono validi e non compare testo aggiuntivo. Si può partire dal thinking low e verificare se il task passa. Pagare un effort high quando la validazione è già superata aumenta il costo senza migliorare il denominatore.

La documentazione del modello Google descrive i livelli di thinking low, medium e high per Gemini 3.8 Flash; minimal non è supportato. Il livello di thinking va trattato come impostazione di costo del singolo route, non come impostazione predefinita per l'intera applicazione.

Lavoro agente su contesti lunghi

Un agente per coding o ricerca può riproporre un grande contesto per diversi turni, per poi generare ulteriore reasoning e chiamate agli strumenti. In questi casi input in cache, meno retry e un tasso di successo più alto possono contare più della tariffa nominale dell'output.

Per un task di lunga durata, registra separatamente la ripetizione del contesto e il nuovo input. Una finestra di contesto da 1 milione di token non rende gratuiti quei token. Se il route è interattivo, Standard o Priority possono essere adeguati; se può elaborare durante la notte, confronta Batch o Flex con i requisiti temporali.

Automazioni con molti retry

Supponiamo che un route costi $0.0675 per tentativo dopo il 1° gennaio e abbia un successo del 70%. Ipotizzando retry indipendenti e nessun limite ai retry, il numero atteso di tentativi per successo è circa 1 ÷ 0.70 = 1.43, ovvero all'incirca $0.0964 di costo del modello per task accettato.

Se i fallimenti attivano costose azioni browser, chiamate di ricerca o revisione umana, tali costi vanno aggiunti al numeratore. Un agente può essere economico in token ma costoso da gestire operativamente.

Quando Gemini 3.8 Flash giustifica ancora il sovrapprezzo

Gemini 3.8 Flash ha senso quando il reasoning aggiuntivo cambia il risultato: meno patch rifiutate, meno sequenze di strumenti fallite, verifiche migliori sui processi multi-step o un tasso di accettazione superiore nei task difficili. Mantieni un route più economico per trasformazioni ripetitive, routing, estrazione e altri lavori i cui test di accettazione passano già con effort basso.

I dati indipendenti pubblicati da Artificial Analysis e riassunti da Apidog stimano Gemini 3.8 Flash a circa $0.58 per task di benchmark in una configurazione high-thinking, contro circa $0.40 per Gemini 3.7 Flash, con un Intelligence Index di 59 contro 56. Sono valori specifici del benchmark, non una previsione universale della fattura: usali come indicazione del fatto che il consumo di token può cambiare l'economia, non come preventivo per il tuo carico di lavoro.

Anche i resoconti della community vanno nella stessa direzione. Jan (@jan_volad) ha segnalato circa 120 milioni di token in output per un confronto con Gemini 3.8 Flash, contro 29–35 milioni dei concorrenti, e ha indicato un costo combinato per task di $0.58; è un'osservazione utente, non una fattura di produzione verificata in modo indipendente. Il post è utile perché mostra perché una tariffa bassa per milione di token possa sovrastimare il risparmio.

Una regola pratica di routing è questa:

  • Task agente difficile: prova Gemini 3.8 Flash con medium o high e misura il costo per task accettato.
  • Task di routine: prova prima low; mantieni il route solo se supera il controllo qualità.
  • Lavoro in massa non urgente: confronta Batch e Standard dopo il 1° gennaio.
  • Qualsiasi route con qualità incerta: non ottimizzare la tariffa token prima di aver misurato la probabilità di successo.

FAQ sui prezzi di Gemini 3.8 Flash

Batch costa sempre meno?

Batch costa meno nel listino pubblicato, ma è progettato per carichi di lavoro che possono tollerare un'elaborazione differita. Non sostituisce automaticamente un agente interattivo che deve rispondere subito.

Come calcolo il costo per task agente completato con successo?

Somma le spese per modello, strumenti, grounding e infrastruttura nell'intervallo considerato, quindi dividi per le esecuzioni che superano il test di accettazione. Per una previsione, dividi il costo atteso per tentativo per la probabilità di successo stimata e includi i retry attesi.

La scelta pratica: pianifica il route, non il modello

Registra per ogni route input, thinking, output visibile, turni degli strumenti, retry, latenza, spesa e stato di accettazione. Prova i livelli di thinking rilevanti, poi proietta sia il listino di dicembre sia quello di gennaio.

La decisione è semplice: usa Gemini 3.8 Flash dove il reasoning aggiuntivo produce risultati completati con successo, usa effort inferiori per i lavori che già passano e sposta su Batch i job in massa idonei. Il cambio tariffario di gennaio 2027 è al momento programmato nella tabella pubblicata; la convenienza del modello dipende dai token e dai fallimenti che si nascondono dietro ogni risultato completato con successo.