Google ha annunciato Gemini 4 Argon, ma un annuncio non equivale a un’API già pronta da chiamare. Al 1° ottobre 2026, Google dichiara che Argon è in distribuzione inizialmente presso difensori cyber di fiducia; seguiranno i clienti API a pagamento e gli abbonati Google AI Ultra, senza però una data per la disponibilità generale. Oggi la scelta più sensata è metterlo a budget e preparare una valutazione, non inserire nel codice un model ID ipotetico.
Gemini 4 Argon è stato annunciato, ma l’API non è ancora accessibile liberamente
Gemini 4 Argon esiste ed è stato annunciato ufficialmente da Google DeepMind il 30 settembre 2026. Per ora lo stato è quello di un accesso limitato, non di un rilascio generale. Nell’annuncio, Google spiega che il primo gruppo esterno sarà composto dai difensori cyber di fiducia del Fairwind Program; sviluppatori, aziende e consumatori seguiranno “as soon as possible”.
La pubblicazione dei prezzi non significa che Argon sia già abilitato sul proprio account API: non distribuite quindi applicazioni basate su un endpoint o un model ID presunti.
Cosa ha effettivamente aperto Google il 30 settembre
Il rollout di Google ha quattro confini pratici:
| Gruppo di accesso | Stato al 1° ottobre 2026 | Cosa significa |
|---|---|---|
| Difensori cyber di fiducia Fairwind | In distribuzione | Accesso esterno iniziale, con una versione pensata per il lavoro di cybersecurity difensiva |
| Team interni di Google | Già utilizzato internamente | Dimostra l’uso interno, non dà diritto a utilizzare un’API pubblica |
| Clienti Gemini API a pagamento e abbonati AI Ultra | Prossimo gruppo, senza data | Google ha detto “as soon as possible”, ma non ha indicato una data di calendario |
| Sviluppatori, aziende e consumatori in generale | Non datato | Non ci sono basi per pianificare un lancio in produzione attorno ad Argon |
Nessuna di queste informazioni fornisce un model ID pubblico stabile, un piano di limiti di richieste o una data garantita per il lancio su Google AI Studio o Vertex AI.
L’annuncio ufficiale di Gemini 4 Argon è la fonte di riferimento per le informazioni sul rollout. Per un listino pubblico effettivamente utilizzabile, va invece consultata la documentazione aggiornata sui prezzi delle Gemini API; al momento della verifica, Argon non era presente nell’elenco.
Prezzi delle API di Gemini 4 Argon prima della disponibilità
Google ha annunciato prezzi introduttivi per 1 milione di token. Al termine del periodo introduttivo, la cui data di fine non è stata pubblicata, le tariffe raddoppieranno.
| Voce di fatturazione | Prezzo introduttivo | Prezzo successivo |
|---|---|---|
| Token di input | 2,00 $ / 1M | 4,00 $ / 1M |
| Input memorizzato nella cache | 0,10 $ / 1M, indicato come sconto del 95% | Non dichiarato |
| Token di output | 10,00 $ / 1M | 20,00 $ / 1M |
Per una semplice chiamata ad agente con 200.000 token di input, di cui 150.000 memorizzati nella cache e 50.000 non memorizzati, più 40.000 token di output, la stima introduttiva è di 0,515 $:
- 50.000 token di input non memorizzati nella cache costano 0,10 $.
- 150.000 token di input in cache costano 0,015 $.
- 40.000 token di output costano 0,40 $.
- Totale: 0,515 $, prima di eventuali altri costi del provider o della piattaforma.
Con le tariffe successive pubblicate per input e output, la parte relativa all’input non memorizzato e all’output sarebbe di 1,00 $; il totale resta però sconosciuto, perché Google non ha indicato il prezzo futuro dell’input in cache. L’output è la voce che pesa di più sul conto: 1 milione di token costerebbe 10 $ con la tariffa introduttiva oppure 20 $ in seguito, senza includere l’input. Si tratta quindi di un tetto di budget, non di un’impostazione predefinita sensata.
Non costruite il budget usando soltanto il prezzo introduttivo. Una funzionalità che regge a 2/10 $ ma diventa insostenibile a 4/20 $ non è pronta per la produzione. Restano da chiarire limiti di richieste, disponibilità regionale, condizioni per l’elaborazione batch, comportamento definitivo della cache e data di fine del periodo introduttivo.
Cosa dimostrano — e cosa non dimostrano — i dati pubblicati su Argon
Google presenta Argon come un modello destinato all’ingegneria del software su orizzonti lunghi, al lavoro con la conoscenza aziendale, alla comprensione di video lunghi e alla cybersecurity difensiva. Nei materiali di lancio riporta questi risultati:
| Valutazione | Risultato riportato | Limiti dell’evidenza |
|---|---|---|
| DeepSWE v1.1 | 77,9% | Risultato di software engineering riportato da Google |
| AutomationBench | 51,3% | Risultato end-to-end su funzioni aziendali riportato da Google |
| LVBench | 91,7% | Risultato sui video lunghi riportato da Google |
| CWE-bench v1 | 68% | Risultato sulla correzione delle vulnerabilità riportato da Google |
Artificial Analysis ha riportato un primo punteggio di 53 sull’Intelligence Index per la sua versione ad alto ragionamento e ha indicato come non disponibili i dati sulla velocità. È un elemento di contesto, non una garanzia sulla latenza. I benchmark di Google giustificano test mirati sui singoli carichi di lavoro, ma non autorizzano a dare per scontata una superiorità in ogni attività.
Il limite di 1 milione di token in output cambia l’architettura
Google afferma che Argon può generare fino a 1 milione di token di output, contro i 64.000 dei precedenti modelli Gemini. Questo potrebbe ridurre la necessità di dividere una migrazione complessa o un report in numerose risposte da ricomporre. Allo stesso tempo introduce tre rischi operativi.
Primo: una risposta molto lunga può fallire quando il lavoro è quasi terminato. Trasmettete l’output in streaming e salvate checkpoint del lavoro parziale, così una connessione interrotta non trasforma un’attività quasi completata in una fattura senza risultato utilizzabile. Secondo: più output significa più lavoro di revisione. Anche una migrazione di codice estesa richiede test, analisi delle differenze e punti di rollback. Terzo: la latenza cresce insieme alla lunghezza dell’output, rendendo le generazioni molto lunghe poco adatte a un’interfaccia interattiva.
Impostate un limite esplicito all’output per ogni chiamata. Usate un valore contenuto per estrazione e chat, uno più ampio per modifiche di codice circoscritte e un budget definito caso per caso per report o migrazioni. Il limite di 1M è utile quando il compito ne ha davvero bisogno; non è un buon motivo per lasciare ogni agente senza vincoli.
Un piano di migrazione sicuro per gli sviluppatori
Potete prepararvi senza fingere che Argon sia già disponibile.
- Inserite il nome del modello in
GEMINI_MODEL, non nella logica dell’applicazione. - Tenete
GEMINI_API_KEYfuori dal controllo versione. - Costruite 20–50 attività rappresentative a partire dal vostro repository, dai documenti o dalle tracce degli agenti.
- Registrate token, latenza, tentativi, errori degli strumenti, risultati accettati, tempo di correzione manuale e costo fatturato.
- Quando l’accesso sarà disponibile, controllate l’elenco dei modelli dell’account usando la documentazione di riferimento della Models API; non indovinate
gemini-4-argon. - Ripetete lo stesso set di test sul modello attualmente utilizzato in produzione prima di spostare il traffico.
Una chiamata Python minimale può rimanere indipendente dal modello, seguendo la documentazione di riferimento dell’SDK Python per le Gemini API di Google:
import os
from google import genai
from google.genai import types
client = genai.Client()
model = os.environ["GEMINI_MODEL"]
response = client.models.generate_content(
model=model,
contents="Review this bounded code change and list concrete risks.",
config=types.GenerateContentConfig(max_output_tokens=32000),
)
print(response.text)
Questo esempio non afferma che oggi funzioni GEMINI_MODEL=gemini-4-argon. Quando Google pubblicherà l’ID ufficiale, verificate che la risposta dell’elenco modelli e la documentazione API siano coerenti prima di modificare una distribuzione.
Chi dovrebbe aspettare e chi dovrebbe prepararsi subito
| Carico di lavoro | Decisione di oggi | Motivo |
|---|---|---|
| Refactoring estesi e agenti di coding con contesto lungo | Preparate una valutazione | Il limite di output e il risultato DeepSWE puntano proprio a questo tipo di attività |
| Analisi legale o finanziaria di più documenti | Preparate una valutazione | Il lavoro con la conoscenza aziendale e il ragionamento prolungato fanno parte del posizionamento di lancio |
| Supporto breve, estrazione o classificazione | Restate su un modello più economico e già validato | Il costo e la latenza da modello di punta di Argon difficilmente sarebbero giustificati |
| Ricerca difensiva sulle vulnerabilità | Fate richiesta attraverso il percorso Fairwind documentato, se avete i requisiti | L’accesso iniziale è limitato e specifico per il settore cyber |
| Lancio di un prodotto che dipende da un modello disponibile questo mese | Non fate affidamento su Argon | Non esistono ancora un model ID pubblico o una data di disponibilità generale |
La raccomandazione pratica è usare il routing, non sostituire tutto automaticamente: mantenete un modello rapido per le richieste ordinarie e riservate Argon ai lavori lunghi e complessi, dopo aver superato i vostri test di accettazione.
FAQ su Gemini 4 Argon
Gemini 4 Argon è disponibile per tutti?
No. Google lo sta distribuendo inizialmente ai difensori cyber di fiducia attraverso Fairwind. I clienti API a pagamento e gli abbonati Google AI Ultra sono indicati come gruppi successivi, ma non è stata annunciata una data pubblica per la disponibilità generale.
Qual è il model ID delle API di Gemini 4 Argon?
Nei materiali di lancio verificati il 1° ottobre 2026, Google non aveva pubblicato un model ID pubblico stabile. Interrogate i modelli disponibili con le vostre credenziali invece di presumere che gemini-4-argon sia valido.
Quanto costa Gemini 4 Argon?
Il prezzo introduttivo è di 2 $ per milione di token di input e 10 $ per milione di token di output. Google ha indicato tariffe successive di 4 $ e 20 $; l’input in cache è riportato con uno sconto del 95% rispetto al prezzo introduttivo dell’input.
La cifra di 1 milione di token indica la finestra di contesto?
Google la descrive esplicitamente come un limite per i token di output. Non date per scontata una finestra di contesto da 1 milione di token finché la documentazione API di Google non avrà specificato il limite di input.
Devo sostituire subito Gemini 3.8 Flash?
No. Mantenete il modello di riferimento già validato, bloccate un set di test rappresentativo e passate ad Argon solo quando sarà disponibile sul vostro account, il model ID ufficiale sarà documentato e le stesse attività supereranno i test con costi e tempi di correzione accettabili.