Il prezzo di riferimento non è solo quello, spesso citato, di 10 $ per milione di token in input e 50 $ per milione di token in output. Le richieste oltre 272.000 token in input passano a una tariffa maggiorata sull’intera richiesta. Inoltre, l’accesso a GPT-6 Astra è ancora in fase di distribuzione: la presenza del modello nella documentazione non significa automaticamente che l’account possa utilizzarlo.
Prezzi API di GPT-6 Astra in sintesi
La tabella seguente riporta il listino della pagina ufficiale del modello di OpenAI. Prompt in cache, richieste con contesto esteso e modalità Fast possono cambiare sensibilmente il costo effettivo.
| Voce | Dettaglio attuale |
|---|---|
| ID del modello API | gpt-6-astra |
| Input standard | 10,00 $ / 1M token |
| Input in cache | 1,00 $ / 1M token |
| Scrittura della cache | 12,50 $ / 1M token |
| Output standard | 50,00 $ / 1M token |
| Finestra di contesto | 1.050.000 token |
| Output massimo | 128.000 token |
| Knowledge cutoff | 30 aprile 2026 |
| Input/output | Input testuale e immagini; output testuale |
| Piano API gratuito | Non supportato |
| Disponibilità attuale | Distribuzione progressiva alle aziende del Trusted Access; l’accesso API più ampio e quello incluso nei piani a pagamento sono indicati come in arrivo nei prossimi giorni |
Questi dati provengono dalla pagina del modello GPT-6 Astra e non da una stima pre-release. Le indicazioni sul modello di OpenAI specificano che il tool calling richiede la Responses API.
Tre regole che possono cambiare il conto
GPT-6 Astra prevede quattro categorie di token, oltre a regole specifiche per le modalità di servizio. Considerarlo semplicemente come un endpoint da 10 $ in / 50 $ out porta a sottostimare il costo della creazione della cache, dei prompt lunghi e dell’elaborazione a bassa latenza.
Input standard, input in cache e scritture della cache
L’input standard costa 10 $ per milione, quello in cache 1 $ per milione, mentre le scritture della cache costano 12,50 $ per milione. Dopo la prima scrittura, il riutilizzo può quindi essere molto economico.
| Categoria di token | Tariffa standard | Cosa rappresenta |
|---|---|---|
| Input non in cache | 10,00 $ / 1M | Nuovo input elaborato dal modello |
| Input in cache | 1,00 $ / 1M | Input già elaborato e recuperato dalla cache |
| Scrittura della cache | 12,50 $ / 1M | Input aggiunto alla prompt cache |
| Output | 50,00 $ / 1M | Token generati nella risposta |
La finestra di contesto non va moltiplicata per la tariffa dell’input. Una finestra da 1,05 milioni di token indica la capacità massima, non garantisce che tutti i token vengano fatturati alla tariffa base.
La soglia di 272K token vale per l’intera richiesta
Quando una richiesta contiene più di 272.000 token in input, OpenAI applica all’intera richiesta tariffe raddoppiate per input e cache e tariffe di output pari a 1,5 volte quelle standard. La fascia per il contesto esteso diventa quindi di 20 $ per milione di token in input non in cache, 2 $ per milione di token in cache, 25 $ per milione per le scritture della cache e 75 $ per milione di token in output.
| Fascia della richiesta | Input | Input in cache | Scrittura cache | Output |
|---|---|---|---|---|
| Fino a 272K token in input | 10 $ | 1 $ | 12,50 $ | 50 $ |
| Oltre 272K token in input | 20 $ | 2 $ | 25 $ | 75 $ |
Con una richiesta da 300K token in input, tutti i token applicabili — input, cache e output — vengono fatturati secondo le tariffe maggiorate del contesto esteso: i primi 272K non restano nella fascia standard.
Batch, Flex, Fast e scelta della regione di distribuzione
OpenAI applica a Batch e Flex il 50% delle tariffe applicabili. Le sue indicazioni sul modello specificano che la modalità Fast costa il doppio delle tariffe applicabili, non offre SLA sulla latenza e non è disponibile con la residenza dei dati nell’UE. Anche l’elaborazione Priority non è disponibile con la residenza dei dati nell’UE.
| Modalità | Input standard | Output standard | Come interpretarla |
|---|---|---|---|
| Standard | 10 $ / 1M | 50 $ / 1M | Modalità predefinita per l’API diretta |
| Batch o Flex | 5 $ / 1M | 25 $ / 1M | Metà della tariffa Standard applicabile |
| Fast | 20 $ / 1M | 100 $ / 1M | Il doppio della tariffa Standard applicabile |
| Standard con contesto esteso | 20 $ / 1M | 75 $ / 1M | Si applica oltre 272K token in input |
| Fast con contesto esteso | 40 $ / 1M | 150 $ / 1M | Il doppio delle tariffe per il contesto esteso |
La tabella mostra solo input non in cache e output. Anche le tariffe per la lettura e la scrittura della cache seguono il moltiplicatore previsto dalla modalità di servizio applicabile.
Microsoft Foundry pubblica una tabella di distribuzione separata. Il suo annuncio di GPT-6 Astra indica per la modalità Global Standard con contesto breve 10 $ per l’input, 1 $ per l’input in cache, 12,50 $ per le scritture della cache e 50 $ per l’output. U.S. Data Zone Standard applica 11 $, 1,10 $, 13,75 $ e 55 $. Nella tabella per il contesto esteso compaiono 20 $/2 $/25 $/75 $ per Global e 22 $/2,20 $/27,50 $/82,50 $ per U.S. Data Zone. Non trasferire quindi il listino diretto di OpenAI a un budget Azure.
Quanto costa davvero una richiesta ad Astra
Gli esempi utilizzano i prezzi diretti OpenAI in modalità Standard, escludono strumenti e retry e classificano i token come non in cache o in cache esattamente come indicato.
| Esempio di richiesta | Calcolo | Costo stimato dei token |
|---|---|---|
| 100K input non in cache + 10K output | 0.1 × $10 + 0.01 × $50 | 1,50 $ |
| 200K input in cache + 20K output | 0.2 × $1 + 0.02 × $50 | 1,20 $ |
| 300K input non in cache + 30K output | 0.3 × $20 + 0.03 × $75 | 8,25 $ |
Verifica il limite dei 272K token prima di adottare flussi di lavoro con contesto esteso: retrieval e compattazione possono ridurre il costo del modello, ma aggiungono lavoro a livello applicativo.
Scrivere 200K token costa 2,50 $, mentre una successiva lettura dalla cache degli stessi 200K token costa 0,20 $; la convenienza dipende dalla frequenza di riutilizzo.
Su Microsoft Foundry, una richiesta con 100K token in input e 10K in output nella tabella Global per il contesto breve costa anch’essa 1,50 $, prima di strumenti e retry. La variante U.S. Data Zone costa 1,65 $: 0.1 × $11 + 0.01 × $55.
La guida di OpenAI afferma che Astra può offrire un costo stimato più basso per attività completata rispetto ai modelli precedenti, ma non si tratta di un benchmark indipendente dei costi in produzione. Misura nei tuoi trace input, hit della cache, token di output, chiamate agli strumenti, retry e correzioni umane.
Accesso, quote e differenza tra ChatGPT e API
GPT-6 Astra viene distribuito alle aziende del Trusted Access Program; l’accesso via API e quello per i piani Plus, Pro, Business ed Enterprise arriveranno nei prossimi giorni. Anche la documentazione del provider OpenAI di OpenClaw chiarisce che è la disponibilità del modello nel catalogo dell’account a determinare l’accesso ad Astra: aggiungere il nome del modello alla configurazione non concede alcun permesso.
Un utente ha descritto così il ritardo nella distribuzione:
“It’s almost 2 AM and I’m going to bed pissed off. I waited ALL DAY for Astra. ... And then I find out: I CAN’T EVEN USE IT.” — @buildwithrajath, X
La pagina del modello indica questi limiti API in base al livello di utilizzo:
| Livello | RPM | TPM | Limite coda Batch |
|---|---|---|---|
| Free | Non supportato | Non supportato | Non supportato |
| Tier 1 | 500 | 500.000 | 1.500.000 |
| Tier 2 | 5.000 | 1.000.000 | 3.000.000 |
| Tier 3 | 5.000 | 2.000.000 | 100.000.000 |
| Tier 4 | 10.000 | 4.000.000 | 200.000.000 |
| Tier 5 | 15.000 | 40.000.000 | 15.000.000.000 |
Il listino di Astra riguarda esclusivamente le API. La documentazione citata non indica crediti API inclusi nei piani ChatGPT: considera quindi separatamente i costi di utilizzo della Platform API.
Verifiche per migrare gli agenti esistenti
Le indicazioni sul modello di OpenAI richiedono tre controlli in fase di migrazione:
- Modello e API: imposta
modelsugpt-6-astra, verifica che il catalogo dell’account lo renda disponibile e usa la Responses API per il tool calling. - Parametri della richiesta: scegli
low,medium,high,xhighoppuremax; Astra non supportanone. Rimuovi i parametri non supportati per il campionamento e i log-probability. - Cache e regione: quando segui le indicazioni di migrazione di OpenAI per i modelli precedenti, sostituisci
prompt_cache_retentionconprompt_cache_options.ttl: "30m"; poi ricontrolla le impostazioni Fast e Priority in presenza della residenza dei dati nell’UE.
Come decidere il budget: instrada le richieste in base ai trace, non al prezzo dei token
GPT-6 Astra è più facile da giustificare quando l’attività è lunga, richiede molti strumenti, ha un costo elevato in caso di errore oppure coinvolge software che non espone un’API pulita. Non è invece la scelta predefinita ideale per prompt brevi e ordinari, soprattutto quando i 50 $ per milione di token in output non si traducono in meno retry o in un lavoro completato meglio.
- Prova Astra per primo nella ricerca con contesto esteso, nell’uso del computer, nel coding complesso e nei flussi di lavoro tra più applicazioni, dove gli errori generano costi di revisione o rilavorazione.
- Mantieni un modello più economico come predefinito per classificazione breve, estrazione, stesura semplice e trasformazioni prevedibili.
- Usa Batch o Flex quando la latenza non è importante e il carico di lavoro è compatibile con una tariffa dimezzata.
- Non scegliere Fast come impostazione predefinita. Con 20 $ per l’input e 100 $ per l’output ogni milione di token, prima di qualsiasi moltiplicatore per il contesto esteso, deve offrire un vantaggio misurabile in termini di throughput.
- Imposta un limite rigido a 272K. Genera un avviso prima che una richiesta superi la soglia, perché il sovrapprezzo si applica all’intera richiesta.
Valuta il costo per attività accettata a partire dai tuoi trace, non dal solo prezzo dei token. Per il budget di attività correlate, confronta le ipotesi della guida ai prezzi di GPT-5.6 e della guida ai prezzi di OpenRouter, senza trasferire automaticamente ad Astra le regole dei rispettivi listini.
FAQ sui prezzi API di GPT-6 Astra
Quanto costa GPT-6 Astra per 1M di token?
La tariffa standard è di 10 $ per milione di token in input non in cache, 1 $ per milione di token in cache, 12,50 $ per milione per le scritture della cache e 50 $ per milione di token in output.
Cosa succede oltre 272K token in input?
Le tariffe per input e cache raddoppiano, mentre l’output aumenta del 50%: per l’intera richiesta si applicano 20 $ per l’input, 2 $ per l’input in cache, 25 $ per le scritture della cache e 75 $ per l’output ogni milione di token.
L’input in cache è la stessa cosa di una scrittura della cache?
No. L’input in cache è un hit della cache e costa 1 $ per milione nella fascia Standard; una scrittura crea o aggiorna il prefisso memorizzato nella cache e costa 12,50 $ per milione.
Batch o Flex dimezzano il prezzo di GPT-6 Astra?
OpenAI indica per Batch e Flex il 50% delle tariffe Standard applicabili, compresa la tariffa per il contesto esteso quando viene superata la soglia prevista.
La modalità Fast vale il costo aggiuntivo?
La modalità Fast costa il doppio delle tariffe applicabili e non offre SLA sulla latenza. Usala solo quando i tuoi trace mostrano un miglioramento sufficiente del throughput o del valore per l’utente da compensare il sovrapprezzo.
Posso usare GPT-6 Astra tramite API oggi?
L’accesso è in fase di distribuzione e non ancora aperto universalmente. OpenAI indica una disponibilità iniziale per le aziende del Trusted Access e afferma che l’accesso API più ampio arriverà nei prossimi giorni: il catalogo dell’account resta quindi la verifica decisiva.
ChatGPT Plus include crediti API per GPT-6 Astra?
La documentazione del modello non promette crediti API inclusi in un piano ChatGPT. Considera separati l’accesso al modello tramite un piano a pagamento e la fatturazione a consumo della Platform API, finché i termini di fatturazione espliciti del tuo account non stabiliscono diversamente.
Quali modifiche API sono necessarie per GPT-6 Astra?
Imposta model su gpt-6-astra, usa la Responses API per il tool calling, seleziona un livello di ragionamento supportato, rimuovi i parametri non supportati per il campionamento e i log-probability e verifica le regole relative al TTL della cache e alla modalità Fast in base alla regione. Prima di rendere Astra il modello predefinito, registra token, comportamento della cache, strumenti, retry e correzioni umane in un’esecuzione rappresentativa.