Dal 30 luglio 2026, GPT-5.6 Luna costa l'80% in meno e Terra il 20% in meno. Il listino standard di Sol non è cambiato. Attenzione però agli agenti multi-turn: il costo delle cache write può assorbire gran parte dello sconto prima ancora che si rifletta in fattura.
Cosa è cambiato il 30 luglio 2026
I nuovi prezzi sono entrati in vigore il 30 luglio 2026 e riguardano gli attuali model ID. OpenAI ha spiegato di aver ridotto le tariffe dei due modelli dopo aver migliorato l'efficienza dei sistemi che li servono; la tariffa standard di GPT-5.6 Sol è invece rimasta invariata.
| Modello | Model ID | Input prima | Input ora | Output prima | Output ora |
|---|---|---|---|---|---|
| GPT-5.6 Luna | gpt-5.6-luna | $1.00 | $0.20 | $6.00 | $1.20 |
| GPT-5.6 Terra | gpt-5.6-terra | $2.50 | $2.00 | $15.00 | $12.00 |
| GPT-5.6 Sol | gpt-5.6-sol | $5.00 | $5.00 | $30.00 | $30.00 |
Prezzi per 1M token, tier standard e contesto breve, secondo la documentazione prezzi dell'API OpenAI (verificata il 2026-07-31).
Dire che «la serie GPT-5.6 costa meno» è vero solo per due modelli su tre. Nello stesso aggiornamento OpenAI ha introdotto per Sol una Fast mode da $10.00 in input e $60.00 in output: costa il doppio del tier standard, offre fino a 2.5× il throughput e non modifica il modello sottostante. La documentazione chiarisce che Fast mode è il nuovo nome di quella che prima veniva chiamata priority processing. In sostanza, mentre i due tier più economici scendevano di prezzo, il flagship acquisiva un'opzione più costosa.
Nel codice va indicato il model ID completo, non il semplice nome della serie. Il catalogo dei modelli di OpenAI definisce gpt-5.6 come alias di gpt-5.6-sol: instradare le richieste con il nome abbreviato sperando nel tier economico significa pagare le tariffe del modello flagship. Gli intermediari potrebbero inoltre non supportare affatto l'alias: sull'endpoint AIReiter, gpt-5.6 restituisce Model 'gpt-5.6' not found (test del 2026-07-31).
Tra gli sviluppatori l'attenzione si è concentrata meno sull'entità del taglio che sulla sua sostenibilità:
Non è possibile che i modelli 5.6 di OpenAI costino davvero così poco da eseguire — titolo di un thread su r/Anthropic
Luna costa meno di GPT-5.4 nano: quale tier scegliere ora
Con $0.20 in input e $1.20 in output, GPT-5.6 Luna costa ora meno per token di output rispetto a gpt-5.4-nano ($0.20 / $1.25) ed è molto più economico di gpt-5.4-mini ($0.75 / $4.50). Se tenevi chiamate nano o mini più vecchie solo per ragioni di prezzo, quel motivo non esiste più.
Per capire se il tier economico regge il confronto, il 2026-07-31 ho eseguito due task su tutti e tre i modelli GPT-5.6 tramite l'endpoint OpenAI-compatible di AIReiter: estrazione da ticket di assistenza a JSON con schema rigoroso e un problema aritmetico di fatturazione token con una sola risposta corretta ($23.71). Due esecuzioni per ciascuno, max_tokens: 4000, nessun retry e valutazione pass/fail rispetto all'output previsto.
| Task | Modello | Token input | Token output | Latenza (run 1 / run 2) | Corretto |
|---|---|---|---|---|---|
| Ticket → JSON | Luna | 135 | 77–78 | 4.0s / 3.5s | Sì |
| Terra | 135 | 46 | 2.1s / 2.1s | Sì | |
| Sol | 135 | 46 | 2.3s / 2.2s | Sì | |
| Calcolo di fatturazione | Luna | 119 | 111–122 | 3.1s / 4.3s | Sì |
| Terra | 119 | 87–89 | 3.8s / 2.8s | Sì | |
| Sol | 4,488 | 84–87 | 3.5s / 3.2s | Sì |
Da questi test emergono due aspetti rilevanti.
Nell'estrazione Luna è stato il più lento dei tre, non il più rapido: 3.5–4.0s contro i 2.1s di Terra. Il tier economico non coincide automaticamente con quello a minore latenza.
Sol ha riportato 4,488 token di input per un prompt che Terra e Luna hanno entrambe conteggiato come 119; 3,840 erano segnalati come cached_tokens. Il risultato si è ripetuto identico in entrambe le esecuzioni. Su un prompt banale ("Reply with only the word OK.") tutti e tre hanno invece riportato 24 token identici: l'inflazione sembra quindi seguire il prompt, non il modello. Posso osservare i conteggi, ma non determinarne la causa. Va considerato un comportamento di fatturazione misurato su un endpoint, non una proprietà documentata del modello.
Applicando le tariffe standard ufficiali, la stessa risposta corretta è costata:
Per 1.000 esecuzioni: Luna $0.16, Terra $1.29, Sol $7.73. Per restituire lo stesso numero di tre cifre, Sol ha fatturato circa 6× Terra e 47× Luna.
Il campione è ridotto — due run su due task semplici — e non è un benchmark né misura la qualità del ragionamento. Supporta però una regola pratica: partire da Luna e salire di tier soltanto davanti a fallimenti misurati sul proprio traffico. In questi test, pagare Sol quando Terra aveva già risposto correttamente non ha portato alcun vantaggio. La ripartizione completa per carico di lavoro è nella tabella finale.
Perché un taglio dell'80% può non ridurre la fattura dell'80%
La tariffa pubblicizzata vale per token di input freschi e token di output. Nel traffico degli agenti multi-turn pesa una terza voce, le cache write: su tutti e tre i tier GPT-5.6, una scrittura in cache costa 12.5× una lettura dalla cache.
| Modello | Input in cache (lettura) | Scrittura cache | Rapporto |
|---|---|---|---|
| GPT-5.6 Luna | $0.02 | $0.25 | 12.5× |
| GPT-5.6 Terra | $0.20 | $2.50 | 12.5× |
| GPT-5.6 Sol | $0.50 | $6.25 | 12.5× |
Un test controllato pubblicato nella community per sviluppatori OpenAI il 2026-07-11 mostra bene l'impatto. In sei turni sequenziali della Responses API concatenati tramite previous_response_id, Luna ha consumato il 3% in meno di token input e il 29% in meno di token output rispetto a gpt-5.4-mini, ma è costato il 96% in più ($0.0651 contro $0.0332 per conversazione). Circa il 70% dell'input di Luna è stato fatturato come cache write. I dati sono precedenti al taglio, ma il meccanismo non è cambiato.
La parte utile è che, in quell'implementazione, la causa era correggibile. La cache di GPT-5.6 non attribuisce valore alle corrispondenze parziali: qualsiasi modifica al prefisso memorizzato impone una riscrittura completa. L'autore ricostruiva a ogni turno una snapshot crescente della conversazione dentro instructions, invalidando così il prefisso.
La diagnosi è netta: istruzioni stabili hanno ottenuto cache hit in 15 turni utente successivi su 15, istruzioni variabili in 0 su 15. Spostando quel contesto in un input item dello sviluppatore, il sovrapprezzo di Luna è sceso dal 96% al 16.7%; nella revisione cieca dell'autore, Luna è poi risultato più veloce e ha ottenuto un punteggio superiore a mini. Né prompt_cache_key né breakpoint espliciti della cache hanno aiutato.
Prima di dare per scontato che lo sconto sia arrivato fino a te, ci sono due verifiche da fare:
- Non mettere dati variabili nel prefisso in cache. Testo di sistema, definizioni degli strumenti e persona devono venire prima e restare byte-identici; lo stato della conversazione va inserito negli input item.
- Controlla i dati restituiti dall'API. Il rapporto tra
usage.prompt_tokens_details.cached_tokenseusage.prompt_tokensindica la quota di letture cache per ogni chiamata. Su un agente di lunga durata, un rapporto basso è il bug di costo con il maggiore impatto in questa serie.
Le tre tariffe GPT-5.6 che circolano online: quale vale per te
Cercando il prezzo di GPT-5.6 Luna compaiono almeno tre valori diversi, e ognuno è o è stato corretto per un determinato tier. Nella maggior parte dei casi, basta capire a quale tier si riferisce una quotazione per risolvere l'apparente contraddizione.
| Dove l'hai visto | Input / output Luna | Che cosa indica |
|---|---|---|
| $0.20 / $1.20 | Tier standard, contesto breve | Il valore predefinito per una normale chiamata API |
| $0.10 / $0.60 | Tier Batch e Flex | Esattamente metà dello standard, per carichi asincroni e a priorità inferiore |
| $0.40 / $2.40 | Fast mode | Il doppio della tariffa standard |
| $1.00 / $6.00 | Tariffa standard precedente al 30 luglio | Corretta fino al taglio |
Ci sono altri due modificatori, entrambi indicati nella stessa documentazione prezzi: il contesto lungo viene fatturato a 2× la tariffa di input per contesto breve e 1.5× quella di output (la riga long context di Luna è $0.40 / $1.80, non $0.40 / $2.40); inoltre, per i modelli rilasciati dal 2026-03-05 in poi — categoria che include tutti i GPT-5.6 — i documenti indicano un supplemento del 10% sugli endpoint idonei alla data residency.
Quando una pagina prezzi non coincide con la fattura, due controlli risolvono il dubbio: individuare la data di verifica riportata nella pagina e confrontarla con la documentazione ufficiale dei prezzi relativa allo specifico tier utilizzato. Anche aggregatori e reseller pubblicano tariffe proprie: è una terza categoria, non necessariamente un dato obsoleto ma semplicemente un prezzo diverso.
Su AIReiter i tre tier GPT-5.6 sono prezzati al 50% del listino OpenAI, e l'adeguamento ha seguito il taglio del 30 luglio: GPT-5.6 Luna costa $0.10 / $0.60, Terra $1.00 / $6.00 e Sol $2.50 / $15.00; lo stesso dimezzamento si applica a input in cache e cache write.
Per un agente Terra che usa ogni giorno 1M di token input e 200K di token output, il costo è quindi $4.40 al giorno a listino contro $2.20: stessa chiamata, stesso model ID.
Il posizionamento di Luna nel mercato più ampio è un'altra questione. Nel confronto del 30 luglio di VentureBeat su 30 modelli, la tariffa combinata di Luna da $1.40 batte Gemini 3.5 Flash-Lite ($2.80) e Gemini 3.1 Flash-Lite ($1.75), ma resta sopra DeepSeek DeepSeek v4-flash ($0.42). Se l'unico criterio è il costo, le API LLM più economiche non sono quelle di OpenAI.
FAQ
È sceso di prezzo anche GPT-5.6 Sol?
No. La tariffa standard di Sol resta $5.00 in input e $30.00 in output per 1M token. Ha acquisito una Fast mode al doppio del prezzo, per un throughput fino a 2.5× superiore.
GPT-5.6 Luna è ora il modello API più economico?
No. Con $1.40 combinati per 1M token è tra i modelli delle serie frontier meno costosi, ma la tabella di VentureBeat del 30 luglio colloca sotto di lui DeepSeek v4-flash ($0.42), MiMo-V2.5 Flash di Xiaomi ($0.40) e DeepSeek v4-pro ($1.305).
Perché alcune pagine indicano $1 / $6 per GPT-5.6 Luna?
Era la tariffa standard prima del 30 luglio 2026. Controlla la data di verifica dichiarata dalla pagina e poi confronta il valore con la documentazione ufficiale per il tier che stai chiamando.
Il taglio si applica anche a Batch e Flex?
Sì. Batch e Flex sono fissati a metà della tariffa standard: Luna costa quindi $0.10 / $0.60 e Terra $1.00 / $6.00 su questi tier, incluse le tariffe di input in cache e cache write.
Devo modificare il codice per ottenere il nuovo prezzo?
No. Il taglio si applica agli attuali model ID gpt-5.6-luna e gpt-5.6-terra, senza migrazione. L'unica modifica che vale davvero la pena fare è verificare il rapporto di cache read, il punto in cui più spesso si perde lo sconto.
Il tier giusto per ogni carico di lavoro
| Carico di lavoro | Tier | Motivazione |
|---|---|---|
| Estrazione, tagging e sintesi ad alto volume | Luna | Ha superato entrambi i task di test; $1.40 combinati per 1M, ora sotto gpt-5.4-nano |
| Chiamate rivolte agli utenti sensibili alla latenza | Terra | Nell'estrazione è stato più rapido di Luna (2.1s contro 3.5–4.0s) |
| Primo passaggio quando Luna non raggiunge la qualità richiesta | Terra | $14 combinati contro i $35 di Sol |
| Task in cui Terra rende misurabilmente peggio sul tuo traffico | Sol | Unica giustificazione per un costo per task misurato pari a 6× Terra |
| Agenti multi-turn su qualsiasi tier | Correggi prima il caching | Le cache write costano 12.5× le read; un prefisso sbagliato pesa più della scelta del tier |