AIREITER

Immagine IA

FLUX.2 ProGPT-Image 2Wan 2.7 Image ProGPT 4o ImageSeedream 5.0 ProSeedream V5 liteSeedream V4.5Altro

Video IA

Kling 3.0 Motion ControlSora 2 ProKling 3.0 TurboSora 2Kling 3.0Grok Imagine 1.5Veo 3.1Altro

LLM

Gemini 3.6 FlashGemini 3.1 ProKimi K3Gemini 3 ProGemini 2.5 ProClaude Opus 5Claude Fable 5Altro
ProssimamenteSeedance 2.5
Super ResolutionLyric Video GeneratorGPT Image 2 1K GeneratorGPT Image 2 Product Mockup GeneratorUse GPT-5.6 Online
DOC APIPREZZI
BlogAggiornamentiLLM API GuideClaude API GuideKimi K3 API Guide
TEMPLATE
  • AIReiter
  • Blog
  • Taglio dei prezzi di GPT-5.6: quanto costano davvero Luna e Terra

Taglio dei prezzi di GPT-5.6: quanto costano davvero Luna e Terra

Ultimo Aggiornamento: 2026-07-31 10:58:57

Dal 30 luglio 2026, GPT-5.6 Luna costa l'80% in meno e Terra il 20% in meno. Il listino standard di Sol non è cambiato. Attenzione però agli agenti multi-turn: il costo delle cache write può assorbire gran parte dello sconto prima ancora che si rifletta in fattura.

Cosa è cambiato il 30 luglio 2026

I nuovi prezzi sono entrati in vigore il 30 luglio 2026 e riguardano gli attuali model ID. OpenAI ha spiegato di aver ridotto le tariffe dei due modelli dopo aver migliorato l'efficienza dei sistemi che li servono; la tariffa standard di GPT-5.6 Sol è invece rimasta invariata.

ModelloModel IDInput primaInput oraOutput primaOutput ora
GPT-5.6 Lunagpt-5.6-luna$1.00$0.20$6.00$1.20
GPT-5.6 Terragpt-5.6-terra$2.50$2.00$15.00$12.00
GPT-5.6 Solgpt-5.6-sol$5.00$5.00$30.00$30.00

Prezzi per 1M token, tier standard e contesto breve, secondo la documentazione prezzi dell'API OpenAI (verificata il 2026-07-31).

Tabella prezzi dell'API OpenAI con le tariffe per 1M token di gpt-5.6-sol, gpt-5.6-terra e gpt-5.6-luna

Dire che «la serie GPT-5.6 costa meno» è vero solo per due modelli su tre. Nello stesso aggiornamento OpenAI ha introdotto per Sol una Fast mode da $10.00 in input e $60.00 in output: costa il doppio del tier standard, offre fino a 2.5× il throughput e non modifica il modello sottostante. La documentazione chiarisce che Fast mode è il nuovo nome di quella che prima veniva chiamata priority processing. In sostanza, mentre i due tier più economici scendevano di prezzo, il flagship acquisiva un'opzione più costosa.

Grafico a barre raggruppate che confronta il prezzo combinato di input e output per 1M token di GPT-5.6 prima e dopo il 30 luglio

Nel codice va indicato il model ID completo, non il semplice nome della serie. Il catalogo dei modelli di OpenAI definisce gpt-5.6 come alias di gpt-5.6-sol: instradare le richieste con il nome abbreviato sperando nel tier economico significa pagare le tariffe del modello flagship. Gli intermediari potrebbero inoltre non supportare affatto l'alias: sull'endpoint AIReiter, gpt-5.6 restituisce Model 'gpt-5.6' not found (test del 2026-07-31).

Tra gli sviluppatori l'attenzione si è concentrata meno sull'entità del taglio che sulla sua sostenibilità:

Non è possibile che i modelli 5.6 di OpenAI costino davvero così poco da eseguire — titolo di un thread su r/Anthropic

Luna costa meno di GPT-5.4 nano: quale tier scegliere ora

Con $0.20 in input e $1.20 in output, GPT-5.6 Luna costa ora meno per token di output rispetto a gpt-5.4-nano ($0.20 / $1.25) ed è molto più economico di gpt-5.4-mini ($0.75 / $4.50). Se tenevi chiamate nano o mini più vecchie solo per ragioni di prezzo, quel motivo non esiste più.

Per capire se il tier economico regge il confronto, il 2026-07-31 ho eseguito due task su tutti e tre i modelli GPT-5.6 tramite l'endpoint OpenAI-compatible di AIReiter: estrazione da ticket di assistenza a JSON con schema rigoroso e un problema aritmetico di fatturazione token con una sola risposta corretta ($23.71). Due esecuzioni per ciascuno, max_tokens: 4000, nessun retry e valutazione pass/fail rispetto all'output previsto.

TaskModelloToken inputToken outputLatenza (run 1 / run 2)Corretto
Ticket → JSONLuna13577–784.0s / 3.5sSì
Terra135462.1s / 2.1sSì
Sol135462.3s / 2.2sSì
Calcolo di fatturazioneLuna119111–1223.1s / 4.3sSì
Terra11987–893.8s / 2.8sSì
Sol4,48884–873.5s / 3.2sSì

Da questi test emergono due aspetti rilevanti.

Nell'estrazione Luna è stato il più lento dei tre, non il più rapido: 3.5–4.0s contro i 2.1s di Terra. Il tier economico non coincide automaticamente con quello a minore latenza.

Sol ha riportato 4,488 token di input per un prompt che Terra e Luna hanno entrambe conteggiato come 119; 3,840 erano segnalati come cached_tokens. Il risultato si è ripetuto identico in entrambe le esecuzioni. Su un prompt banale ("Reply with only the word OK.") tutti e tre hanno invece riportato 24 token identici: l'inflazione sembra quindi seguire il prompt, non il modello. Posso osservare i conteggi, ma non determinarne la causa. Va considerato un comportamento di fatturazione misurato su un endpoint, non una proprietà documentata del modello.

Applicando le tariffe standard ufficiali, la stessa risposta corretta è costata:

Grafico a barre del costo misurato per 1.000 esecuzioni di Luna, Terra e Sol sullo stesso task

Per 1.000 esecuzioni: Luna $0.16, Terra $1.29, Sol $7.73. Per restituire lo stesso numero di tre cifre, Sol ha fatturato circa 6× Terra e 47× Luna.

Il campione è ridotto — due run su due task semplici — e non è un benchmark né misura la qualità del ragionamento. Supporta però una regola pratica: partire da Luna e salire di tier soltanto davanti a fallimenti misurati sul proprio traffico. In questi test, pagare Sol quando Terra aveva già risposto correttamente non ha portato alcun vantaggio. La ripartizione completa per carico di lavoro è nella tabella finale.

Perché un taglio dell'80% può non ridurre la fattura dell'80%

La tariffa pubblicizzata vale per token di input freschi e token di output. Nel traffico degli agenti multi-turn pesa una terza voce, le cache write: su tutti e tre i tier GPT-5.6, una scrittura in cache costa 12.5× una lettura dalla cache.

ModelloInput in cache (lettura)Scrittura cacheRapporto
GPT-5.6 Luna$0.02$0.2512.5×
GPT-5.6 Terra$0.20$2.5012.5×
GPT-5.6 Sol$0.50$6.2512.5×

Un test controllato pubblicato nella community per sviluppatori OpenAI il 2026-07-11 mostra bene l'impatto. In sei turni sequenziali della Responses API concatenati tramite previous_response_id, Luna ha consumato il 3% in meno di token input e il 29% in meno di token output rispetto a gpt-5.4-mini, ma è costato il 96% in più ($0.0651 contro $0.0332 per conversazione). Circa il 70% dell'input di Luna è stato fatturato come cache write. I dati sono precedenti al taglio, ma il meccanismo non è cambiato.

La parte utile è che, in quell'implementazione, la causa era correggibile. La cache di GPT-5.6 non attribuisce valore alle corrispondenze parziali: qualsiasi modifica al prefisso memorizzato impone una riscrittura completa. L'autore ricostruiva a ogni turno una snapshot crescente della conversazione dentro instructions, invalidando così il prefisso.

La diagnosi è netta: istruzioni stabili hanno ottenuto cache hit in 15 turni utente successivi su 15, istruzioni variabili in 0 su 15. Spostando quel contesto in un input item dello sviluppatore, il sovrapprezzo di Luna è sceso dal 96% al 16.7%; nella revisione cieca dell'autore, Luna è poi risultato più veloce e ha ottenuto un punteggio superiore a mini. Né prompt_cache_key né breakpoint espliciti della cache hanno aiutato.

Prima di dare per scontato che lo sconto sia arrivato fino a te, ci sono due verifiche da fare:

  1. Non mettere dati variabili nel prefisso in cache. Testo di sistema, definizioni degli strumenti e persona devono venire prima e restare byte-identici; lo stato della conversazione va inserito negli input item.
  2. Controlla i dati restituiti dall'API. Il rapporto tra usage.prompt_tokens_details.cached_tokens e usage.prompt_tokens indica la quota di letture cache per ogni chiamata. Su un agente di lunga durata, un rapporto basso è il bug di costo con il maggiore impatto in questa serie.

Le tre tariffe GPT-5.6 che circolano online: quale vale per te

Cercando il prezzo di GPT-5.6 Luna compaiono almeno tre valori diversi, e ognuno è o è stato corretto per un determinato tier. Nella maggior parte dei casi, basta capire a quale tier si riferisce una quotazione per risolvere l'apparente contraddizione.

Dove l'hai vistoInput / output LunaChe cosa indica
$0.20 / $1.20Tier standard, contesto breveIl valore predefinito per una normale chiamata API
$0.10 / $0.60Tier Batch e FlexEsattamente metà dello standard, per carichi asincroni e a priorità inferiore
$0.40 / $2.40Fast modeIl doppio della tariffa standard
$1.00 / $6.00Tariffa standard precedente al 30 luglioCorretta fino al taglio

Ci sono altri due modificatori, entrambi indicati nella stessa documentazione prezzi: il contesto lungo viene fatturato a 2× la tariffa di input per contesto breve e 1.5× quella di output (la riga long context di Luna è $0.40 / $1.80, non $0.40 / $2.40); inoltre, per i modelli rilasciati dal 2026-03-05 in poi — categoria che include tutti i GPT-5.6 — i documenti indicano un supplemento del 10% sugli endpoint idonei alla data residency.

Quando una pagina prezzi non coincide con la fattura, due controlli risolvono il dubbio: individuare la data di verifica riportata nella pagina e confrontarla con la documentazione ufficiale dei prezzi relativa allo specifico tier utilizzato. Anche aggregatori e reseller pubblicano tariffe proprie: è una terza categoria, non necessariamente un dato obsoleto ma semplicemente un prezzo diverso.

Su AIReiter i tre tier GPT-5.6 sono prezzati al 50% del listino OpenAI, e l'adeguamento ha seguito il taglio del 30 luglio: GPT-5.6 Luna costa $0.10 / $0.60, Terra $1.00 / $6.00 e Sol $2.50 / $15.00; lo stesso dimezzamento si applica a input in cache e cache write.

Tabella prezzi AIReiter che confronta le tariffe API ufficiali di GPT-5.6 con quelle AIReiter per Luna, Terra e Sol

Per un agente Terra che usa ogni giorno 1M di token input e 200K di token output, il costo è quindi $4.40 al giorno a listino contro $2.20: stessa chiamata, stesso model ID.

Il posizionamento di Luna nel mercato più ampio è un'altra questione. Nel confronto del 30 luglio di VentureBeat su 30 modelli, la tariffa combinata di Luna da $1.40 batte Gemini 3.5 Flash-Lite ($2.80) e Gemini 3.1 Flash-Lite ($1.75), ma resta sopra DeepSeek DeepSeek v4-flash ($0.42). Se l'unico criterio è il costo, le API LLM più economiche non sono quelle di OpenAI.

FAQ

È sceso di prezzo anche GPT-5.6 Sol?

No. La tariffa standard di Sol resta $5.00 in input e $30.00 in output per 1M token. Ha acquisito una Fast mode al doppio del prezzo, per un throughput fino a 2.5× superiore.

GPT-5.6 Luna è ora il modello API più economico?

No. Con $1.40 combinati per 1M token è tra i modelli delle serie frontier meno costosi, ma la tabella di VentureBeat del 30 luglio colloca sotto di lui DeepSeek v4-flash ($0.42), MiMo-V2.5 Flash di Xiaomi ($0.40) e DeepSeek v4-pro ($1.305).

Perché alcune pagine indicano $1 / $6 per GPT-5.6 Luna?

Era la tariffa standard prima del 30 luglio 2026. Controlla la data di verifica dichiarata dalla pagina e poi confronta il valore con la documentazione ufficiale per il tier che stai chiamando.

Il taglio si applica anche a Batch e Flex?

Sì. Batch e Flex sono fissati a metà della tariffa standard: Luna costa quindi $0.10 / $0.60 e Terra $1.00 / $6.00 su questi tier, incluse le tariffe di input in cache e cache write.

Devo modificare il codice per ottenere il nuovo prezzo?

No. Il taglio si applica agli attuali model ID gpt-5.6-luna e gpt-5.6-terra, senza migrazione. L'unica modifica che vale davvero la pena fare è verificare il rapporto di cache read, il punto in cui più spesso si perde lo sconto.

Il tier giusto per ogni carico di lavoro

Carico di lavoroTierMotivazione
Estrazione, tagging e sintesi ad alto volumeLunaHa superato entrambi i task di test; $1.40 combinati per 1M, ora sotto gpt-5.4-nano
Chiamate rivolte agli utenti sensibili alla latenzaTerraNell'estrazione è stato più rapido di Luna (2.1s contro 3.5–4.0s)
Primo passaggio quando Luna non raggiunge la qualità richiestaTerra$14 combinati contro i $35 di Sol
Task in cui Terra rende misurabilmente peggio sul tuo trafficoSolUnica giustificazione per un costo per task misurato pari a 6× Terra
Agenti multi-turn su qualsiasi tierCorreggi prima il cachingLe cache write costano 12.5× le read; un prefisso sbagliato pesa più della scelta del tier

>_Directory modelli AIReiter

Accesso API rapido ai modelli collegati a questa guida

GPT-5.6 Luna

Chat

Un modello di testo GPT-5.6 bilanciato per la programmazione quotidiana, la scrittura e i flussi di lavoro degli agenti.

OpenAICrea API Key >

GPT-5.6 Terra

Chat

Un modello di testo GPT-5.6 più potente per attività di coding e analisi che richiedono un ragionamento approfondito.

OpenAICrea API Key >

GPT-5.6 Sol

Chat

Un modello di testo GPT-5.6 premium per attività impegnative di coding, ragionamento e lavoro agentico a lungo formato.

OpenAICrea API Key >

Gemini 3.1 Pro

Chat
GoogleCrea API Key >

Gemini 3 Pro

Chat
GoogleCrea API Key >

Post recenti

API Key non valida: diagnostica 401 e 403 prima di intervenire

2026-07-31

Risolvere OpenRouter 429: errore del provider o limite di frequenza?

2026-07-31

DeepSeek V4 Flash vs GLM-5.2: test dell'aggiornamento 0731

2026-07-31

La B2B Ad Intelligence passa dall'HTML: come scrivere un parser che resiste ai redesign

2026-07-31
AIREITER

Domande? Contattaci a
[email protected]

LLM

Gemini 3.6 FlashGemini 3.1 ProKimi K3Gemini 3 ProGemini 2.5 Pro

Video IA

Kling 3.0 Motion ControlSora 2 ProKling 3.0 TurboSora 2Kling 3.0

Immagine IA

FLUX.2 ProGPT-Image 2Wan 2.7 Image ProGPT 4o ImageSeedream 5.0 Pro

Blog

Vedi Tutto →

Azienda

Informativa sulla privacyTermini di servizioPolitica di rimborso

© 2026 AIReiter. Tutti i diritti riservati.