Se state configurando un agente questa settimana, quale modello conviene chiamare: claude-opus-5 o gpt-5.6? Attenzione al secondo nome: non identifica un singolo modello, ma un alias che punta a una delle tre SKU, ciascuna con il proprio listino.
In breve: fino a 272.000 token in input, i due modelli di punta distano meno del 7% nel prezzo. Oltre quella soglia, Claude Opus 5 costa circa la metà di GPT-5.6 Sol. Il 24 luglio 2026 abbiamo eseguito gli stessi quattro controlli su tutti e quattro i modelli e verificato ogni parametro sulla documentazione dei due fornitori.
GPT-5.6: Sol, Terra e Luna sono tre taglie della stessa generazione
OpenAI ha rilasciato tutti e tre il 9 luglio 2026. Nella documentazione modelli li collega ai precedenti suffissi dimensionali: Sol corrisponde al "the unsuffixed tier of earlier GPT-5 families", Terra al "the mini model tier" e Luna al "the nano model tier". Sono quindi tre SKU della medesima generazione, non tre generazioni distinte.
La stringa semplice gpt-5.6 è un alias. Il changelog di OpenAI la indirizza a gpt-5.6-sol: una configurazione che usa gpt-5.6 viene dunque fatturata alla tariffa più alta della famiglia.
| Variante | ID modello | Tier rappresentato | Input / output per 1M (≤272K) | Valutazione reasoning |
|---|---|---|---|---|
| Sol | gpt-5.6-sol (alias gpt-5.6) | senza suffisso | $5.00 / $30.00 | Massima |
| Terra | gpt-5.6-terra | mini | $2.50 / $15.00 | Superiore |
| Luna | gpt-5.6-luna | nano | $1.00 / $6.00 | Alta |
Le caratteristiche comuni contano più delle differenze. Tutte e tre le pagine modello riportano gli stessi dati:
- Finestra di contesto da 1.050.000 token e output massimo di 128.000 token
- Knowledge cutoff al 16 febbraio 2026
- Input testuale e immagini, output testuale; nessun fine-tuning; nessuno snapshot datato
- La stessa scala di effort e la medesima valutazione di velocità "Fast"
Prezzo e valutazione del reasoning sono le sole differenze documentate. L'etichetta "Default" compare nella pagina di ogni rispettivo tier: trovarla su Terra non significa quindi che Terra sia il modello predefinito della famiglia.
Dall'altra parte, Anthropic propone una sola SKU. Claude Opus 5 è arrivato il 24 luglio 2026 come claude-opus-5, uno snapshot fissato senza suffisso data, con prezzo di listino di $5 in input e $25 in output per milione di token. La finestra da 1M è al tempo stesso quella predefinita e quella massima.
Coding: quattro controlli meccanici, quattro promossi
Abbiamo inviato quattro task con criteri di superamento verificabili automaticamente attraverso un gateway compatibile con OpenAI, usando per ogni modello lo stesso prompt utente:
- Correzione di bug: riparare
kth_smallest, che alterava la lista del chiamante con unsort()in-place e conteneva inoltre un errore di indice off-by-one - JSON rigoroso: ordine delle chiavi fisso, conteggio e checksum coerenti tra loro
- Reasoning: il più grande totale non ottenibile usando soltanto pacchetti da 7 e da 12, ossia il numero di Frobenius, 7×12−7−12 = 65
- Refactoring: aggiungere la validazione senza modificare la firma
Tutti e quattro i modelli hanno chiuso con 4/4: sorted() oppure una copia, con l'indice portato a k-1; JSON parsabile nell'ordine richiesto; 65; e un refactoring pulito. Si tratta di una sola esecuzione per ciascuna coppia modello-task, non di un benchmark: a questa scala, la correttezza non li ha distinti.
I dati più ampi restano quelli dichiarati dai fornitori e non sono stati riprodotti in modo indipendente. Nei materiali di lancio, Anthropic colloca Opus 5 entro lo 0,5% del picco di Fable 5 su CursorBench 3.2 al massimo effort, con metà costo per task: è un dato relativo ottenuto internamente. La pagina di lancio di GPT-5.6 restituisce 403 ai fetch automatici; i punteggi di Sol nel coding restano quindi attribuiti a chi li ha pubblicati:
| Benchmark di terze parti | Sol | Terra | Luna |
|---|---|---|---|
| Vellum, Terminal-Bench 2.1 | 88.8% | 87.4% | 84.7% |
| Artificial Analysis, Coding Agent Index | 80 con Codex | 77 | 75 |
I pareri pratici non coincidono sempre con le classifiche. Uno sviluppatore che ha confrontato i due modelli con effort High ha scritto il 24 luglio che "GPT 5.6 Sol High is still better at coding than Claude Opus 5 High."
Le indicazioni di migrazione di Anthropic aggiungono un dettaglio operativo: Opus 5 verifica autonomamente il proprio lavoro. I prompt ereditati che aggiungono un passaggio esplicito di verifica lo spingono quindi a verificare troppo e andrebbero ripuliti.
Seguire le istruzioni: le differenze emergono nel formato
Due delle prove erano in realtà test di aderenza alle istruzioni: il task JSON imponeva items in ordine alfabetico minuscolo, checksum pari a 14 e nessuna chiave aggiuntiva; il refactoring richiedeva un ValueError, zero commenti e zero docstring, vincoli che i modelli infrangono spesso documentando ciò che fanno. Tutti e quattro hanno superato entrambe le prove.
La forma dell'output, però, è cambiata. Sol e Luna hanno racchiuso la risposta in LaTeX, restituendo \boxed{65}; Opus 5 e Terra hanno invece dato il numero semplice. Una regex che estrae l'ultimo intero gestisce entrambe le forme, mentre un parser che si aspetta un numero nudo o un campo JSON no. Ed è proprio questo il comportamento predefinito che ci si porta dietro sostituendo claude-opus-5 con gpt-5.6 senza cambiare altro.
Efficienza token: 1.182 token in output contro i 464 di Sol
La differenza riportata sotto dipende verosimilmente da due impostazioni predefinite, non dalla qualità. Opus 5 viene distribuito con thinking attivo e effort impostato di default su high sia nell'API sia in Claude Code: una richiesta senza parametri è già una richiesta di reasoning. GPT-5.6 parte invece da medium.
Token di completamento visibili sui quattro task, con costo calcolato alle tariffe ufficiali di output. Una richiesta per ogni coppia, nessun retry, impostazioni predefinite:
| Modello | Token output | Task di refactoring | Costo, solo output |
|---|---|---|---|
| Claude Opus 5 | 1,182 | 600 tok / 8.3s | $0.0296 |
| GPT-5.6 Sol | 464 | 321 tok / 12.0s | $0.0139 |
| GPT-5.6 Terra | 737 | 603 tok / 11.8s | $0.0111 |
| GPT-5.6 Luna | 612 | 380 tok / 8.7s | $0.0037 |
Questi costi vanno letti con due cautele. Per lo stesso prompt utente, il gateway ha riportato dai 62 ai 4.471 token di prompt sui modelli GPT, mentre Claude è rimasto tra 592 e 640. Le richieste non erano quindi identiche a livello di trasmissione: una stima lato input non sarebbe significativa e non è possibile attribuire con precisione il divario.
Inoltre, la guida di OpenAI sul reasoning non mostra i riepiloghi del ragionamento senza opt-in, ma GPT-5.6 fattura quei token nascosti come output. I tre costi GPT sottostimano quindi la fattura effettiva. Qui la correttezza è il segnale confrontabile; token e latenza sono indicativi.
Il grafico include anche Opus 4.8 e Sonnet 5, riferimenti Claude ottenuti nella stessa esecuzione. Opus 5 è stato il più lento dei sei, con 24.6s nei quattro task, contro 20.3s di Sol, 22.7s di Terra e 18.4s di Luna. Opus 4.8 ha thinking disattivato per impostazione predefinita e ha terminato in 11.8s: un indizio che il divario dipende dalla configurazione, non dalle capacità.
Artificial Analysis, che ha valutato Opus 5 il giorno del rilascio, ha descritto la sua impostazione di effort come estesa su un intervallo di utilizzo token più ampio rispetto ai modelli di altri laboratori. Il costo risulta quindi più regolabile di quanto suggerisca il listino.
Prezzi: il salto a 272K, tradotto in dollari
Una singola frase pubblicata decide gran parte del confronto di prezzo tra Claude Opus 5 e GPT-5.6. Alla tariffa principale, i due flagship sembrano quasi equivalenti: Opus 5 costa $5/$25 per milione di token, Sol $5 in input e $30 in output. Opus 5 è quindi identico sull'input e costa il 17% in meno sull'output. Ma ciò vale soltanto fino a 272.000 token in input.
Tutte e tre le pagine modello di GPT-5.6 riportano la stessa nota: "Prompts with >272K input tokens are priced at 2x input and 1.5x output for the full request." L'aumento riguarda l'intera richiesta, non soltanto i token oltre soglia. Basta superare 272K di un token e Sol fattura $10/$45 sull'intera chiamata; la finestra da 1M di Opus 5 rimane invece a $5/$25 dall'inizio alla fine.
Prendiamo una richiesta agentica con 20.000 token in output e variamo l'input, usando le tariffe pubblicate da OpenAI e le tariffe standard di Anthropic, entrambe consultate il 25 luglio 2026:
| Token input | Claude Opus 5 | GPT-5.6 Sol | GPT-5.6 Terra |
|---|---|---|---|
| 200,000 | $1.50 | $1.60 | $0.80 |
| 400,000 | $2.50 | $4.90 | $2.45 |
| 900,000 | $5.00 | $9.90 | $4.95 |
Sotto la soglia, i flagship distano il 7%. Sopra, Sol costa 1.96x Opus 5 con 400K token in input e 1.98x con 900K: cento richieste dalla forma 400K costano dunque $250 contro $490.
Terra è il caso da osservare con attenzione. Oltre 272K paga lo stesso input di Opus 5, $5 per milione, e la differenza è interamente nella riga output: $2.50 per milione, ovvero cinque centesimi in questa richiesta da 20k token in output, sia a 300K sia a 900K. Il differenziale scala con l'output, non con l'input. La soglia introduce uno scatto discreto nel listino, non una pendenza continua come può far sembrare un asse a intervalli regolari.
Batch, tokenizzatori e canale d'acquisto
I tier scontati mantengono la stessa proporzione sulla richiesta da 400K:
- Anthropic Batch API: Opus 5 a $2.50/$12.50, per una richiesta da $1.25
- OpenAI Batch e Flex: sconto del 50% sul listino standard; la tariffa long-context di Sol diventa $5/$22.50, ovvero $2.45 per la stessa chiamata
Le tariffe per token non sono direttamente comparabili tra fornitori. La documentazione prezzi di Anthropic segnala che i modelli Claude dalla 4.7 in poi, incluso Opus 5, usano un tokenizzatore più recente che produce circa il 30% di token in più per lo stesso testo; il rapporto varia in base a contenuto e lingua. Un documento da 400.000 token GPT-5.6 arriva vicino ai 520.000 su Opus 5, portando la riga input dell'esempio da $2.00 a $2.60. Resta sotto i $4.00 di Sol, ma conviene tokenizzare i propri prompt prima di impegnarsi.
Conta anche dove si acquista. AIReiter rivende Claude sotto listino, con Opus 4.8 a $1.56/$7.76 per milione di token, circa il 69% sotto la tariffa ufficiale; il catalogo arriva però soltanto a Fable 5 e Opus 4.8, quindi Opus 5 non è ancora richiamabile. Nella lineup di Anthropic, il punto di pareggio da valutare è Fable 5 a $10/$50 contro Opus 5 a $5/$25.
Contesto: entrambi dichiarano 1M, ma uno applica una tariffa fissa
La finestra di Opus 5 è di 1.000.000 token ed è contemporaneamente quella predefinita e quella massima; non esiste quindi una variante a contesto ridotto da selezionare per errore. Tutte e tre le varianti GPT-5.6 indicano 1.050.000 token, una finestra più ampia del 5%. L'output massimo è di 128.000 token su entrambi i fronti, con un'asimmetria: nella Batch API di Anthropic, l'header beta output-300k-2026-03-24 porta il limite di Opus 5 a 300.000.
Sol accetta un prompt da 900K token, ma applica la tariffa long-context all'intera richiesta: circa il 74% della finestra dichiarata supera quindi la fascia economica. Le capacità su contesti estesi sono un tema separato: secondo l'analisi di Vellum, Luna ottiene 41.3% su MRCR, contro 91.5% di Sol e 89.6% di Terra. È un motivo per escludere il tier nano dai lavori long-context, indipendentemente dal costo. Anthropic assegna inoltre a Opus 5 un knowledge cutoff a maggio 2026, mentre le tre pagine modello GPT-5.6 riportano il 16 febbraio 2026.
Controlli di reasoning: una scala, due approcci
Opus 5 non richiede header beta per nessun livello di effort e ha thinking attivo per impostazione predefinita. Disattivarlo ha un limite netto: thinking: {"type": "disabled"} viene accettato soltanto con effort high o inferiore e restituisce un 400 con xhigh o max. Anthropic lo segnala come cambiamento incompatibile rispetto ai modelli precedenti.
| Controllo | Claude Opus 5 | GPT-5.6 |
|---|---|---|
| Scala di effort | low → medium → high → xhigh → max | none → low → medium → high → xhigh → max |
| Effort predefinito | high in API e Claude Code | medium |
| Secondo controllo | nessuno | reasoning.mode: standard (predefinito) oppure pro |
| Reasoning disattivato | non oltre effort high | effort: none |
Questi due valori di modalità sono gli unici documentati dalla guida di OpenAI sul reasoning. L'API non espone alcun valore ultra e non viene spiegato il meccanismo alla base della modalità Pro. Il changelog del 9 luglio indica reasoning persistente, effort max e modalità Pro tra le novità introdotte con la famiglia.
L'asimmetria pratica è questa: GPT-5.6 può interrompere completamente il reasoning nelle chiamate dove la latenza è critica, cosa che Opus 5 non può fare oltre effort high; Opus 5 offre invece una gamma dinamica più ampia all'interno del reasoning. Uno sviluppatore che segue entrambi ha adottato una singola scala cross-vendor: Luna high, Sol medium, poi Opus medium, high e xhigh.
Disponibilità, rate limit e fine-tuning
Opus 5 è richiamabile tramite Claude API, Amazon Bedrock come anthropic.claude-opus-5, Google Cloud, Microsoft Foundry, claude.ai, Claude Code e Claude Cowork; è inoltre il nuovo modello predefinito su Claude Max. La fast mode di Anthropic, a $10/$50 per circa 2.5x di throughput, è disponibile soltanto nella Claude API.
Tutte e tre le varianti GPT-5.6 sono prodotti OpenAI API e il tier API gratuito non include né Sol né Terra. I limiti documentati di Sol salgono da 500 RPM nel Tier 1 a 15.000 nel Tier 5; Terra condivide quel tetto. Nessuno dei tre supporta il fine-tuning né espone uno snapshot datato: fissare una versione significa usare l'ID semplice e accettare aggiornamenti in-place.
Quale modello usare in ogni scenario
Il primo parametro da controllare è la dimensione dell'input: è l'unico asse con una discontinuità di prezzo pubblicata. Caching, idoneità al batch e volume di output determinano poi il totale.
Sotto 272K, i flagship sono abbastanza vicini da lasciare la decisione ai fattori secondari; oltre soglia, l'economia di listino favorisce Opus 5 rispetto a Sol di circa 2x. Il vantaggio non si estende però all'intera famiglia: Terra oltre lo scatto costa $2.45 contro i $2.50 di Opus 5 sulla stessa richiesta. Il risparmio long-context riguarda dunque il confronto con Sol, non con GPT-5.6 nel suo insieme.
- Claude Opus 5: prompt molto grandi, tariffa fissa su una finestra da 1M, conoscenza aggiornata a maggio 2026 oppure inferenza da eseguire su Bedrock, Google Cloud o Foundry.
- GPT-5.6 Terra: la scelta predefinita per i volumi, perché costa meno di Opus 5 a entrambe le estremità della gamma.
- GPT-5.6 Sol: quando servono la modalità
proo effortnone. Il suo sovrapprezzo si giustifica per i controlli, non per un vantaggio di correttezza che siamo riusciti a misurare. - GPT-5.6 Luna: lavori superficiali ad alto volume, evitando i task long-context.
Il confronto Claude Opus 5 vs GPT-5.6 si riduce a una scelta per fascia di dimensione dell'input, e i due fornitori pubblicano entrambi il confine che la determina.
FAQ
Claude Opus 5 è migliore di GPT-5.6 per programmare?
Nelle nostre quattro verifiche meccaniche, Opus 5, Sol, Terra e Luna hanno tutti ottenuto 4/4: a questa scala la correttezza non ha fatto differenza, e gli sviluppatori che li usano entrambi con effort High non concordano. Il costo è un dato più netto: sopra 272K token in input, Opus 5 costa circa la metà di Sol.
Che differenza c'è tra GPT-5.6 Sol, Terra e Luna?
Il prezzo e una valutazione qualitativa del reasoning. La documentazione OpenAI associa Sol al vecchio tier senza suffisso, Terra a mini e Luna a nano, con tariffe sotto 272K input di $5/$30, $2.50/$15 e $1/$6 per milione di token. Finestra di contesto, output massimo, knowledge cutoff, modalità e scala di effort sono identici per tutti e tre.
È migliore GPT o Claude?
Dipende dal parametro considerato, e il divario pubblicato più ampio è su un dato che nessuno dei due fornitori promuove. benchlm.ai registra un tasso di allucinazioni AA-Omniscience del 35.9% per Claude Opus 4.8 contro l'88.8% di GPT-5.6 Sol, ma assegna a Sol punteggi superiori in matematica, conoscenza e categorie agentiche. È l'abbinamento pubblicato più vicino; nessun aggregatore include ancora dati su Opus 5 o Terra. Se le risposte errate costano più di quelle mancanti, questa gerarchia pesa più di qualunque punteggio nel coding.
Dovrei usare GPT-5.6 Terra invece di Sol?
Per la maggior parte dei volumi, sì. Chi instrada le richieste in base alla complessità su r/codex riferisce una distribuzione vicina a Terra per il 75% del lavoro, Luna al 15% e Sol al 10%. Artificial Analysis sostiene che il tier intermedio sia dominato, perché una configurazione di Luna o Sol spesso lo eguaglia o lo supera a pari o minore costo: prima di assumere che il tier centrale sia la scelta sicura, testate Terra contro entrambi i vicini.
GPT-5.6 ha una modalità di reasoning ultra?
L'API espone reasoning.mode con due soli valori documentati, standard e pro, insieme a reasoning.effort da none a max. La modalità Pro è arrivata nel changelog del 9 luglio 2026. Nessun valore ultra compare nella guida OpenAI sul reasoning né nelle pagine modello.
