Claude Opus 5.5 High è un modello realmente disponibile, non una semplice indiscrezione. Il dato “1.509 punti e primo posto nella Text Arena”, però, è il risultato di una classifica scattata in un momento preciso, non una caratteristica permanente del prodotto. La domanda utile, per chi deve scegliere, è un’altra: i vantaggi nei lavori lunghi di coding e ricerca compensano il thinking adattivo sempre attivo, i tempi più lunghi delle esecuzioni ad alto sforzo e una migrazione API che può introdurre nuovi errori 400?
Cosa ha rilasciato davvero Anthropic
Anthropic ha annunciato Claude Opus 5.5 il 22 settembre 2026, presentandolo come il primo modello della famiglia Claude 5.5. Il comunicato ufficiale conferma la disponibilità tramite Claude e i canali API e lo colloca soprattutto negli scenari di coding agentico, uso del computer e lavoro basato sulla conoscenza. L’ID diretto del modello è claude-opus-5-5; la finestra di contesto standard è di 1 milione di token, mentre l’output massimo standard è di 128.000 token.
| Dato | Claude Opus 5.5 | Cosa non dimostra |
|---|---|---|
| Data di rilascio | 22 settembre 2026 | Che ogni gateway usi lo stesso percorso o applichi lo stesso prezzo |
| ID del modello API | claude-opus-5-5 | Che le integrazioni precedenti di Opus 5 siano compatibili senza modifiche |
| Finestra di contesto | 1 milione di token | Che riempire tutta la finestra migliori qualsiasi attività |
| Sforzo predefinito | Medio | Che “medio” corrisponda al vecchio comportamento predefinito di Opus 5 |
| Thinking | Adattivo e sempre attivo | Che la latenza sia prevedibile |
Secondo l’annuncio di Anthropic, Opus 5.5 raggiunge prestazioni paragonabili a Claude Fable 5.1 nella maggior parte delle attività e costa il 40% in meno da eseguire rispetto a Opus 5 sui carichi di lavoro tipici. Sono dichiarazioni del produttore; la stessa azienda avverte inoltre che i margini dei benchmark sono ormai una guida meno affidabile per capire le differenze nell’uso reale.
Come leggere il risultato di 1.509 nella Text Arena
Text Arena ha annunciato il debutto di Claude Opus 5.5 High al primo posto, con 1.509 punti: 18 in più di Opus 5 High. È un segnale forte sulle preferenze degli utenti all’interno della configurazione dell’Arena, ma non è una prova universale delle capacità di coding, dell’uso degli strumenti o dell’accuratezza fattuale.
Il punteggio può cambiare rapidamente. Le rilevazioni successive dei tracker hanno mostrato valori diversi, confermando che le classifiche dell’Arena sono legate al momento in cui vengono osservate. L’annuncio indicava inoltre Opus 5.5 High sulla frontiera di Pareto, con un costo combinato di 16 dollari per milione di token. Questo dato medio, però, non deve sostituire il listino API ufficiale quando si prepara il budget di un carico di lavoro.
L’incertezza è significativa: un utente, rispondendo all’annuncio dell’Arena, ha osservato che il distacco di 18 punti era inferiore ai margini d’errore. Meglio quindi considerare la classifica un buon segnale da verificare, non la dimostrazione che Opus 5.5 High sia superiore a ogni altro modello in qualsiasi attività.
“1509 contro 1491, quindi 18 punti: sinceramente, il distacco è inferiore ai margini d’errore.” — @Avery_Coree, in risposta all’annuncio di Text Arena (fonte)
Cosa dicono i dati oltre la classifica
La tabella pubblicata da Anthropic assegna a Opus 5.5 il 66,4% su Terminal-Bench 4.0, il 54,4% su FrontierCode Main, il 57,8% su CursorBench 4.0 e un punteggio di 1.846 Elo su GDPval-AA v2.1. I dati mostrano anche alcuni svantaggi: GPT-6 Astra raggiunge il 41,4% su AutomationBench contro il 40,0% di Opus 5.5 e il 64,6% su Terminal-Bench-Science contro il 58,7%.
| Valutazione | Opus 5.5 | Confronto significativo |
|---|---|---|
| Terminal-Bench 4.0 | 66,4% | Fable 5.1: 55,8%; GPT-6 Astra: 57,9% |
| FrontierCode Main | 54,4% | GPT-6 Astra: 53,3% |
| CursorBench 4.0 | 57,8% | Opus 5: 46,6% |
| GDPval-AA v2.1 | 1.846 Elo | Fable 5.1: 1.735; Opus 5: 1.708 |
| AutomationBench | 40,0% | GPT-6 Astra: 41,4% |
| Terminal-Bench-Science | 58,7% | GPT-6 Astra: 64,6% |
Questi numeri vanno sempre letti insieme alle impostazioni usate. Anthropic ha eseguito la maggior parte dei test di Opus 5.5 con il massimo livello di sforzo adattivo; su Terminal-Bench ha usato xhigh per Opus 5.5 e high per Astra. L’errore standard dichiarato per Opus 5.5 su Terminal-Bench è di ±2,6 punti: differenze ridotte non vanno quindi trasformate in classifiche precise.
Le verifiche indipendenti indicano una direzione simile, ma aggiungono qualche elemento di cautela. La valutazione Java di Sonar ha rilevato un tasso di superamento dell’87,68% per Opus 5.5 High, contro l’88,6% di Opus 5. Il codice generato è sceso da 916.813 a 664.890 righe e il numero complessivo di problemi rilevati da 18.814 a 10.941. Nello stesso test, però, la densità dei bug è salita da 576 a 644 per milione di righe e sono aumentati i problemi di concorrenza. È un buon motivo per mantenere i test automatici nel ciclo di sviluppo, non per accettare senza revisione il codice generato.
Dove vale la pena provare Claude Opus 5.5 High
Il caso d’uso più convincente riguarda i lavori lunghi, con uso di strumenti, nei quali la pianificazione e la riduzione dei tentativi a vuoto contano più della risposta immediata. Anthropic riferisce di aver completato un audit su 200.000 righe in meno di tre ore, contro oltre 20 ore con Opus 5, e una riscrittura da C a Rust di HAProxy in 9,5 ore, rispetto alle 12 ore di Fable 5.1. Sono esempi forniti da Anthropic: vanno quindi usati come ipotesi per un test pilota, non come promesse.
Le esperienze degli utenti reali descrivono lo stesso schema, ma con un entusiasmo meno uniforme. Un utente di Reddit ha raccontato di aver ricostruito un sito in circa quattro minuti, con un design migliore, mentre un altro ha scritto che Opus 5.5 “non si ferma proprio mai” durante l’orchestrazione. La qualità della scrittura, però, non migliora in modo universale: @rchitectopteryx lo ha definito “il peggior testo scadente che abbia mai visto sul piano della scrittura”. La raccomandazione pratica deve quindi dipendere dal lavoro specifico: conviene testarlo prima su coding multi-step, audit di repository e attività di ricerca con criteri di accettazione oggettivi, non soltanto su testi valutati in base al gusto.
“La cosa che ho notato con Opus 5.5 è che non si ferma proprio mai. Gli dai un’attività in orchestrazione e lui semplicemente... continua a eseguirla.” — @bridgerloftin (fonte)
Prezzi, livello di sforzo e costo dell’attesa
Le tariffe ufficiali dell’API diretta sono di 4 dollari per milione di token in input, 20 dollari per milione di token in output e 0,20 dollari per milione di token letti dalla cache. La scrittura in cache costa 5 dollari per milione di token. Anthropic sostiene che le tariffe più basse, insieme al minor numero di token necessari per attività, portino in genere a una riduzione del 40% dei costi rispetto a Opus 5; la percentuale effettiva dipenderà da cache hit, livello di sforzo, tentativi ripetuti e strumenti utilizzati.
| Voce API | Opus 5.5 | Opus 5 |
|---|---|---|
| Input / 1M token | $4 | $5 |
| Output / 1M token | $20 | $25 |
| Lettura cache / 1M token | $0.20 | $0.50 |
| Scrittura cache di cinque minuti / 1M | $5 | $6.25 |
| Modalità veloce | $8 input / $40 output | — |
Un livello di sforzo più alto non significa automaticamente un rapporto qualità-prezzo migliore. La recensione indipendente di BitsMinds ha riportato, sulla base dei dati di Artificial Analysis, un costo per attività di $1.34 a livello medio, $1.82 a livello high, $3.46 a livello xhigh e $5.98 a livello max, con punteggi benchmark rispettivamente di 51, 54, 56 e 58. Se il lavoro non richiede una pianificazione massima, medium o high possono rappresentare il punto operativo più equilibrato.
Controlli da fare prima della migrazione API
Claude Opus 5.5 non è un semplice aggiornamento del nome del modello. Le indicazioni di migrazione di Anthropic e le recensioni indipendenti evidenziano quattro cambiamenti da verificare in staging:
- Il thinking non può essere disattivato. Le richieste che usano il thinking disabilitato o un budget manuale per il thinking possono fallire con errore HTTP 400. Usa il thinking adattivo e regola invece il livello di sforzo.
- È cambiata la selezione forzata degli strumenti. Valori di
tool_choicecomeanyo il nome di uno strumento non sono più accettati; riprogetta il ciclo usando la selezione automatica supportata e la validazione. - I blocchi di thinking dipendono dalla conversazione. Conserva i blocchi di thinking restituiti quando richiesto e verifica il comportamento dopo modifiche ai messaggi o alla cronologia degli strumenti.
- È cambiata la gestione dell’avanzamento. Il testo tra una chiamata allo strumento e l’altra può arrivare nei blocchi di thinking. Le interfacce che mostrano l’avanzamento devono quindi analizzare i tipi di blocco, invece di dare per scontato che il testo visibile sia sempre il primo elemento del contenuto.
Esegui questi controlli con una chiave di staging prima di spostare il traffico in produzione. Mantieni disponibile il vecchio percorso finché non avrai confrontato completamenti riusciti, tentativi ripetuti, latenza, token fatturati e tempo richiesto dalle correzioni manuali.
Come impostare un test pilota con Opus 5.5 High
Meglio partire da un’attività delimitata che da una richiesta costruita per impressionare la classifica:
- Seleziona 20 ticket, audit o deliverable di ricerca già risolti.
- Esegui Opus 5.5 a livello medium e high, mantenendo identici strumenti e test di accettazione.
- Registra tasso di completamento, tentativi ripetuti, tempo trascorso, token di input/output/cache e minuti di revisione.
- Analizza separatamente gli errori di concorrenza, sicurezza e accuratezza fattuale: non comprimerli in un unico punteggio.
- Confronta il costo per deliverable accettato, non il costo per richiesta.
- Usa max solo per le attività in cui il miglioramento qualitativo giustifica l’attesa e i token aggiuntivi.
Il cambio di modello è giustificato quando Opus 5.5 riduce il costo complessivo di consegna o il carico di revisione nelle attività ricorrenti. Il solo piazzamento nell’Arena non basta.
Domande frequenti su Claude Opus 5.5 High
Claude Opus 5.5 High è stato rilasciato ufficialmente?
Claude Opus 5.5 è stato rilasciato ufficialmente da Anthropic il 22 settembre 2026. “High” è una configurazione del livello di sforzo usata nelle valutazioni e negli strumenti; non è un prodotto separato annunciato con una propria identità di modello.
1.509 è ancora il punteggio attuale nella Text Arena?
Non necessariamente. 1.509 è il punteggio riportato nell’annuncio dell’Arena del 26 settembre; i tracker successivi hanno mostrato rilevazioni diverse. Quando citi il numero, indica sempre data e fonte.
Opus 5.5 High è migliore di Fable 5.1?
Primeggia in diverse valutazioni pubblicate ed è più economico per token, ma Anthropic afferma che il divario nell’uso reale è più ridotto di quanto suggeriscano i benchmark. Fable potrebbe comunque prevalere su uno specifico repository, flusso di lavoro o progetto complesso distribuito su più file: per questo conviene eseguire lo stesso test pilota con entrambi.
Quanto costa Claude Opus 5.5?
La tariffa base dell’API diretta è di $4 per milione di token in input, $20 per milione di token in output, $0.20 per milione di token letti dalla cache e $5 per milione di scritture in cache di cinque minuti. I prezzi dei gateway e l’uso incluso negli abbonamenti possono essere diversi.
Devo usare il livello di sforzo massimo?
In genere no. Parti da medium o high, misura la qualità delle attività accettate e il costo totale, poi riserva max ai lavori che traggono vantaggio da una pianificazione più profonda. Il livello massimo può migliorare i punteggi dei benchmark aumentando però latenza e consumo di token.
La decisione è semplice anche se la classifica non lo è: scegli Claude Opus 5.5 High per un flusso di lavoro misurabile e a lungo orizzonte, quando il miglioramento nella qualità dei completamenti compensa i tempi di attesa e il lavoro di migrazione. Per le attività brevi, sensibili alla latenza o fortemente legate allo stile, mantieni un percorso più economico o veloce finché il tuo test pilota non dimostrerà un vantaggio concreto.