Claude Mythos vs Claude Opus 4.8: I benchmark verificati

Ultimo Aggiornamento: 2026-07-15 02:17:20

Anthropic ha pubblicato esattamente tre benchmark che confrontano direttamente il suo modello di classe Mythos con Claude Opus 4.8: SWE-Bench Pro (80,3% vs 69,2%), FrontierCode di Cognition (29,3% vs 13,4%) ed ExploitBench (78% vs 40%). Ogni altro dato associato a "Claude Mythos vs Claude Opus" che circola online — i punteggi di Humanity's Last Exam, GPQA, AIME, o versioni di Opus diverse dalla 4.8 — non è presente nel rilascio di Anthropic. Parte di questi dati è inventata di sana pianta; parte mette a confronto l'attuale modello Mythos con una versione di Opus di una generazione precedente.

C'è una seconda complicazione: quasi nessuno che confronta Mythos e Opus 4.8 fianco a fianco sta eseguendo Mythos. Il modello che la maggior parte delle persone ottiene quando chiamano l'API della classe Mythos è Fable 5, che reindirizza silenziosamente a Opus 4.8 nel momento in cui una richiesta tocca la cybersecurity, la biologia o una manciata di altri domini segnalati. Quindi molti confronti diretti "Mythos vs Opus" sono, senza che l'autore se ne renda conto, Opus 4.8 contro se stesso.

I tre benchmark che Anthropic ha effettivamente pubblicato

Il lancio da parte di Anthropic del 9 giugno 2026 di Fable 5 e Mythos 5 includeva una tabella di benchmark che confrontava il modello base della classe Mythos con Claude Opus 4.8. Tre risultati compaiono in modo coerente sia nel comunicato ufficiale di Anthropic sia in fonti indipendenti che lo citano direttamente, tra cui le analisi de The Decoder e di Vellum della stessa pubblicazione:

BenchmarkMythos-classClaude Opus 4.8
SWE-Bench Pro (risoluzione reale di issue GitHub)80.3%69.2%
FrontierCode di Cognition29.3%13.4%
ExploitBench (attività di sicurezza offensiva)78%40%

Il divario SWE-Bench Pro, 11,1 punti, è il dato più citabile se stai decidendo se valga la pena inseguire il ragionamento di classe Mythos per il lavoro di coding. Il punteggio ExploitBench è quello che conta meno per gli acquirenti tipici: misura la capacità grezza del modello sottostante prima che entrino in gioco i classificatori di sicurezza di Fable 5 e, in produzione, Fable 5 ottiene un punteggio vicino allo 0% sui task cyber perché il classificatore li reindirizza a Opus 4.8 prima che quella capacità venga mai esposta.

Nessun numero pubblicato da Anthropic mette Mythos-class e Opus 4.8 a confronto su Humanity's Last Exam, GPQA Diamond, AIME o Terminal-Bench. Se vedi una tabella con quei benchmark compilati per entrambi i modelli, chiedi da quale fonte provenga — al momento in cui scriviamo, non è di Anthropic.

I punteggi ripetuti che Anthropic non ha pubblicato

La ricerca di "Claude Mythos vs Claude Opus" mostra diversi siti con tabelle di benchmark dettagliate proprio per questo confronto. Il confronto con il rilascio di Anthropic evidenzia due problemi distinti, non uno:

Numeri senza una fonte verificabile. Il confronto Benchlm tra Mythos 5 e Opus 4.6 riporta un punteggio del benchmark Math del 97,6% per Mythos contro il 36,3% per Opus — un divario di 61 punti su un benchmark che il materiale pubblico di nessuno dei due modelli menziona con quel nome. Nessuna delle due cifre compare nell’annuncio di Anthropic, nelle analisi indipendenti di The Decoder o Vellum, né in alcuna scheda di sistema di Opus 4.8.

Numeri reali, avversario sbagliato. La stessa pagina Benchlm riporta correttamente il punteggio SWE-Bench Pro di Mythos-class, 80,3%, in linea con il dato reale di Anthropic, ma lo confronta con il 53,4% di Claude Opus 4.6 invece che con il 69,2% di Opus 4.8. Opus 4.6 precede il lancio di Fable 5/Mythos 5 di diversi cicli di rilascio, quindi metterlo a confronto con il valore più recente di Mythos crea un divario di 27 punti, mentre il confronto tra generazioni attuali ne mostra 11.

Nessuno dei due schemi rende falsa l’affermazione sottostante — che il ragionamento della classe Mythos batte Opus 4.8 nelle attività di coding e agentiche. Il divario di 11 punti su SWE-Bench Pro è reale. Ma un divario di 11 punti e un divario artificiale di 44 punti portano a conclusioni diverse su quanto Mythos sia effettivamente migliore, e solo uno di questi numeri proveniva da Anthropic.

Perché la maggior parte delle persone che fanno questa domanda non può testarlo da sola

Ecco la parte che le tabelle del benchmark tralasciano: Mythos 5 non è un modello che si possa chiamare. Anthropic lo fornisce solo ai partner di Project Glasswing — difensori informatici del governo degli Stati Uniti — con un programma di accesso fidato che si apre alle organizzazioni di cybersecurity e, separatamente, ai ricercatori biomedici. Non c’è una pagina dei prezzi, nessun modulo di registrazione, nessuna API key che si possa generare per eseguire un confronto personale con SWE-Bench Pro.

Ciò che è generalmente disponibile è Fable 5: gli stessi pesi sottostanti della classe Mythos, con classificatori di sicurezza che monitorano ogni richiesta per contenuti di cybersecurity, biologia/chimica o distillazione del modello. Quando una richiesta attiva uno di quei classificatori, Fable 5 la passa a Opus 4.8 a metà conversazione, te lo segnala e addebita la parte reindirizzata alla tariffa per token inferiore di Opus 4.8. I dati di Anthropic indicano che il tasso di attivazione è inferiore al 5% delle sessioni. Per il restante 95% e oltre, ciò che ottieni chiamando Fable 5 sono davvero i benchmark della classe Mythos sopra; per la minoranza segnalata, torni a testare Opus 4.8 contro se stesso.

Ecco perché così tanti articoli su "Mythos vs Opus" risultano vaghi ("Mythos è chiaramente migliore nei compiti complessi e multi-step") invece di essere basati su benchmark: la maggior parte degli autori non ha mai avuto Mythos da testare. Stanno semplicemente ripetendo i numeri di rilascio di Anthropic, ripetendo i numeri non attribuiti degli altri, oppure descrivendo Fable 5 e chiamandolo Mythos.

Quindi quale dovresti davvero usare

Se il tuo lavoro riguarda l’ingegneria software generale, la scrittura o l’analisi, la scelta pratica non è Mythos contro Opus 4.8 — è Fable 5 contro Opus 4.8, poiché Fable 5 è la cosa più vicina alle capacità di classe Mythos che puoi effettivamente ottenere. Fable 5 e Opus 4.8 hanno prezzi diversi ($10/$50 contro $5/$25 per milione di token), quindi il divario di 11 punti su SWE-Bench Pro deve valere all’incirca il doppio del costo perché Fable 5 risulti conveniente per carichi di lavoro sensibili al prezzo. Per i team che già instradano tra i livelli Claude in base alla difficoltà del compito, si tratta di una decisione per attività piuttosto che di una scelta unica per tutto, ed è la stessa logica di instradamento che un aggregatore API gestisce automaticamente invece di scegliere un solo livello per tutto.

Se il tuo lavoro riguarda la ricerca sulla sicurezza, lo sviluppo di exploit o la ricerca biomedica con un caso istituzionale legittimo, il divario di ExploitBench (78% contro 40%, misurando il modello non bloccato) è il numero che conta, e il vero passo successivo è fare domanda al programma di accesso fidato di Anthropic — non cercare un rivenditore che affermi di rivendere l'accesso a Mythos, che non esiste come prodotto acquistabile.

Per una panoramica completa di come Fable 5 e Mythos 5 sono collegati tra loro — stesso modello, diversa configurazione di sicurezza, e cosa comporta in pratica — vedi Fable 5 vs Mythos 5.

FAQ

Claude Mythos è più potente di Claude Opus 4.8?

Sui tre benchmark che Anthropic ha pubblicato in confronto diretto — SWE-Bench Pro, FrontierCode di Cognition e ExploitBench — sì, di 11-38 punti a seconda del benchmark. Le affermazioni che vanno oltre quei tre benchmark, inclusi i punteggi di Humanity's Last Exam o GPQA per questo confronto, non sono attribuite a nulla che Anthropic abbia rilasciato.

Posso davvero testare Claude Mythos contro Opus 4.8 da solo?

Non direttamente. Mythos 5 è limitato ai partner governativi di cyber-difesa di Project Glasswing e a un piccolo programma di accesso fidato. Quello che puoi testare è Fable 5, che condivide gli stessi pesi sottostanti e fornisce output di livello Mythos in circa il 95% delle sessioni, reindirizzando a Opus 4.8 per il resto.

Perché alcuni siti mostrano punteggi Mythos e Opus diversi?

Due motivi ricorrono ripetutamente: numeri senza una fonte rintracciabile che non compaiono nel rilascio di Anthropic e punteggi reali della classe Mythos confrontati con una versione precedente di Opus (4.6 invece di 4.8), il che gonfia il divario apparente.

Qual è la vera differenza tra Fable 5 e Mythos 5?

Sono lo stesso modello. Fable 5 esegue classificatori di sicurezza che reindirizzano le richieste relative a cybersecurity, biologia e distillazione a Opus 4.8; Mythos 5 ha queste protezioni rimosse, ma è limitato ai partner verificati. Vedi Fable 5 vs Mythos 5 per il dettaglio completo.

Opus 4.8 è più economico dei modelli di classe Mythos?

Sì. Opus 4.8 costa $5/$25 per milione di token di input/output, rispetto a $10/$50 per Fable 5 e Mythos 5. Per i carichi di lavoro che non necessitano dei miglioramenti di SWE-Bench Pro o FrontierCode, Opus 4.8 è l’opzione a costo inferiore, senza dover preoccuparsi di rerouting del classifier.

In sintesi

Tre benchmark pubblicati da Anthropic mostrano un ragionamento di classe Mythos avanti a Opus 4.8 di un margine reale e moderato. Tutto ciò che va oltre questi tre numeri — e la maggior parte di ciò che alimenta i titoli “Mythos surclassa Opus” — è privo di fonte oppure confrontato con una versione obsoleta di Opus. E, a meno che tu non sia un partner verificato per la cyber-difesa o il settore biomedico, il modello con cui in realtà verresti testato contro Opus 4.8 è Fable 5, non Mythos 5 stesso.

Fonti