Anthropic a publié exactement trois benchmarks qui comparent directement son modèle de classe Mythos à Claude Opus 4.8 : SWE-Bench Pro (80,3 % contre 69,2 %), FrontierCode de Cognition (29,3 % contre 13,4 %), et ExploitBench (78 % contre 40 %). Tous les autres chiffres associés à « Claude Mythos vs Claude Opus » qui circulent en ligne — les scores de Humanity's Last Exam, GPQA, AIME, ou des versions d'Opus autres que 4.8 — ne figurent pas dans la publication d'Anthropic. Une partie est purement inventée ; une autre compare le modèle Mythos actuel à une version d'Opus d'une génération entière antérieure.
Il y a une deuxième complication : presque personne qui compare Mythos et Opus 4.8 côte à côte n’exécute Mythos. Le modèle que la plupart des gens obtiennent lorsqu’ils appellent l’API de classe Mythos est Fable 5, qui redirige silencieusement vers Opus 4.8 dès qu’une requête touche à la cybersécurité, à la biologie ou à quelques autres domaines signalés. Ainsi, beaucoup de confrontations « Mythos vs Opus » sont, sans que l’auteur s’en rende compte, Opus 4.8 contre lui-même.
Les trois benchmarks qu’Anthropic a réellement publiés
Le lancement par Anthropic, le 9 juin 2026, de Fable 5 et Mythos 5 incluait un tableau de benchmarks comparant le modèle sous-jacent de la classe Mythos à Claude Opus 4.8. Trois résultats apparaissent de manière cohérente dans la propre publication d'Anthropic et dans des sources indépendantes qui la citent directement, notamment les analyses de The Decoder et de Vellum de la même publication :
| Benchmark | Mythos-class | Claude Opus 4.8 |
|---|---|---|
| SWE-Bench Pro (résolution réelle de problèmes GitHub) | 80.3% | 69.2% |
| FrontierCode de Cognition | 29.3% | 13.4% |
| ExploitBench (tâches de sécurité offensive) | 78% | 40% |
L'écart SWE-Bench Pro, 11,1 points, est le chiffre le plus digne d’être cité si vous décidez si le raisonnement de classe Mythos vaut la peine d’être poursuivi pour le travail de codage. Le score ExploitBench est celui qui compte le moins pour les acheteurs typiques : il mesure la capacité brute du modèle sous-jacent avant que les classificateurs de sécurité de Fable 5 n’interviennent, et en production, Fable 5 obtient un score proche de 0 % sur les tâches cyber parce que le classificateur les redirige vers Opus 4.8 avant que cette capacité ne soit jamais exposée.
Aucun chiffre publié par Anthropic ne compare Mythos-class et Opus 4.8 sur Humanity's Last Exam, GPQA Diamond, AIME ou Terminal-Bench. Si vous voyez un tableau avec ces benchmarks renseignés pour les deux modèles, demandez d'où il provient — à l'heure où nous écrivons ces lignes, il ne vient pas d'Anthropic.
Les scores répétés qu’Anthropic n’a pas publiés
La recherche de "Claude Mythos vs Claude Opus" fait apparaître plusieurs sites avec des tableaux de benchmarks détaillés pour exactement cette confrontation. La comparaison avec la publication d'Anthropic révèle deux problèmes distincts, et non un seul :
Nombres sans source traçable. La comparaison Benchlm entre Mythos 5 et Opus 4.6 indique un score de benchmark Math de 97,6 % pour Mythos contre 36,3 % pour Opus — un écart de 61 points sur un benchmark qu’aucun des documents publics des deux modèles ne mentionne sous ce nom. Aucun de ces chiffres n’apparaît dans l’annonce d’Anthropic, ni dans les comptes rendus indépendants de The Decoder ou de Vellum, ni dans aucune fiche système d’Opus 4.8.
Des chiffres réels, mauvais adversaire. La même page Benchlm indique correctement le score SWE-Bench Pro de Mythos-class, 80,3 %, correspondant au vrai chiffre d'Anthropic, mais le compare à 53,4 % de Claude Opus 4.6 au lieu des 69,2 % d'Opus 4.8. Opus 4.6 précède le lancement de Fable 5/Mythos 5 de plusieurs cycles de publication, donc le comparer au chiffre plus récent de Mythos fabrique un écart de 27 points là où la comparaison de la génération actuelle en montre 11.
Aucun des deux motifs ne rend fausse l’affirmation sous-jacente — à savoir que le raisonnement de classe Mythos surpasse Opus 4.8 en matière de codage et de tâches agentiques. L’écart de 11 points sur SWE-Bench Pro est bien réel. Mais un écart de 11 points et un écart artificiel de 44 points mènent à des conclusions différentes sur la supériorité réelle de Mythos, et un seul de ces chiffres provient d’Anthropic.
Pourquoi la plupart des personnes qui posent cette question ne peuvent pas le tester elles-mêmes
Voici la partie que les tableaux de benchmark omettent : Mythos 5 n'est pas un modèle que vous pouvez appeler. Anthropic le fournit uniquement aux partenaires de Project Glasswing — les défenseurs cyber du gouvernement américain — dans le cadre d'un programme d'accès de confiance qui s'ouvre aux organisations de cybersécurité et, séparément, aux chercheurs en biomédecine. Il n'existe pas de page de tarification, pas de formulaire d'inscription, pas de clé API que vous puissiez générer pour exécuter votre propre comparaison SWE-Bench Pro.
Ce qui est généralement disponible, c’est Fable 5 : les mêmes poids sous-jacents de classe Mythos, avec des classificateurs de sécurité qui surveillent chaque requête pour des contenus de cybersécurité, de biologie/chimie ou de distillation de modèle. Lorsqu’une requête déclenche l’un de ces classificateurs, Fable 5 la transmet à Opus 4.8 au milieu de la conversation, vous l’indique, et facture la portion redirigée au tarif inférieur par jeton d’Opus 4.8. Les propres données d’Anthropic placent le taux de déclenchement en dessous de 5 % des sessions. Pour les autres 95 % et plus, ce que vous obtenez en appelant Fable 5 correspond réellement aux benchmarks de classe Mythos ci-dessus ; pour la minorité signalée, vous revenez à tester Opus 4.8 contre lui-même.
C'est pourquoi tant de comptes rendus « Mythos vs Opus » sont vagues (« Mythos est clairement meilleur pour les tâches complexes à étapes multiples ») plutôt que fondés sur des benchmarks : la plupart des auteurs n'ont jamais eu Mythos à tester. Ils se contentent soit de répéter les chiffres de lancement d'Anthropic, soit de répéter les chiffres non sourcés des uns et des autres, soit de décrire Fable 5 en l'appelant Mythos.
Alors, lequel devriez-vous réellement utiliser
Si votre travail relève de l’ingénierie logicielle générale, de la rédaction ou de l’analyse, le choix pratique n’est pas Mythos contre Opus 4.8 — c’est Fable 5 contre Opus 4.8, puisque Fable 5 est ce qui se rapproche le plus d’une capacité de classe Mythos que vous pouvez réellement obtenir. Fable 5 et Opus 4.8 ont des tarifs différents ($10/$50 contre $5/$25 par million de tokens), donc l’écart de 11 points sur SWE-Bench Pro doit valoir à peu près le double du coût pour que Fable 5 soit rentable sur des charges de travail sensibles au prix. Pour les équipes qui orientent déjà les requêtes entre les niveaux Claude selon la difficulté de la tâche, il s’agit d’une décision par tâche plutôt que d’un choix global, et c’est la même logique d’orientation qu’un API aggregator gère automatiquement au lieu de choisir un seul niveau pour tout.
Si votre travail concerne la recherche en sécurité, le développement d’exploits ou la recherche biomédicale dans le cadre légitime d’une institution, l’écart d’ExploitBench (78 % contre 40 %, en mesurant le modèle non bloqué) est le chiffre qui compte, et la véritable étape suivante consiste à postuler au programme d’accès de confiance d’Anthropic — et non à chercher un fournisseur prétendant revendre l’accès à Mythos, qui n’existe pas en tant que produit achetable.
Pour une analyse complète de la relation entre Fable 5 et Mythos 5 — même modèle, configuration de sécurité différente, et ce que cela vous coûte en pratique — consultez Fable 5 vs Mythos 5.
FAQ
Claude Mythos est-il plus puissant que Claude Opus 4.8 ?
Sur les trois benchmarks qu’Anthropic a publiés en comparaison directe — SWE-Bench Pro, FrontierCode de Cognition et ExploitBench — oui, de 11 à 38 points selon le benchmark. Les affirmations au-delà de ces trois benchmarks, y compris les scores Humanity's Last Exam ou GPQA pour cette comparaison, ne sont étayées par rien qu’Anthropic ait publié.
Puis-je vraiment tester Claude Mythos moi-même face à Opus 4.8 ?
Pas directement. Mythos 5 est réservé aux partenaires gouvernementaux de cyberdéfense de Project Glasswing et à un petit programme d’accès de confiance. Ce que vous pouvez tester, c’est Fable 5, qui partage les mêmes poids sous-jacents et fournit une sortie de classe Mythos dans environ 95 % des sessions, avec un basculement vers Opus 4.8 pour le reste.
Pourquoi certains sites affichent-ils des scores Mythos différents de ceux d'Opus ?
Deux raisons reviennent régulièrement : des chiffres sans source vérifiable qui n’apparaissent pas dans la publication d’Anthropic, et de véritables scores de classe Mythos comparés à une version plus ancienne d’Opus (4.6 au lieu de 4.8), ce qui gonfle l’écart apparent.
Quelle est la vraie différence entre Fable 5 et Mythos 5 ?
Ce sont le même modèle. Fable 5 exécute des classificateurs de sécurité qui redirigent les requêtes liées à la cybersécurité, à la biologie et à la distillation vers Opus 4.8 ; Mythos 5 a ces garde-fous levés, mais est réservé aux partenaires vérifiés. Voir Fable 5 vs Mythos 5 pour le détail complet.
Opus 4.8 est-il moins cher que les modèles de classe Mythos ?
Oui. Opus 4.8 coûte 5 $/25 $ par million de tokens d’entrée/sortie, contre 10 $/50 $ pour Fable 5 et Mythos 5. Pour les charges de travail qui n’ont pas besoin des gains SWE-Bench Pro ou FrontierCode, Opus 4.8 est l’option la moins chère, sans reroutage de classificateur à craindre.
Conclusion
Trois benchmarks publiés par Anthropic montrent un raisonnement de classe Mythos devant Opus 4.8 avec une marge réelle et modérée. Tout ce qui vient après ces trois chiffres — et la majeure partie de ce qui alimente les titres du type « Mythos écrase Opus » — est soit sans source, soit comparé à une version obsolète d’Opus. Et à moins que vous ne soyez un partenaire vérifié en cyberdéfense ou en biomédecine, le modèle contre lequel vous testeriez réellement face à Opus 4.8 est Fable 5, et non Mythos 5 lui-même.
