Claude Mythos vs Claude Opus 4.8: Die verifizierten Benchmarks

Zuletzt aktualisiert: 2026-07-15 02:17:22

Anthropic hat genau drei Benchmarks veröffentlicht, die sein Mythos-class-Modell direkt mit Claude Opus 4.8 vergleichen: SWE-Bench Pro (80,3 % vs. 69,2 %), Cognition's FrontierCode (29,3 % vs. 13,4 %) und ExploitBench (78 % vs. 40 %). Jede andere Zahl, die online zu „Claude Mythos vs. Claude Opus“ kursiert — Humanity's Last Exam-Scores, GPQA, AIME oder Opus-Versionen außer 4.8 — stammt nicht aus der Veröffentlichung von Anthropic. Ein Teil davon ist schlicht erfunden; ein anderer Teil stellt das aktuelle Mythos-Modell einer Opus-Version gegenüber, die ihm eine ganze Generation hinterherhinkt.

Es gibt eine zweite Komplikation: Fast niemand, der Mythos und Opus 4.8 direkt nebeneinander vergleicht, führt tatsächlich Mythos aus. Das Modell, das die meisten Leute erhalten, wenn sie die Mythos-Klasse-API aufrufen, ist Fable 5, das stillschweigend zu Opus 4.8 umleitet, sobald eine Anfrage Cybersicherheit, Biologie oder einige andere markierte Bereiche berührt. Daher sind viele „Mythos vs. Opus“-Direktvergleiche, ohne dass der Autor es bemerkt, Opus 4.8 gegen sich selbst.

Die drei Benchmarks, die Anthropic tatsächlich veröffentlicht hat

Anthropics Veröffentlichung von Fable 5 und Mythos 5 am 9. Juni 2026 umfasste eine Benchmark-Tabelle, die das zugrunde liegende Mythos-Klassenmodell mit Claude Opus 4.8 verglich. Drei Ergebnisse erscheinen durchgehend sowohl in Anthropics eigener Veröffentlichung als auch in unabhängigen Quellen, die direkt darauf verweisen, darunter The Decoders und Vellums Aufschlüsselungen derselben Veröffentlichung:

BenchmarkMythos-classClaude Opus 4.8
SWE-Bench Pro (reale GitHub-Issue-Behebung)80.3%69.2%
Cognitions FrontierCode29.3%13.4%
ExploitBench (offensive Sicherheitsaufgaben)78%40%

Die SWE-Bench-Pro-Lücke von 11,1 Punkten ist die am besten zitierbare Zahl, wenn Sie entscheiden, ob sich das Verfolgen von Mythos-Klasse-Reasoning für Programmierarbeiten lohnt. Der ExploitBench-Score ist für typische Käufer derjenige, der am wenigsten zählt: Er misst die rohe Fähigkeit des zugrunde liegenden Modells, bevor Fable 5s Sicherheitsklassifikatoren eingreifen, und in der Produktion erzielt Fable 5 bei Cyber-Aufgaben Werte nahe 0 %, weil der Klassifikator sie an Opus 4.8 weiterleitet, bevor diese Fähigkeit überhaupt offengelegt wird.

Keine von Anthropic veröffentlichte Zahl setzt Mythos-Klasse und Opus 4.8 beim Humanity's Last Exam, GPQA Diamond, AIME oder Terminal-Bench direkt gegeneinander. Wenn Sie eine Tabelle sehen, in der diese Benchmarks für beide Modelle ausgefüllt sind, fragen Sie nach der Quelle — zum Zeitpunkt dieses Schreibens stammt sie nicht von Anthropic.

Die wiederholten Punktzahlen, die Anthropic nicht veröffentlicht hat

Die Suche nach "Claude Mythos vs Claude Opus" liefert mehrere Websites mit detaillierten Benchmark-Tabellen genau für dieses Duell. Beim Abgleich mit Anthropic's Veröffentlichung zeigen sich zwei separate Probleme, nicht nur eines:

Numern ohne nachvollziehbare Quelle. Benchlms Mythos-5-vs-Opus-4.6-Vergleich nennt für Mythos einen Math-Benchmark-Score von 97.6% gegenüber 36.3% für Opus — ein Abstand von 61 Punkten bei einem Benchmark, den die öffentlichen Materialien beider Modelle unter diesem Namen nicht erwähnen. Keine der beiden Zahlen erscheint in Anthonics Ankündigung, in den unabhängigen Berichten von The Decoder oder Vellum dazu oder in einer Opus-4.8-Systemkarte.

Echte Zahlen, falscher Gegner. Dieselbe Benchlm-Seite gibt Mythos-classs eigenen SWE-Bench-Pro-Score korrekt mit 80,3 % an und entspricht damit Anthropics tatsächlichem Wert, setzt ihn jedoch gegen Claude Opus 4.6s 53,4 % statt gegen Opus 4.8s 69,2 %. Opus 4.6 liegt mehrere Release-Zyklen vor dem Start von Fable 5/Mythos 5, sodass der Vergleich mit dem neueren Mythos-Wert eine Lücke von 27 Punkten erzeugt, wo der Vergleich der aktuellen Generation 11 zeigt.

Keines der beiden Muster macht die zugrunde liegende Behauptung — dass Mythos-Klassen-Reasoning Opus 4.8 bei Coding- und agentischen Aufgaben übertrifft — falsch. Der 11-Punkte-Abstand bei SWE-Bench Pro ist real. Aber ein 11-Punkte-Abstand und ein künstlich erzeugter 44-Punkte-Abstand führen zu unterschiedlichen Schlussfolgerungen darüber, wie viel besser Mythos tatsächlich ist, und nur eine dieser Zahlen stammt von Anthropic.

Warum die meisten Menschen, die diese Frage stellen, es nicht selbst testen können

Hier ist der Teil, den die Benchmark-Tabellen auslassen: Mythos 5 ist kein Modell, das man aufrufen kann. Anthropic stellt es nur Projekt-Glasswing-Partnern zur Verfügung – US-amerikanischen Cyber-Verteidigern der Regierung – mit einem Trusted-Access-Programm, das für Cybersicherheitsorganisationen und, separat, für biomedizinische Forscher geöffnet wird. Es gibt keine Preisseite, kein Anmeldeformular, keinen API-Schlüssel, den Sie generieren können, um Ihren eigenen SWE-Bench-Pro-Vergleich auszuführen.

Allgemein verfügbar ist Fable 5: dieselben zugrunde liegenden Gewichte der Mythos-Klasse, mit Sicherheitsklassifikatoren, die jede Anfrage auf Inhalte zu Cybersecurity, Biologie/Chemie oder Model-Distillation prüfen. Wenn eine Anfrage einen dieser Klassifikatoren auslöst, übergibt Fable 5 sie mitten im Gespräch an Opus 4.8, teilt Ihnen mit, dass dies geschehen ist, und berechnet den umgeleiteten Teil zum niedrigeren Preis pro Token von Opus 4.8. Anthropics eigene Daten beziffern die Auslösungsrate auf unter 5 % der Sitzungen. Für die übrigen mehr als 95 % sind die Ergebnisse, die Sie durch den Aufruf von Fable 5 erhalten, tatsächlich die oben genannten Benchmarks der Mythos-Klasse; für die markierte Minderheit testen Sie Opus 4.8 wieder gegen sich selbst.

Deshalb klingen so viele „Mythos vs Opus“-Berichte vage („Mythos ist bei komplexen, mehrstufigen Aufgaben eindeutig besser“) statt belegt: Die meisten Autoren hatten Mythos nie zum Testen. Sie wiederholen entweder Anthropics eigene Release-Zahlen, wiederholen die nicht belegten Zahlen der anderen oder beschreiben Fable 5 und nennen es Mythos.

Welche sollten Sie also tatsächlich verwenden

Wenn Ihre Arbeit allgemeine Softwareentwicklung, Schreiben oder Analyse umfasst, ist die praktische Wahl nicht Mythos vs Opus 4.8 — sondern Fable 5 vs Opus 4.8, da Fable 5 dem Mythos-Niveau am nächsten kommt, das Sie tatsächlich bekommen können. Fable 5 und Opus 4.8 sind unterschiedlich bepreist ($10/$50 vs $5/$25 pro Million Tokens), daher muss die 11-Punkte-SWE-Bench-Pro-Lücke ungefähr den doppelten Preis wert sein, damit sich Fable 5 bei preissensiblen Workloads rechnet. Für Teams, die bereits je nach Aufgabenschwierigkeit zwischen Claude-Tiers routen, ist das eine Entscheidung pro Aufgabe statt eine pauschale, und es ist dieselbe Routing-Logik, die ein API aggregator automatisch übernimmt, anstatt einen Tier für alles zu wählen.

Wenn Ihre Arbeit Sicherheitsforschung, Exploit-Entwicklung oder biomedizinische Forschung mit einem legitimen institutionellen Fall ist, ist die ExploitBench-Lücke (78 % vs. 40 %, gemessen am nicht blockierten Modell) die Zahl, auf die es ankommt, und der eigentliche nächste Schritt ist, sich für das Trusted-Access-Programm von Anthropic zu bewerben — nicht bei einem Anbieter einzukaufen, der behauptet, Mythos-Zugang weiterzuverkaufen, was als kaufbares Produkt nicht existiert.

Für eine vollständige Aufschlüsselung, wie Fable 5 und Mythos 5 miteinander zusammenhängen — dasselbe Modell, unterschiedliche Sicherheitskonfiguration und was dich das in der Praxis kostet — siehe Fable 5 vs Mythos 5.

FAQ

Ist Claude Mythos leistungsstärker als Claude Opus 4.8?

Bei den drei Benchmarks, die Anthropic direkt veröffentlicht gegenübergestellt hat — SWE-Bench Pro, Cognitions FrontierCode und ExploitBench — ja, um 11 bis 38 Punkte, je nach Benchmark. Behauptungen über diese drei Benchmarks hinaus, einschließlich Humanity's Last Exam oder GPQA-Werten für dieses Duell, sind durch nichts belegt, was Anthropic veröffentlicht hat.

Kann ich Claude Mythos tatsächlich selbst gegen Opus 4.8 testen?

Nicht direkt. Mythos 5 ist auf die staatlichen Cyberabwehr-Partner von Project Glasswing und ein kleines Trusted-Access-Programm beschränkt. Was Sie testen können, ist Fable 5, das dieselben zugrunde liegenden Gewichte teilt und in etwa 95 % der Sitzungen Mythos-Klasse-Ausgaben liefert, während für den Rest auf Opus 4.8 umgeleitet wird.

Warum zeigen einige Websites unterschiedliche Mythos- und Opus-Scores?

Zwei Gründe tauchen immer wieder auf: Zahlen ohne nachvollziehbare Quelle, die in Anthropics Veröffentlichung nicht auftauchen, und echte Mythos-Class-Scores, die mit einer älteren Opus-Version (4.6 statt 4.8) verglichen werden, wodurch die scheinbare Lücke aufgebläht wird.

Was ist der echte Unterschied zwischen Fable 5 und Mythos 5?

Es ist dasselbe Modell. Fable 5 führt Sicherheitsklassifikatoren aus, die Anfragen zu Cybersicherheit, Biologie und Destillation an Opus 4.8 weiterleiten; bei Mythos 5 sind diese Schutzmaßnahmen aufgehoben, aber es ist auf geprüfte Partner beschränkt. Siehe Fable 5 vs Mythos 5 für die vollständige Aufschlüsselung.

Ist Opus 4.8 günstiger als die Modelle der Mythos-Klasse?

Ja. Opus 4.8 kostet 5 $/25 $ pro Million Input-/Output-Token, im Vergleich zu 10 $/50 $ für Fable 5 und Mythos 5. Für Workloads, die die Gewinne von SWE-Bench Pro oder FrontierCode nicht benötigen, ist Opus 4.8 die kostengünstigere Option, ohne dass man sich um Classifier-Umleitungen sorgen muss.

Kurz gesagt

Drei von Anthropic veröffentlichte Benchmarks zeigen, dass Mythos-klassisches Reasoning Opus 4.8 mit einem echten, moderaten Vorsprung übertrifft. Alles jenseits dieser drei Zahlen — und das meiste, was die Schlagzeilen „Mythos überrollt Opus“ antreibt — ist entweder nicht belegt oder vergleicht mit einer veralteten Opus-Version. Und sofern Sie nicht ein verifizierter Cyber-Defense- oder biomedizinischer Partner sind, wäre das Modell, gegen das Sie tatsächlich Opus 4.8 testen würden, Fable 5, nicht Mythos 5 selbst.

Quellen