Claude Opus 5.5 High ist kein Gerücht, sondern ein veröffentlichtes Modell. Die viel zitierte „1.509 und Platz 1 in der Text Arena“ beschreibt allerdings nur den Stand einer Rangliste zu einem bestimmten Zeitpunkt – keine dauerhaft gültige Produkteigenschaft. Für die Kaufentscheidung zählt etwas anderes: Rechtfertigen anspruchsvolle Coding- und Rechercheaufgaben das dauerhaft aktive adaptive Thinking, längere Läufe mit hohem Aufwand und eine API-Migration, bei der neue 400-Fehler auftreten können?
Was Anthropic tatsächlich veröffentlicht hat
Anthropic hat Claude Opus 5.5 angekündigt und am 22. September 2026 als erstes Modell der Claude-5.5-Familie veröffentlicht. Laut offizieller Mitteilung ist es über Claude und die API verfügbar und für agentisches Coding, Computernutzung und Wissensarbeit gedacht. Die direkte Modell-ID lautet claude-opus-5-5. Das Standard-Kontextfenster umfasst 1 Million Tokens, die standardmäßige maximale Ausgabe 128.000 Tokens.
| Fakt | Claude Opus 5.5 | Was daraus nicht folgt |
|---|---|---|
| Veröffentlichungsdatum | 22. September 2026 | Dass jeder Gateway denselben Endpunkt oder Preis verwendet |
| API-Modell-ID | claude-opus-5-5 | Dass ältere Opus-5-Integrationen ohne Anpassungen kompatibel sind |
| Kontextfenster | 1 Million Tokens | Dass ein vollständig genutztes Fenster jede Aufgabe verbessert |
| Standardaufwand | Medium | Dass Medium genauso arbeitet wie der frühere Standardmodus von Opus 5 |
| Thinking | Adaptiv und immer aktiviert | Dass die Latenz vorhersehbar bleibt |
Anthropic schreibt in der eigenen Ankündigung, Opus 5.5 erreiche bei den meisten Aufgaben das Niveau von Claude Fable 5.1 und sei bei typischen Workloads 40 % günstiger als Opus 5. Das sind Herstellerangaben. Anthropic weist außerdem selbst darauf hin, dass Benchmark-Abstände zunehmend weniger zuverlässig auf Unterschiede im Praxiseinsatz schließen lassen.
Was der Text-Arena-Wert von 1.509 aussagt
Text Arena meldete, dass Claude Opus 5.5 High mit 1.509 Punkten auf Platz 1 eingestiegen sei – 18 Punkte vor Opus 5 High. Das ist ein starkes Signal für die aktuelle Nutzerpräferenz unter den Bedingungen der Arena, aber kein universeller Test für Coding, Tool-Nutzung oder faktische Genauigkeit.
Der Wert kann sich schnell verändern. Spätere Tracker zeigten andere Punktzahlen und bestätigten damit, dass Arena-Rankings immer eine Momentaufnahme sind. In derselben Ankündigung wurde Opus 5.5 High außerdem mit einem kombinierten Preis von 16 $ pro Million Tokens an der Pareto-Frontier eingeordnet. Für die Budgetplanung sollte dieser Mischwert jedoch nicht die offizielle API-Preisliste ersetzen.
Die Unsicherheit ist relevant: Ein Nutzer merkte unter der Arena-Ankündigung an, dass der Abstand von 18 Punkten kleiner als die Fehlerbalken sei. Die Rangliste ist deshalb ein sinnvolles Signal für eigene Tests, aber kein Beleg dafür, dass Opus 5.5 High bei jeder Aufgabe jedes andere Modell schlägt.
„1509 gegenüber 1491 – 18 Punkte. Ehrlich gesagt ist dieser Abstand kleiner als die Fehlerbalken.“ — @Avery_Coree als Antwort auf die Ankündigung von Text Arena (Quelle)
Die Belege jenseits der Rangliste
In Anthropics veröffentlichter Tabelle erreicht Opus 5.5 bei Terminal-Bench 4.0 66,4 %, bei FrontierCode Main 54,4 %, bei CursorBench 4.0 57,8 % und bei GDPval-AA v2.1 1.846 Elo. Es gibt aber auch Gegenbeispiele: GPT-6 Astra kommt bei AutomationBench auf 41,4 % gegenüber 40,0 % für Opus 5.5 und bei Terminal-Bench-Science auf 64,6 % gegenüber 58,7 %.
| Evaluation | Opus 5.5 | Relevanter Vergleich |
|---|---|---|
| Terminal-Bench 4.0 | 66,4 % | Fable 5.1: 55,8 %; GPT-6 Astra: 57,9 % |
| FrontierCode Main | 54,4 % | GPT-6 Astra: 53,3 % |
| CursorBench 4.0 | 57,8 % | Opus 5: 46,6 % |
| GDPval-AA v2.1 | 1.846 Elo | Fable 5.1: 1.735; Opus 5: 1.708 |
| AutomationBench | 40,0 % | GPT-6 Astra: 41,4 % |
| Terminal-Bench-Science | 58,7 % | GPT-6 Astra: 64,6 % |
Diese Zahlen sind nur zusammen mit den jeweiligen Einstellungen aussagekräftig. Anthropic ließ die meisten Opus-5.5-Evaluierungen mit maximalem adaptivem Aufwand laufen. Bei Terminal-Bench wurde Opus 5.5 mit xhigh getestet, Astra dagegen mit high. Der angegebene Standardfehler von Terminal-Bench liegt für Opus 5.5 bei ±2,6 Punkten. Enge Ergebnisse sollten daher nicht als exakte Rangfolge gelesen werden.
Unabhängige Tests weisen in eine ähnliche Richtung, zeigen aber wichtige Einschränkungen. Sonars Java-Evaluierung kam bei Opus 5.5 High auf eine Erfolgsquote von 87,68 %, bei Opus 5 auf 88,6 %. Gleichzeitig sank der Umfang des erzeugten Codes von 916.813 auf 664.890 Zeilen, die Gesamtzahl der Findings von 18.814 auf 10.941. In derselben Untersuchung stieg die Fehlerdichte von 576 auf 644 Fehler pro Million Zeilen, außerdem nahmen Concurrency-Findings zu. Das spricht dafür, automatisierte Tests fest einzuplanen – nicht dafür, generierten Code ungeprüft zu übernehmen.
Für welche Aufgaben sich Claude Opus 5.5 High zum Testen lohnt
Der überzeugendste Anwendungsfall sind lange, toolgestützte Aufgaben, bei denen gute Planung und weniger Wiederholungen wichtiger sind als eine sofortige Antwort. Anthropic berichtet von einem Audit mit 200.000 Zeilen, das in weniger als drei Stunden abgeschlossen wurde – gegenüber mehr als 20 Stunden mit Opus 5. Außerdem soll eine Umschreibung von HAProxy von C nach Rust in 9,5 Stunden gelungen sein, verglichen mit 12 Stunden bei Fable 5.1. Diese Beispiele stammen von Anthropic und sollten daher als Hypothesen für einen Pilotversuch verstanden werden, nicht als Versprechen.
Auch echte Nutzer beschreiben dieses Muster, wenn auch keineswegs einheitlich. Ein Reddit-Nutzer berichtete, eine Website in etwa vier Minuten mit besserem Design neu aufgebaut zu haben. Ein anderer schrieb, Opus 5.5 höre bei der Orchestrierung „einfach nicht auf“. Bei der Schreibqualität fällt das Urteil allerdings nicht durchgehend positiv aus: @rchitectopteryx bezeichnete sie als „den schlechtesten Textmüll, den ich je beim Schreiben gesehen habe“. Die praktische Empfehlung muss deshalb aufgabenbezogen bleiben: Zuerst mehrstufiges Coding, Repository-Audits und Rechercheaufgaben mit objektiven Abnahmekriterien testen – nicht ausschließlich geschmackssensitive Texte.
„Was mir bei Opus 5.5 aufgefallen ist: Es hört einfach nicht auf. Gib ihm eine Aufgabe in der Orchestrierung, und es läuft und läuft.“ — @bridgerloftin (Quelle)
Preise, Aufwand und die Kosten des Wartens
Die offiziellen direkten API-Preise liegen bei 4 $ pro Million Input-Tokens, 20 $ pro Million Output-Tokens und 0,20 $ pro Million aus dem Cache gelesener Tokens. Cache-Schreibvorgänge kosten 5 $ pro Million Tokens. Anthropic zufolge ergeben die niedrigeren Preise zusammen mit weniger Tokens pro Aufgabe eine typische Kostenersparnis von 40 % gegenüber Opus 5. Wie hoch die tatsächliche Ersparnis ausfällt, hängt von Cache-Treffern, Aufwand, Wiederholungen und eingesetzten Tools ab.
| API-Posten | Opus 5.5 | Opus 5 |
|---|---|---|
| Input / 1 Mio. Tokens | 4 $ | 5 $ |
| Output / 1 Mio. Tokens | 20 $ | 25 $ |
| Cache-Lesen / 1 Mio. Tokens | 0,20 $ | 0,50 $ |
| Fünfminütiger Cache-Schreibvorgang / 1 Mio. | 5 $ | 6,25 $ |
| Fast-Modus | 8 $ Input / 40 $ Output | — |
Mehr Aufwand bedeutet nicht automatisch ein besseres Preis-Leistungs-Verhältnis. Die unabhängige Analyse von BitsMinds nennt auf Basis von Artificial Analysis Kosten pro Aufgabe von 1,34 $ bei medium, 1,82 $ bei high, 3,46 $ bei xhigh und 5,98 $ bei max. Die zugehörigen Benchmark-Werte lagen bei 51, 54, 56 und 58. Wenn eine Aufgabe keine maximale Planungstiefe erfordert, kann high oder medium der bessere Betriebspunkt sein.
Was vor dem API-Wechsel geprüft werden sollte
Claude Opus 5.5 ist kein Upgrade, bei dem lediglich der Modellname ausgetauscht wird. Anthropics Migrationshinweise und unabhängige Tests nennen vier Änderungen, die einen Test in der Staging-Umgebung verdienen:
- Thinking lässt sich nicht deaktivieren. Anfragen mit deaktiviertem Thinking oder einem manuellen Thinking-Budget können mit HTTP 400 fehlschlagen. Verwende stattdessen adaptives Thinking und steuere den Aufwand.
- Die erzwungene Tool-Auswahl hat sich geändert. Werte wie
anyoder ein namentlich angegebenes Tool werden vontool_choicenicht mehr akzeptiert. Die Schleife muss auf unterstützte automatische Auswahl und Validierung umgebaut werden. - Thinking-Blöcke hängen vom Gesprächsverlauf ab. Übernommene Thinking-Blöcke müssen wie vorgeschrieben erhalten bleiben. Änderungen an Nachrichten- oder Tool-Verläufen sollten separat getestet werden.
- Die Fortschrittsanzeige funktioniert anders. Text zwischen Tool-Aufrufen kann in Thinking-Blöcken eintreffen. Oberflächen für den Fortschritt müssen daher Blocktypen auswerten, statt davon auszugehen, dass sichtbarer Text immer im ersten Inhaltselement steht.
Führe diese Prüfungen mit einem Staging-Schlüssel durch, bevor du Produktivtraffic umleitest. Halte den alten Endpunkt verfügbar, bis erfolgreiche Abschlüsse, Wiederholungen, Latenz, abgerechnete Tokens und der Zeitaufwand für menschliche Korrekturen verglichen sind.
Ein praxisnaher Pilot für Opus 5.5 High
Verwende eine klar begrenzte Aufgabe statt eines Prompts für die Rangliste:
- Wähle 20 bereits gelöste Tickets, Audits oder Rechercheergebnisse aus.
- Führe Opus 5.5 mit medium und high aus – mit identischen Tools und Abnahmetests.
- Erfasse Abschlussquote, Wiederholungen, verstrichene Zeit, Input-, Output- und Cache-Tokens sowie die Minuten für die Prüfung.
- Untersuche Concurrency-, Sicherheits- und Faktenfehler getrennt. Verstecke sie nicht in einer einzigen Gesamtwertung.
- Vergleiche die Kosten pro akzeptiertem Ergebnis, nicht die Kosten pro Anfrage.
- Verwende max nur für Aufgaben, bei denen der Qualitätsgewinn die zusätzliche Wartezeit und den höheren Tokenverbrauch rechtfertigt.
Ein Modellwechsel ist dann gerechtfertigt, wenn Opus 5.5 bei wiederkehrenden Aufgaben die gesamten Lieferkosten oder den Prüfaufwand senkt. Der Platz in der Arena allein reicht dafür nicht aus.
FAQ zu Claude Opus 5.5 High
Ist Claude Opus 5.5 High offiziell veröffentlicht?
Claude Opus 5.5 wurde am 22. September 2026 offiziell von Anthropic veröffentlicht. „High“ bezeichnet eine Aufwandskonfiguration, die bei Evaluierungen und in Tools verwendet wird. Es handelt sich nicht um eine separate Produktankündigung mit einer eigenen Modellidentität.
Ist 1.509 noch der aktuelle Wert in der Text Arena?
Nicht unbedingt. 1.509 war der Wert in der Arena-Ankündigung vom 26. September. Spätere Tracker zeigten andere Momentaufnahmen. Wer die Zahl zitiert, sollte deshalb immer Datum und Quelle nennen.
Ist Opus 5.5 High besser als Fable 5.1?
Opus 5.5 führt bei mehreren veröffentlichten Evaluierungen und ist pro Token günstiger. Anthropic weist jedoch darauf hin, dass der Abstand in der Praxis geringer ausfällt, als es die Benchmark-Werte vermuten lassen. Fable kann bei einem bestimmten Repository, Workflow oder einer komplexen Aufgabe über mehrere Dateien hinweg weiterhin besser abschneiden. Teste daher beide Modelle mit demselben Pilotprojekt.
Was kostet Claude Opus 5.5?
Die direkte API-Basis liegt bei 4 $ pro Million Input-Tokens, 20 $ pro Million Output-Tokens, 0,20 $ pro Million aus dem Cache gelesener Tokens und 5 $ pro Million fünfminütiger Cache-Schreibvorgänge. Gateway-Preise und die Nutzung über ein Abonnement können davon abweichen.
Sollte ich den maximalen Aufwand verwenden?
In der Regel nicht. Starte mit medium oder high, miss die Qualität akzeptierter Ergebnisse und die Gesamtkosten und reserviere max für Aufgaben, die von tieferer Planung profitieren. Maximaler Aufwand kann die Benchmark-Werte verbessern, zugleich aber Latenz und Tokenverbrauch erhöhen.
Die Entscheidung ist trotz der unruhigen Rangliste überschaubar: Wähle Claude Opus 5.5 High für einen gemessenen Workflow mit langen Aufgabenketten, wenn die bessere Abschlussqualität die Wartezeit und den Migrationsaufwand überwiegt. Für kurze, latenzkritische oder stark stilabhängige Aufgaben solltest du eine günstigere oder schnellere Route beibehalten, bis ein eigener Pilot einen klaren Vorteil zeigt.