Was ist neu in Claude Haiku 5.5
Anthropic hat Claude Haiku 5.5 am 7. Oktober 2026 veröffentlicht, ein Jahr nach Haiku 4.5. Der Preis sank bei kurzen Prompts um 90 % und das Modell rückte deutlich näher an Sonnet heran.
Das erste Haiku mit Effort-Steuerung
Haiku 5.5 nutzt adaptives Denken und fünf Effort-Stufen: low, medium, high, xhigh und max. Der Standardwert ist medium. Frühere Haiku-Modelle hatten keine Effort-Einstellung.
1M Kontext und 128K Output
Das Kontextfenster wächst von 200K Tokens bei Haiku 4.5 auf 1M und der maximale Output von 64K auf 128K. Es akzeptiert Text- und Bildeingaben. Der Wissensstand reicht bis Juni 2026.
Ein großer Sprung bei Agenten- und Büroaufgaben
Bei max effort berichtet Anthropic von 72,4 % bei OSWorld 2.1 (Haiku 4.5: 15,7 %) und einem GDPval-AA-Elo von 1620 (Haiku 4.5: 735). Sonnet 5.5 führt weiterhin bei jedem von Anthropic veröffentlichten Benchmark.
Unabhängige Bewertung
Artificial Analysis gibt Haiku 5.5 bei max effort einen Score von 43 auf seinem Intelligence Index (zuvor 17 bei Haiku 4.5) und 34 bei der standardmäßigen medium-Einstellung.
Claude Haiku 5.5 vs. Haiku 4.5 vs. Sonnet 5.5
Alle diese Modelle laufen über denselben AIReiter-Key, sodass ein Wechsel lediglich eine Änderung im model-Feld erfordert.
Haiku 5.5 vs. Haiku 4.5
Haiku 4.5 ist mit 1 $ Input und 5 $ Output pro Million Tokens gelistet. Haiku 5.5 liegt bei 0,10 $ und 0,50 $ für Prompts bis zu 100K Tokens. Anthropic schätzt, dass reale Workloads nach Berücksichtigung des neueren Tokenizers, der für denselben Text rund 30 % mehr Tokens erzeugt, etwa 75 % weniger kosten.
Haiku 5.5 vs. Sonnet 5.5
Sonnet 5.5 kostet hier 1,00 $ Input und 5,00 $ Output pro Million Tokens – das Zwanzigfache des Basispreises von Haiku 5.5. Anthropic empfiehlt weiterhin Sonnet 5.5 oder Opus 5.5 für komplexes Coding. Nutzen Sie Haiku 5.5 für Klassifizierung, Extraktion, Zusammenfassungen, Routing und Subagenten-Schritte.
Haiku 5.5 vs. GPT-6 Luna
Beide sind mit 0,10 $ Input und 0,50 $ Output gelistet. Anthropic berichtet, dass Haiku 5.5 bei OSWorld 2.1 (72,4 % vs. 48,9 %) und GDPval-AA (1620 vs. 1437) vorne liegt. Artificial Analysis merkt an, dass Haiku 5.5 mehr Output-Tokens als Luna benötigt, um ähnliche Werte zu erreichen – vergleichen Sie dies daher anhand Ihrer eigenen Aufgaben.
Claude Haiku 5.5 API-Preise auf AIReiter
Jeder Posten wird mit 50 % des Anthropic-Listenpreises abgerechnet. Der Tarif hängt davon ab, wie viele Input-Tokens eine einzelne Anfrage sendet.
Bis zu 100K Input-Tokens
Input 0,05 $ (Listenpreis 0,10 $). Output 0,25 $ (Listenpreis 0,50 $). Cache-Reads 0,005 $ (Listenpreis 0,01 $). Cache-Writes 0,0625 $ (Listenpreis 0,125 $). Alle Preise pro Million Tokens.
Über 100K Input-Tokens: Alle Tarife 5x
Input 0,25 $ (Listenpreis 0,50 $). Output 1,25 $ (Listenpreis 2,50 $). Cache-Reads 0,025 $ (Listenpreis 0,05 $). Cache-Writes 0,3125 $ (Listenpreis 0,625 $). Die Preisstufe wird pro Anfrage anhand des gesamten Inputs einschließlich zwischengespeicherter Tokens ermittelt und gilt für die gesamte Anfrage.
Zwei praxisnahe Aufrufe
50K Input plus 5K Output kosten hier 0,00375 $ (0,0075 $ Listenpreis). 200K Input plus 10K Output fallen in die Long-Context-Stufe und kosten hier 0,0625 $ (0,125 $ Listenpreis). Wenn Sie eine umfangreiche Aufgabe in Anfragen unter 100K aufteilen können, kostet sie nur ein Fünftel.
Abrechnung nach tatsächlich genutzten Token
Zu Beginn des Aufrufs wird ein geschätzter Betrag reserviert und nach Abschluss der Antwort mit der tatsächlichen Token-Anzahl verrechnet; die Differenz wird erstattet. Thinking-Tokens werden als Output abgerechnet.
Migration von Haiku 4.5: Was jetzt einen Fehler zurückgibt
Den Modell-String auf claude-haiku-5-5 zu ändern, reicht nicht immer aus. Diese Request-Strukturen funktionierten auf Haiku 4.5 und werden auf Haiku 5.5 abgelehnt.
temperature, top_p und top_k weglassen
Nicht standardmäßige Sampling-Werte geben 400 mit „deprecated for this model“ zurück. Entfernen Sie diese Felder und steuern Sie die Ausgabe über den Prompt und das Effort-Level.
Kein Assistant-Prefill
Eine Konversation, die mit einer Assistant-Nachricht endet, gibt 400 zurück. Die letzte Nachricht muss vom Benutzer stammen. Um ein Format zu erzwingen, verwenden Sie strukturierte Ausgaben oder geben Sie es im Prompt an.
Thinking-Budgets durch Effort ersetzen
Die API von Anthropic lehnt thinking: {"type": "enabled", "budget_tokens": N} bei diesem Modell ab. Entfernen Sie es daher und setzen Sie stattdessen output_config.effort. Thinking-Tokens werden weiterhin von max_tokens abgezogen. Erhöhen Sie also max_tokens, falls Antworten abgeschnitten werden.
Das Deaktivieren von Thinking begrenzt Effort auf high
thinking: {"type": "disabled"} funktioniert bei low, medium und high Effort. Bei xhigh oder max wird 400 zurückgegeben. Der bei Sonnet 5.5 verwendete between_tools-Thinking-Modus wird von Haiku 5.5 nicht unterstützt. Erzwungenes tool_choice funktioniert weiterhin.
Wählen Sie das Effort-Level vor dem Rollout
Effort ist der wichtigste Regler für Qualität, Latenz und Kosten. Bei Haiku 5.5 ist der Unterschied zwischen den Stufen groß.
Headline-Scores beziehen sich auf max Effort
Die Launch-Zahlen von Anthropic basieren auf max Effort. Beim Standard-Effort medium meldet Anthropic einen GDPval-AA-Elo von 1277 statt 1620. Berücksichtigen Sie Benchmark-Angaben stets im Kontext des Effort-Levels.
max ist token-hungrig
Artificial Analysis maß etwa 162K Output-Tokens pro Intelligence-Index-Aufgabe bei max Effort – rund dreimal so viel wie bei GPT-6 Luna auf max. Bei medium wurden etwa 137 Output-Tokens pro Sekunde gemessen.
Beginnen Sie mit low oder medium
Für Klassifizierung, Extraktion und Routing halten low oder medium mit deaktiviertem Thinking Latenz und Kosten niedrig. Erhöhen Sie das Level nur bei Aufgaben, bei denen die Qualität nicht ausreicht.
So rufen Sie die Claude Haiku 5.5 API auf
Der Endpunkt unterstützt das Anthropic Messages-Protokoll, sodass für einen bestehenden Claude-Client lediglich eine neue Base-URL und ein neuer Key erforderlich sind.
API-Key erstellen und Client auf AIReiter ausrichten
Erstellen Sie einen API-Key in Ihrem AIReiter-Dashboard. Setzen Sie in den offiziellen Anthropic-SDKs die Base-URL auf https://aireiter.com/api – das SDK fügt /v1/messages automatisch an.
Einen Request mit curl senden
curl https://aireiter.com/api/v1/messages \ -H "x-api-key: $AIREITER_API_KEY" \ -H "anthropic-version: 2023-06-01" \ -H "content-type: application/json" \ -d '{ "model": "claude-haiku-5-5", "max_tokens": 4096, "output_config": {"effort": "low"}, "messages": [{"role": "user", "content": "Hello"}] }'
Oder das Python-SDK verwenden
from anthropic import Anthropic client = Anthropic(api_key="YOUR_AIREITER_KEY", base_url="https://aireiter.com/api") msg = client.messages.create( model="claude-haiku-5-5", max_tokens=4096, messages=[{"role": "user", "content": "Hello"}], ) print(next(b.text for b in msg.content if b.type == "text"))
Claude Haiku 5.5 API FAQ
/ 01Wann wurde Claude Haiku 5.5 veröffentlicht und wie lautet die Modell-ID?
Anthropic hat es am 7. Oktober 2026 veröffentlicht. Die API-Modell-ID lautet claude-haiku-5-5 und der Knowledge Cutoff ist Juni 2026. Laut Anthropic wird es nicht vor dem 7. Oktober 2027 eingestellt.
/ 02Wie groß sind das Kontextfenster und die maximale Ausgabe?
Ein Kontextfenster von 1 Mio. Token und bis zu 128.000 Output-Token pro Request. Es akzeptiert Text- sowie Bildeingaben und gibt Text zurück.
/ 03Wie viel kostet die Claude Haiku 5.5 API?
Anthropic gibt $0.10 für Input und $0.50 für Output pro Million Tokens für Anfragen bis zu 100K Input-Tokens an, und das Fünffache darüber. AIReiter berechnet die Hälfte: $0.05 und $0.25 bzw. $0.25 und $1.25 über 100K.
/ 04Warum hat eine Anfrage fünfmal so viel gekostet?
Der gesamte Input überstieg 100K Tokens, sodass die gesamte Anfrage zum Long-Context-Tarif abgerechnet wurde. Gecachte Tokens zählen ebenfalls zum 100K-Limit.
/ 05Warum beginnen meine Antworten mit einem Thinking-Block?
Adaptive Thinking ist standardmäßig aktiviert, daher kann die Antwort vor dem Text einen Thinking-Block enthalten. Lesen Sie Content-Blöcke nach Typ aus, anstatt content[0] zu verwenden, oder deaktivieren Sie Thinking bei low, medium oder high Effort.
/ 06Ist Haiku 5.5 gut genug für Coding?
Für kleine, klar umrissene Änderungen und Subagent-Schritte oft ja. Für komplexe dateiübergreifende Arbeiten empfiehlt Anthropic Sonnet 5.5 oder Opus 5.5, die beide mit demselben Schlüssel verfügbar sind.
/ 07Benötige ich ein Anthropic-Konto?
Nein. Ein AIReiter-Key funktioniert mit dem AIReiter-Endpunkt, und Sie können das Modell im Playground auf dieser Seite ausprobieren, bevor Sie Code schreiben.
/ 08Welche APIs werden unterstützt?
Anthropic Messages unter /api/v1/messages ist die primäre Schnittstelle, inklusive Streaming. Chat Completions im OpenAI-Stil und die Responses API werden ebenfalls unterstützt, und /api/v1/models listet die für Ihren Key verfügbaren Modelle auf.