Claude Haiku 5.5 wirkt zunächst wie ein besonders günstiges Modell – bis eine Anfrage die Marke von 100.000 Eingabe-Tokens überschreitet. Unterhalb dieser Grenze berechnet Anthropic $0.10 pro Million Eingabe-Tokens und $0.50 pro Million Ausgabe-Tokens. Darüber steigen die Preise auf $0.50 beziehungsweise $2.50. Dieser fünffache Sprung bei den Eingabekosten ist für das Produktionsbudget wichtiger als jede vollmundige Launch-Aussage.
Claude Haiku 5.5 API-Preise im Überblick
Die direkte API-Preisliste unterscheidet Anfragen nach der Größe des Eingabe-Prompts (USD pro Million Tokens). Die folgende Tabelle basiert auf den Preisen der Claude-Plattform und der Ankündigung zum Haiku-5.5-Launch; bei Marktplätzen können andere Tarife gelten.
Die 100.000-Tokens-Grenze entscheidet über den Tarif
Maßgeblich ist die Größe des Eingabe-Prompts der jeweiligen Anfrage. Es handelt sich nicht um einen allgemeinen Aufschlag, der automatisch für Modelle mit großem Kontextfenster anfällt. Eine Anfrage mit 90.000 Eingabe-Tokens und 2.000 Ausgabe-Tokens bleibt im günstigeren Tarif. Bei 120.000 Eingabe-Tokens gelten dagegen sowohl für Ein- als auch Ausgabe-Tokens die höheren Preise der Lang-Prompt-Stufe.
Für eine einfache Anfrage mit 10.000 Eingabe-Tokens und 500 Ausgabe-Tokens sieht die Rechnung im günstigeren Tarif so aus:
(10,000 x $0.10 + 500 x $0.50) / 1,000,000 = $0.00035
Bei 10.000 identischen Anfragen ergibt das $3.50 – Kosten für Tools, Plattform und Wiederholungen noch nicht eingerechnet. Um den Tarifwechsel mit einem gültigen langen Prompt zu verdeutlichen: Eine Anfrage mit 120.000 Eingabe-Tokens und 500 Ausgabe-Tokens kostet:
(120,000 x $0.50 + 500 x $2.50) / 1,000,000 = $0.06125
Bei 10.000 solchen Anfragen sind das $612.50. Für die Abrechnung zählt die vollständige Eingabe, die an die API geschickt wird – nicht nur die sichtbare Frage.
In der offiziellen Reddit-Ankündigung von Anthropic heißt es, Anfragen bis 100K Tokens seien rund 90 % günstiger als bei Haiku 4.5, während Anfragen über 100K rund 50 % günstiger ausfielen. Diese Angaben sollten als relative Aussagen zum Launch verstanden werden, nicht als Garantie für jede Workload. Wiederholungen, Ausgabelänge, Tokenizer-Verhalten und fehlgeschlagene Cache-Treffer verändern die tatsächliche Rechnung.
缓存 und Batch verändern die effektiven Kosten
Prompt-Caching lohnt sich besonders, wenn eine Anwendung dieselben Anweisungen oder Wissenspakete wiederholt verschickt. Bei Haiku 5.5 kostet das Schreiben in den Fünf-Minuten-Cache das 1,25-Fache des regulären Eingabetarifs. Das Lesen aus dem Cache wird mit einem Zehntel des normalen Eingabepreises berechnet. Auch im höheren Prompt-Tarif bleiben diese Verhältnisse gleich.
| Vorgang | Bis 100K | Über 100K |
|---|---|---|
| Erste 1M Tokens im Fünf-Minuten-Cache | $0.125 | $0.625 |
| Je 1M aus dem Cache gelesene Tokens | $0.01 | $0.05 |
| Je 1M Eingabe-Tokens im Batch | $0.05 | $0.25 |
| Je 1M Ausgabe-Tokens im Batch | $0.25 | $1.25 |
Ein Fünf-Minuten-Cache amortisiert sich meist nach ungefähr zwei Lesevorgängen, weil der Aufpreis für das Schreiben schnell wieder hereinkommt. Ein Präfix mit 1M Tokens kostet beispielsweise $0.125 beim Schreiben und $0.01 beim Lesen. Zwei nicht gecachte Lesevorgänge würden dagegen $0.20 kosten – Ausgaben nicht berücksichtigt. Ein einstündiger Cache wird mit dem Doppelten des regulären Eingabepreises berechnet und benötigt daher mehr wiederholte Lesevorgänge, bevor er sich rechnet. Entscheidend ist, ob der Cache-Key unverändert bleibt und die Anfrage weiterhin in derselben Tarifstufe liegt.
Die Batch API halbiert die Ein- und Ausgabetarife für asynchrone Jobs wie nächtliche Anreicherungen, Massenklassifizierung, Backfills und Evaluationsläufe. Sie ersetzt keinen synchronen Chat: Der Preisvorteil wird mit höherer Latenz bezahlt. Wenn deine Route beide Varianten unterstützt, lassen sich Batch und Caching kombinieren. Prüfe aber die finalen usage-Felder, statt automatisch davon auszugehen, dass jede Anfrage den Cache getroffen hat.
Das wichtigste Betriebs-Signal zum Loggen ist cache_read_input_tokens, ein Feld aus dem von Anthropic dokumentierten Usage-Schema der Messages API. Bleibt der Wert nach der ersten Anfrage bei null, solltest du Prompt-Reihenfolge, Zeitstempel, Tool-Serialisierung und die Position von Cache-Control prüfen. Ein günstigeres Modell mit dauerhaft leerem Cache kann teurer werden als eine korrekt gecachte Route mit nominell höherem Tarif.
Haiku 5.5 im Vergleich zu älteren Haiku- und Sonnet-Modellen
Der folgende Vergleich verwendet die veröffentlichten direkten Tarife, die vor Haiku 5.5 verfügbar waren. Die Preise von Haiku 4.5 dienen als Referenz; daraus folgt nicht, dass jeder Anbieter identische Tarife verwendet.
| Modell | Eingabe / MTok | Ausgabe / MTok | Einordnung fürs Budget |
|---|---|---|---|
| Claude Haiku 5.5, <=100K | $0.10 | $0.50 | Hohe Volumina mit kurzen Ausgaben |
| Claude Haiku 5.5, >100K | $0.50 | $2.50 | Lange Prompts, wenn die Qualität den höheren Tarif rechtfertigt |
| Claude Haiku 4.5 | $1.00 | $5.00 | Bestehende Integrationen mit bekannter Referenz |
| Claude Sonnet 5.5 | $2.00 | $10.00 | Anspruchsvollere Produktionsaufgaben |
Haiku 5.5 ist ein naheliegender Kandidat für die ersten Tests bei Titelgenerierung, Klassifizierung, Extraktion, Routing, kurzen Zusammenfassungen und anderen Worker-Aufrufen mit hohem Durchsatz. Ein Reddit-Nutzer beschrieb den typischen Haiku-Einsatz als „high-volume, low-complexity tasks“ – etwa das Erzeugen eines Gesprächstitels oder das Extrahieren von Softwarenamen aus Text (u/jam_pod_). Das passt besser, als Haiku pauschal als Ersatz für ein stärkeres Modell in jedem Agent-Schritt einzuplanen.
Entscheide nicht allein nach dem Tokenpreis. Wenn Haiku bei der Hälfte deiner Anfragen einen zweiten Versuch benötigt, Sonnet dagegen bereits im ersten Anlauf akzeptierte Ergebnisse liefert, kann der nominelle Preisunterschied von zwei zu eins verschwinden. Miss an einer repräsentativen Stichprobe die abgerechneten Ein- und Ausgabe-Tokens, Wiederholungen und akzeptierten Ergebnisse, bevor du Produktionsverkehr umleitest.
Eine Kostenregel für den Produktionseinsatz
Arbeite diese Schritte ab, bevor du dich für Haiku 5.5 entscheidest:
- Schicke den echten Prompt durch die Dokumentation zur Token-Zählung von Anthropic – einschließlich Tools, abgerufener Dokumente und Gesprächsverlauf.
- Teile den Traffic in Anfragen mit
<=100Kund>100KEingabe-Tokens auf; mittlere die beiden Tarifstufen nicht zusammen. - Schätze die Ausgabe separat. Bei kurzer Eingabe und langer generierter Antwort dominieren die Ausgabekosten.
- Lege stabile Präfixe hinter Cache-Control und alarmiere, wenn die Cache-Lesevorgänge auf null fallen.
- Schicke Aufgaben, die warten können, über die Batch API und nutze für interaktive Anfragen weiterhin das synchrone Routing.
- Vergleiche Haiku 5.5 und Sonnet 5.5 anhand der Kosten pro akzeptiertem Ergebnis, nicht anhand der Kosten pro Million Tokens.
Diese Regel berücksichtigt auch die größte Unsicherheit in den Daten zum Launch-Tag: Die offiziellen Preise und die Verfügbarkeit sind klar, unabhängige Messungen zu Latenz, Fehlerrate und Qualität bei langen Kontexten liegen jedoch noch nicht belastbar vor. In der Reddit-Diskussion wird dieselbe offene Frage ganz direkt formuliert: „What does ‘prompts up to 100k’ mean?“ (u/ShadowBannedAugustus). Für ein Produktionsteam gehört diese Frage in einen Abrechnungstest – nicht in eine Schätzung.
Claude Haiku 5.5 API-FAQ
Wie lautet die Model-ID der Claude-Haiku-5.5-API?
Verwende claude-haiku-5-5 als aktuellen Alias, wie in den Release Notes von Claude Code angegeben. Wenn reproduzierbares Routing wichtig ist, solltest du die Snapshot-ID in der API-Modelldokumentation überprüfen.
Was kostet eine Haiku-5.5-Anfrage mit 100K Tokens?
Für 100.000 Eingabe-Tokens ohne Ausgabe fallen im günstigeren Tarif $0.01 an. Die Ausgabe wird separat mit $0.50 pro Million Tokens in derselben Tarifstufe berechnet. Der höhere Tarif greift, sobald der Prompt die dokumentierte Grenze überschreitet.
Ist Haiku 5.5 in Claude Pro oder Max enthalten?
Ein Claude-Abonnement und die Nutzung der Claude API sind getrennte Abrechnungsprodukte, wie aus den Preisen der Claude-Plattform hervorgeht. Für programmatischen Traffic gilt die API-Preisliste.
Lässt sich der Batch-Rabatt mit Prompt-Caching kombinieren?
In der Preisdokumentation von Anthropic wird Batch als Rabatt von 50 % auf berechtigte Token-Kosten ausgewiesen; die Abrechnung gecachter Tokens bleibt davon getrennt. Prüfe die finalen usage-Felder deiner Route, da Cache-Berechtigung und die Unterstützung durch den jeweiligen Anbieter abweichen können.
Ist Haiku 5.5 bei jeder Anfrage günstiger als Haiku 4.5?
Nach den veröffentlichten direkten Tarifen ist Haiku 5.5 in beiden Eingabe-Tarifstufen günstiger. Der tatsächliche Vorteil kann durch Wiederholungen, längere Ausgaben, Cache-Fehltreffer oder Workloads schrumpfen, die für ein erfolgreiches Ergebnis ein stärkeres Modell benötigen.