Die Claude API-Preisgestaltung reicht von $1 pro Million Tokens (Haiku 4.5 input) bis $50 pro Million (Fable 5 output) Stand Juli 2026, und für jedes aktuelle Modell gilt dieselbe Regel: Output-Tokens kosten das 5-fache von Input-Tokens. Aber der Listenpreis ist der einfache Teil. Ein neuer Tokenizer, US-only-Routing, Fast Mode und eine Abrechnungsfalle, die den meisten nie auffällt, liegen alle zwischen der Preisliste und Ihrer tatsächlichen Rechnung — und es gibt eine Möglichkeit, dieselben Modelle für einen Bruchteil des Listenpreises zu kaufen.
Jede Zahl unten stammt von Anthropics offizieller Preisseite; prüfen Sie sie, bevor Sie ein Budget festlegen, da sich die Modellpreise ändern.
Claude API-Preise im Jahr 2026: jedes Modell
Dies sind die aktuellen Preise pro Million Token, verifiziert anhand von Anthropic's Preisangaben für Juli 2026 (offizielle Quelle). Opus 4.8 wurde am 28. Mai 2026 zum gleichen Preis wie 4.7 veröffentlicht.
Modell | Eingabe / 1M | Ausgabe / 1M | Kontext |
|---|---|---|---|
Claude Fable 5 | $10.00 | $50.00 | 1M |
Claude Opus 4.8 | $5.00 | $25.00 | 1M |
Claude Opus 4.7 | $5.00 | $25.00 | 1M |
Claude Opus 4.6 | $5.00 | $25.00 | 1M |
Claude Sonnet 4.6 | $3.00 | $15.00 | 1M |
Claude Haiku 4.5 | $1.00 | $5.00 | 200K |
Zwei Dinge, die viele ältere Anleitungen falsch darstellen. Fable 5 — Anthropics leistungsfähigstes Modell — liegt über der Opus-Stufe bei $10/$50, und die gesamte Opus-4.x-Reihe (4.6, 4.7, 4.8) bleibt bei $5/$25. Diese $5 sind wiederum eine eigene Geschichte: Opus 4.1 kostete $15/$75, und der Rückgang auf $5/$25 beim Start von 4.6 war eine Kürzung um 67% beim Flaggschiff, die seit drei Releases anhält.
Alte und preisgünstige Optionen
Wenn Sie die neuesten Modelle nicht benötigen, sind die älteren weiterhin verfügbar: Sonnet 4.5 ($3/$15), Opus 4.5 ($5/$25, 200K context), Haiku 3.5 ($0.80/$4) und Haiku 3 ($0.25/$1.25) für besonders kostensensible Arbeiten mit hohem Volumen.
Ein unterschätztes Detail: Opus 4.6/4.7/4.8, Sonnet 4.6 und Fable 5 enthalten alle das vollständige Kontextfenster mit 1 Mio. Token zum Standardpreis — ohne Aufpreis für langen Kontext. Eine Anfrage mit 900.000 Token kostet pro Token dasselbe wie eine mit 9.000 Token, während mehrere Wettbewerber ab einer bestimmten Länge einen Aufpreis verlangen.
Die Kosten, die nicht auf der Preiskarte stehen
Die Preistabelle ist der Punkt, an dem die meisten Preisartikel aufhören und an dem die Überraschungen beginnen — denn mehrere Faktoren verändern Ihre tatsächliche Rechnung, ohne die Preis-pro-Token-Zahl zu ändern.
Der Tokenizer, der heimlich Tokens hinzufügt
Opus 4.7 (und Opus 4.8, das denselben Tokenizer verwendet) hat die Aufteilung von Text in Tokens verändert. Derselbe Input kann bis zu ~35 % mehr Tokens erzeugen als auf Opus 4.6 — bei identischer Rate pro Token. Code, strukturierte Daten (JSON/XML) und nicht-englischer Text sind am stärksten betroffen, weil sich die Rate nicht geändert hat, aber die Tokenanzahl schon. Verlassen Sie sich nicht blind auf die 35 %: Bevor Sie ein altes Budget übernehmen, führen Sie Ihre tatsächlichen Prompts erneut über den token-counting endpoint auf dem neuen Modell aus und vergleichen Sie.
Denken, Fast Mode und US-only-Routing
Gemäß Anthropics Preisdokumentation:
Erweiterte Denk-Tokens werden als Ausgabe abgerechnet, selbst wenn Sie sie nie anzeigen. Eine aufschlussintensive Anfrage treibt stillschweigend die Ausgabeseite der Rechnung in die Höhe.
Schnellmodus (nur Opus 4.8/4.7) führt dasselbe Modell bis zu 2,5× schneller bei 2× Standardpreis aus.
US-only inference (Datenresidenz) fügt bei Eingabe und Ausgabe einen 1,1×-Multiplikator hinzu; AWS Bedrock- oder Vertex-Regionalendpunkte legen obendrauf noch einmal ungefähr 10 % drauf.
Server-seitige Tools
Tools, die auf der Seite von Anthropic ausgeführt werden, werden separat abgerechnet, gemäß denselben Preisdokumenten: Websuche kostet 10 $ pro 1.000 Suchanfragen zuzüglich der Tokens zur Verarbeitung der Ergebnisse, und die Codeausführung ist bis zu einem monatlichen Kontingent kostenlos, danach etwa 0,05 $/Stunde pro Container. (Bestätigen Sie die aktuellen Werte auf der Preisseite — die Tarife für Server-Tools ändern sich.)
Die Abrechnungsfalle, die Claude-Code-Nutzer erwischt
Dieses hier steht auf keiner Preiskarte. Wenn Sie ANTHROPIC_API_KEY in Ihrer Shell gesetzt haben, berechnet Claude Code über die Pay-per-Token-API statt über Ihr Abonnement. Personen, die einen festen Preis von 20–200 $/Monat erwarten, wurden genau aus diesem Grund von nutzungsabhängigen Gebühren überrascht. Prüfen Sie Ihre Umgebung vor einer längeren Sitzung.
Wie viel wird Claude Sie tatsächlich kosten?
Preise bedeuten wenig, bis Sie sie auf eine Workload abbilden. Drei Beispiele zu aktuellen Preisen, alle bei 10.000 Anfragen/Tag (2.000 Input- + 500 Output-Tokens jeweils — 20 Mio. Input- + 5 Mio. Output-Tokens/Tag):
Ein Support-Chatbot auf Haiku 4.5 ($1/$5): 20M × $1 + 5M × $5 = $45/day, etwa $1,350/month.
Ein Coding-Agent auf Sonnet 4.6 ($3/$15): $60 + $75 = $135/day, etwa $4,050/month vor der Optimierung.
Eine High-Context-RAG-App auf Opus 4.8 ($5/$25), bei der abgerufene Dokumente den Input deutlich erhöhen, steigt aufgrund des dominierenden Input-Volumens in den hohen vier- oder fünfstelligen Bereich pro Monat.
Gleiches Volumen, drei Modelle — allein die Modellauswahl lässt die Rechnung zwischen Haiku und Sonnet um ~3× schwanken.
Das sind keine hypothetischen Obergrenzen. Ein r/ClaudeAI-Thread verfolgte 31 Claude Code-Nutzer, deren Nutzung bei API-Tarifen ungefähr 80.000 $/Monat gekostet hätte, wobei der Spitzennutzer allein bei fast 18.000 $ lag — eine Schätzung dessen, was ihre Abo-Nutzung auf der nutzungsabhängigen API kosten würde, nicht eine wörtliche Rechnung. Bei starken autonomen Workloads wird die Rechnung wirklich hoch, und genau dort zahlen sich die folgenden Optimierungen aus.
Ratenlimits und Nutzungsstufen
Preisgestaltung ist nicht die einzige Einschränkung — wie schnell Sie sie ausgeben können, ist gestaffelt. Neue API-Konten beginnen mit konservativen Limits für Anfragen pro Minute (RPM) und Tokens pro Minute (TPM), die automatisch steigen, wenn Ihr Konto älter wird und Ihre kumulierten Ausgaben wachsen (Tier 1 → 4). Neue Konten erhalten außerdem $5 an kostenlosen Guthaben zum Testen, ohne dass eine Karte erforderlich ist. Über den Durchsatz hinaus bietet Anthropic Service-Tiers, die Verfügbarkeit und Preis gegeneinander abwägen: ein Standard-Tier (die Voreinstellung), ein Priority-Tier für garantierte Verfügbarkeit und ein Batch-Tier für den unten genannten 50%-Async-Rabatt. Prüfen Sie die Rate-Limits-Dokumentation auf die exakten Zahlen Ihres Tiers, bevor Sie auf Skalierung auslegen — ein Kontingent, das für Pilotverkehr ausreichte, kann für die Produktion ein Tier-Upgrade erfordern.
Claude-Abonnement vs. API: Was ist günstiger?
Die häufigste Frage aus der Praxis, und die Antwort ist ein Schwellenwert, kein Urteil.
Claude Pro kostet 20 $/Monat; Max kostet 100 oder 200 $/Monat. Diese decken die Claude-Apps und Claude Code unter einem Nutzungskontingent ab — keine Abrechnung pro Token.
Die API ist rein nutzungsbasiert, ohne monatliches Minimum und ohne Nutzungsobergrenze.
Der Schnittpunkt liegt im niedrigen Millionenbereich an Tokens pro Monat — etwa 3–4 Mio. bei einem Modell der mittleren Preisklasse (Sonnet), vorausgesetzt, ein ausgewogenes Verhältnis von Eingabe und Ausgabe und dass du sonst innerhalb des Nutzungsumfangs von Pro bleibst. Bei Haiku verschiebt er sich nach oben und bei Opus nach unten, also behandle ihn als Spannbreite, nicht als festen Wert. Unter diesem Volumen ist ein Abonnement normalerweise günstiger und einfacher. Darüber — besonders bei Produktionsverkehr oder intensiver agentischer Codierung — ist der Tokenpreis der API im Vorteil, und du gewinnst Kontrolle (Rate Limits, Monitoring, Abrechnung mit mehreren Schlüsseln), die ein Plan nicht bietet. Speziell für ganztägiges Coding schätzen Entwickler, dass ein Max-Plan deutlich günstiger sein kann als dieselbe Arbeit, die tokenweise auf Opus abgerechnet wird.
Die praktische Regel: Prototypen und individuelle Nutzung → Abonnement; skalierter Produktverkehr → API. Und beachten Sie die ANTHROPIC_API_KEY-Falle oben, sonst zahlen Sie auf beide Arten.
Wie man weniger für die Claude API bezahlt
Drei Hebel senken die Standardrechnung, ohne die Modelle zu ändern.
1. Prompt-Caching (bis zu 90 % Rabatt auf wiederholten Kontext)
Cachen Sie ein stabiles Präfix — ein langer System-Prompt, abgerufene Dokumente, Few-Shot-Beispiele — und Cache-Lesezugriffe kosten 0,1× des Eingabepreises, also 90 % Rabatt. Der Haken ist das Schreiben: Ein 5-Minuten-Cache-Schreibvorgang kostet 1,25× und amortisiert sich nach einem Lesezugriff; ein 1-Stunden-Schreibvorgang kostet 2× und amortisiert sich nach zwei. Für alles mit einem großen festen Vorspann, der immer wieder aufgerufen wird, ist dies der größte einzelne Hebel. (Caching docs.)
2. Batch API (50% Rabatt, in beide Richtungen)
Für alles, was keine Antwort in Echtzeit benötigt, gewährt die Batch API 50 % Rabatt auf Eingabe und Ausgabe und liefert innerhalb von 24 Stunden zurück. Sonnet 4.6 sinkt auf 1,50 $/7,50 $; Haiku 4.5 auf 0,50 $/2,50 $. Caching und Batching lassen sich kombinieren und drücken die effektiven Kosten deutlich unter die Hälfte des Listenpreises.
3. Modell-Routing und Ausgabegrenzen
Führen Sie nicht jede Anfrage auf Opus aus. Leiten Sie Klassifizierung, Zusammenfassung und Routing-Logik an Haiku weiter, reservieren Sie Sonnet für die Mitte und rufen Sie Opus nur dann auf, wenn die Aufgabe es erfordert — das allein senkt die Kosten häufig um 40–60 %. Und da die Ausgabe 5× so teuer ist wie die Eingabe, ist das Begrenzen max_tokens einer Ihrer Hebel mit der größten Wirkung: Wenn Sie die durchschnittliche Ausgabe bei einer Million Aufrufen von 800 auf 500 Tokens reduzieren, sparen Sie jeden Monat echtes Geld.
Offizielle API vs. Relay-Plattformen: Können Sie weniger bezahlen?
Es gibt einen vierten Weg, den die offiziellen Dokumente nicht erwähnen: die gleichen Claude-Modelle über ein Relay zu kaufen. Ein API-Relay (oder Aggregator) sitzt zwischen Ihnen und Anthropic, stellt einen Anthropic-kompatiblen Endpunkt bereit und berechnet seinen eigenen Tarif.
Warum kann ein Relay günstiger sein? Vor allem drei Mechanismen: Relays kaufen mit zugesicherten Volumina ein, die Rabatte ermöglichen, die ein einzelnes Konto nicht erreichen kann; sie leiten effizient über Regionen und Anbieter hinweg; und viele arbeiten mit knappen Margen (oder als Lockangebot), um Entwickler zu gewinnen. Aber ein so großer Rabatt muss irgendwo herkommen — verstehen Sie das Geschäftsmodell einer Plattform, bevor Sie sich darauf verlassen.
Die Rabatte variieren stark. So vergleichen sich drei Optionen für dieselben Claude-Modelle:
Plattform | Rabatt gegenüber der Anthropic-Preisliste | Modellabdeckung | Hinweise |
|---|---|---|---|
Offizielle Anthropic API | — (Basiswert) | Alle, inkl. Fable 5 / Opus 4.8 | Caching, Batch, alle Funktionen |
≈ Preisliste (gibt den Providerpreis weiter) | Viele Modelle, mehrere Provider | Aggregator; Komfort statt Ersparnis | |
EvoLink | ~10% Rabatt | Bis Opus 4.7 | OpenAI-kompatibler Endpunkt |
~80% Rabatt | Bis Opus 4.6 | Anthropic-kompatibel; Caching wird weitergegeben |
AIReiter liegt am aggressiven Ende. Hier ist, was die im Titel genannten ~80 % pro Modell bedeuten:
Modell | Offiziell (in / out) | AIReiter (in / out) | Sie sparen |
|---|---|---|---|
Claude Haiku 4.5 | $1 / $5 | $0.20 / $1.00 | 80% |
Claude Sonnet 4.6 | $3 / $15 | $0.60 / $3.00 | 80% |
Claude Opus 4.6 | $5 / $25 | $1.00 / $5.00 | 80% |
Die Integration ist direkt einsetzbar: Der Endpunkt von AIReiter ist kompatibel mit der Anthropic Messages API, sodass das offizielle anthropic-SDK mit der Änderung von zwei Zeilen funktioniert — verweisen Sie base_url auf https://aireiter.com/api und tauschen Sie den Schlüssel aus:
client = anthropic.Anthropic(
api_key="YOUR_AIREITER_KEY",
base_url="https://aireiter.com/api",
)
Streaming, Multi-Turn, Vision und cache_control werden alle durchgereicht, sodass der oben genannte 90%-Caching-Rabatt zusätzlich zum niedrigeren Grundtarif greift.
FAQ
Warum ist die Claude API so teuer?
Oft ist es nicht der Preis pro Token — sondern das Workflow-Design. Die größten Kostentreiber sind, alles auf Opus auszuführen, obwohl Haiku oder Sonnet ausreichen würden, wiederholter Kontext ohne Cache, unbeschränkte Ausgabe und Reasoning-Token, für die Sie bezahlen, die Sie aber nie sehen. Diese zu beheben ist in der Regel wichtiger als der angegebene Preis.
Gibt es einen kostenlosen Claude-API-Tarif?
Kein dauerhaft kostenloser Produktions-Tarif, aber neue Konten erhalten $5 an kostenlosen Guthaben (keine Kreditkarte erforderlich), um damit zu testen. Danach erfolgt die Abrechnung nach Verbrauch.
Claude API vs ChatGPT-Preise — welches ist günstiger?
Das hängt von der Stufe ab, die Sie vergleichen. Grob gesagt, pro Million Tokens (ein / aus):
Claude | Vergleichbare OpenAI |
|---|---|
Haiku 4.5 — $1 / $5 | GPT mini-Tarif — niedrige einstellige Beträge |
Sonnet 4.6 — $3 / $15 | mittlere Tarifstufe — vergleichbar |
Opus 4.8 — $5 / $25 | GPT-5.5 — ca. $5 / $30 |
Wie berechne ich meine monatliche Claude-API-Rechnung?
Schätzen Sie es so: (requests × avg input tokens ÷ 1,000,000 × input rate) + (requests × avg output tokens ÷ 1,000,000 × output rate). Verwenden Sie den Token-Counting-Endpunkt für genaue Zählungen bei Ihren echten Prompts — ein generischer Tokenizer kann bei Claude um 15–35 % abweichen.
Das Fazit
Für die meisten Teams ist es eine Dreiteilung: Prototyping oder individuelle Nutzung → ein Pro- oder Max-Abonnement (einfacher, günstiger unter ~3–4 Mio. Tokens/Monat); Produktion auf dem neuesten Flaggschiff (Opus 4.8, Fable 5) → die offizielle API mit aktiviertem Caching, Batching und Routing; Produktion, bei der Sonnet 4.6 oder Opus 4.6 ausreicht → ein seriöser Relay wie AIReiter kann dieselbe Rechnung durch einen Drop-in-SDK-Wechsel um bis zu 80 % senken.
Egal, wofür Sie sich entscheiden, die meisten Teams zahlen zu viel, weil sie die Optimierungen auslassen, nicht weil sie die falsche Stufe wählen — also schalten Sie die Stellschrauben ein, bevor Sie sich um die Preisliste kümmern.