Für sehr große, wiederkehrende Prompts mit funktionierendem Cache ist K3 die passendere Wahl. Claude Opus 5 richtet sich eher an Agenten, bei denen integrierte Thinking-Steuerung zählt. Dieser Vergleich betrachtet dokumentierte Limits und Integrationsverhalten – ohne ohne einen Benchmark mit identischen Prompts einen Qualitätsgewinner auszurufen.
Die schnelle Entscheidung: Der Workload gibt den Ausschlag
Kimi K3 eignet sich für Teams, die ein Kontextfenster von einer Million Tokens und cacheabhängige Preise für Eingaben benötigen. Claude Opus 5 passt zu Teams, denen standardmäßig aktiviertes Thinking und die Steuerung des Aufwands wichtiger sind als die maximale Kontextgröße.
| Entscheidungskriterium | Kimi K3 | Claude Opus 5 | Bessere Wahl |
|---|---|---|---|
| Kontextfenster | 1.048.576 Tokens | 200.000 Tokens | K3 für sehr große Eingaben |
| Standardpreis für Eingaben | ¥2/M gecacht; ¥20/M ohne Cache | $5/M | K3 beim unten verwendeten Beispiel-Wechselkurs |
| Standardpreis für Ausgaben | ¥100/M | $25/M | K3 beim unten verwendeten Beispiel-Wechselkurs |
| Tool-Nutzung | Tool Calling und Steuerelemente zur Tool-Auswahl sind dokumentiert | Tool-Nutzung wird unterstützt; das Deaktivieren von Thinking hat dokumentierte Sonderfälle | Abhängig von Tool-Schema und Thinking-Einstellung |
| Zugangsweg | Kimi API | Claude API und aufgeführte Cloud-Zugänge | Benötigten Anbieter prüfen |
Preise und Kontext bestimmen die Kostenrechnung
Die am 7. August 2026 geprüfte offizielle Preisseite von Kimi K3 nennt ¥2 pro Million Input-Tokens bei einem Cache-Treffer, ¥20 ohne Cache-Treffer und ¥100 pro Million Output-Tokens. Dort ist außerdem ein Kontextfenster von 1.048.576 Tokens angegeben. Diese Kombination begünstigt wiederkehrende lange Prompts – vorausgesetzt, die Anwendung erzielt tatsächlich Cache-Treffer.
Die am 7. August 2026 geprüfte offizielle Modelldokumentation zu Claude Opus 5 nennt für die Standard-API $5 pro Million Input-Tokens und $25 pro Million Output-Tokens sowie ein Kontextfenster von 200k.
Rechnet man in den jeweiligen Währungen pro Token, kostet eine Anfrage mit 180k Input und 8k Output bei K3 ¥1,16 mit Cache-Treffer beziehungsweise ¥4,40 ohne Cache-Treffer; bei Opus 5 sind es zu Standardtarifen $1,10. Die Anfrage passt in das Kontextfenster von Opus 5. Die tatsächliche Abrechnung hängt jedoch vom vertraglich vereinbarten Wechselkurs, der Cache-Berechtigung und der abgerechneten Ausgabe ab.
Bei Tool Calling und Thinking trennen sich die Integrationswege
Die K3-API-Dokumentation von Kimi behandelt ausdrücklich Tool Calling, Tool-Auswahl, dynamisches Laden von Tools, den JSON-Modus und strukturierte Ausgabe. Diese Steuerungsmöglichkeiten sind für Anwendungen mit festen Schemata und toolgesteuerten Abläufen relevant.
Bei Claude Opus 5 ist Thinking standardmäßig aktiv. Das Modell entscheidet pro Turn selbst, wie intensiv es nachdenkt, während der Parameter für den Aufwand die Tiefe steuert. Anthropic dokumentiert dabei eine Breaking Constraint: Thinking lässt sich bei hohem Aufwand nicht deaktivieren. Ist Thinking deaktiviert, kann das Modell außerdem gelegentlich einen Tool-Aufruf als sichtbaren Text schreiben, statt einen tool_use-Block auszugeben.
Bleiben Tool-Aufrufe strukturell zuverlässig, sollte Thinking bei Opus 5 aktiviert bleiben. K3 ist die naheliegendere Wahl, wenn explizite Tool-Steuerung und schemaorientierte Ausgabe im Vordergrund stehen.
Welches Modell passt zu typischen Workloads?
Lange Dokumente und Wissensarbeit
K3 gewinnt, sobald die Quellensammlung das dokumentierte Kontextlimit von 200k bei Opus 5 überschreitet.
Passt der Korpus in 200k, ist das standardmäßig aktive Thinking von Opus 5 der wichtigere Unterschied als die reine Kontextgröße.
Programmierung und langfristige Agenten
Für einen neuen Agenten ist Opus 5 die richtige Wahl, wenn das dokumentierte Standard-Thinking und die Aufwandsteuerung wichtiger sind, als das gesamte Repository in einen Prompt zu bekommen.
K3 bietet sich für einen großen, cachefähigen Agentenkontext an. Das Tool-Protokoll sollte jedoch mit produktionsnahen Aufgaben getestet werden.
Kostensensible API-Workloads
Bei cachefähigen, inputlastigen Workloads sollte K3 preislich getestet und der Cache-Status protokolliert werden, denn die Preise für gecachte und nicht gecachte Eingaben unterscheiden sich deutlich.
Bei Opus 5 sollte die abgerechnete Ausgabe mit repräsentativen Workloads gemessen werden, da Thinking standardmäßig aktiv ist.
Bevor Sie sich festlegen, lassen Sie repräsentative Prompts über beide APIs laufen und erfassen Sie Cache-Trefferquote, Gültigkeit der Tool-Aufrufe, Latenz und abgerechnete Ausgabe.