Beim reinen Tokenpreis ist DeepSeek V4 Flash die günstigste LLM-API fürs Programmieren. Im Test lieferte sie allerdings nicht die aufgeräumteste Antwort. Kimi K2.7 Code erfüllte jede Vorgabe, während GPT-5.4 mini viermal schneller fertig war. Spätestens wenn ein fehlerhafter Patch einen weiteren Versuch nötig macht, verschiebt sich jedoch die Rechnung.
Vier günstige Coding-APIs am selben Bug
Am 30. Juli 2026 bekamen vier aktuelle, codingfähige APIs denselben TypeScript-Concurrency-Bug vorgesetzt. Die Aufgabe war bewusst klein, aber strikt definiert: mapLimit sollte repariert werden, sodass die Ausgabereihenfolge erhalten bleibt, ein positiver ganzzahliger Concurrency-Grenzwert vor dem Aufruf von User-Code geprüft wird, dieser Grenzwert nie überschritten wird und nach der ersten Rejection keine weitere Arbeit mehr eingeplant wird. Außerdem musste jede Antwort genau drei Tests enthalten.
Das ist eine Stichprobe für Instruktionsbefolgung anhand einer einzelnen Aufgabe, kein Coding-Benchmark. Jeder direkte Durchlauf bestand aus einer User-Nachricht, ohne Tools, mit einem Ausgabelimit von 8.000 Tokens, der Standard-Temperatur des Anbieters und einer manuellen Prüfung anhand der vier genannten Anforderungen. Die gemessene Zeit umfasst unser gemeinsames Gateway sowie Provider- und Netzwerk-Overhead.
| Modell | Verifizierter Preis für Input / Output pro 1M | Zeit | Implementierung | Tests | Fazit |
|---|---|---|---|---|---|
| DeepSeek V4 Flash | $0.14 / $0.28 | 59.4s | Erfüllte in der finalen Version alle vier Anforderungen | Deckte die geforderten Verhaltensweisen ab | Günstigste brauchbare Antwort; unruhige Ausgabe |
| MiniMax M3 | $0.30 / $1.20 promotional | 60.7s | Reihenfolge und Concurrency waren korrekt; der Rejection-Status wurde eine Promise-Ebene zu spät gesetzt | Drei relevante Tests | Knapp an der strikten Stop-Regel vorbei |
| Kimi K2.7 Code | $0.95 / $4.00 | 64.3s | Sauberer Scheduler mit geordneten Ergebnissen und sofortigem Settled-Status | Deckte Reihenfolge/Concurrency, Rejection und ungültige Limits ab | Vollständigste Antwort |
| GPT-5.4 mini | $0.75 / $4.50 | 13.6s | Korrekte Worker-Pool-Implementierung | Drei Tests, aber keiner prüfte ungültige Limits | Schnellste saubere Implementierung; Lücke bei den Tests |
DeepSeek V4 Flash: niedrigster Preis, mehr Nacharbeit
DeepSeek V4 Flash lieferte letztlich eine korrekte Implementierung: Das Ergebnis-Array wurde vorab angelegt, Werte über ihren Eingabeindex zugeordnet, limit validiert und Worker über ein gemeinsames Rejection-Flag gestoppt. Problematisch war die Antwort selbst. Vor der finalen Funktion stand eine verworfene Implementierung mit einem nicht auflösbaren Promise-Pfad, gefolgt von der Erklärung, warum dieser Entwurf falsch war.
Wer jede Zeile selbst prüft, kann damit arbeiten. Für einen Agenten, der den ersten Codeblock herauszieht und automatisch anwendet, ist das dagegen ungeeignet. DeepSeek ist für mich nur dann der günstige erste Versuch, wenn Tests und Typechecking zwingende Gates sind.
MiniMax M3: attraktiver Preis, eine Concurrency-Kante
MiniMax M3 erzeugte kompakten Code und bewahrte die Reihenfolge mit out[i]. Das Rejection-Flag wurde allerdings im äußeren Promise.all-Catch gesetzt statt direkt im Worker, der den Callback-Fehler erkannt hatte. Durch diese zusätzliche Promise-Reaktion bleibt ein kleines, vermeidbares Zeitfenster, bevor andere Worker das Stop-Flag sehen.
Der Preis ist ungewöhnlich gut. Die offizielle MiniMax-Seite nennt für M3 bei bis zu 512K Input-Tokens eine dauerhafte Reduzierung um 50 % auf $0.30/M Input und $1.20/M Output. Oberhalb von 512K steigt die rabattierte Stufe auf $0.60/$2.40.
Kimi K2.7 Code: in dieser Stichprobe die vollständigste Antwort
Kimi K2.7 Code gab eine einzige Implementierung aus, nicht erst einen Entwurf mit anschließender Korrektur. Das Modell prüfte das Limit vor dem Scheduling, führte ein indexiertes Ergebnis-Array, begrenzte aktive Promises und setzte settled im Rejection-Handler. Seine drei Tests deckten die drei Punkte ab, an denen diese Funktion typischerweise scheitert: Abschlussreihenfolge, weiteres Scheduling nach einem Fehler und ungültige Limits.
Kimi war in diesem Durchlauf die langsamste Antwort und kostet pro Token mehr als DeepSeek oder das rabattierte MiniMax. Für unbeaufsichtigte Agentenarbeit, bei der ein übersehener Edge Case teurer ist als ein weiterer Cent API-Nutzung, würde ich diesen Aufpreis zahlen.
GPT-5.4 mini: schnellster Code, unvollständige Testauswahl
GPT-5.4 mini lieferte im präzisierten Durchlauf mit 13.6 Sekunden die schnellste korrekte Implementierung. Der Code erfüllte alle vier Anforderungen, einschließlich der Prüfung des Limits, bevor überhaupt Callbacks eingeplant werden. Die drei Tests prüften Reihenfolge, Spitzen-Concurrency und Rejection-Verhalten, doch die eigene Limit-Validierung testete das Modell nicht.
Beim ersten Versuch fragte das Modell außerdem nach einem Repository-Pfad, obwohl die vollständige Funktion bereits im Prompt stand. Dieser einzelne Fehler ist kein modellweiter Zuverlässigkeitswert, unterstreicht für Coding-Agenten aber eine wichtige Regel: Validiert das Artefakt, nicht den Modellnamen.
Was 100 Coding-Aufrufe wirklich kosten
Tokenpreise lassen sich anhand einer konkreten Coding-Last besser vergleichen. Angenommen, jede Anfrage sendet 8.000 neue Input-Tokens aus Anweisungen und Repository-Kontext und erhält einen Patch mit Erklärung von 2.000 Tokens zurück. Zu den oben verifizierten Tarifen kosten 100 Aufrufe vor Caching zwischen $0.168 und $1.56.
| Modell | Kosten für 100 Aufrufe | Formel |
|---|---|---|
| DeepSeek V4 Flash | $0.168 | 100 × (0.008 × $0.14 + 0.002 × $0.28) |
| MiniMax M3 | $0.48 | 100 × (0.008 × $0.30 + 0.002 × $1.20) |
| GPT-5.4 mini | $1.50 | 100 × (0.008 × $0.75 + 0.002 × $4.50) |
| Kimi K2.7 Code | $1.56 | 100 × (0.008 × $0.95 + 0.002 × $4.00) |
Wenn die Abnahmekontrollen schwach sind, kann schon ein einziger fehlgeschlagener Retry den Preisunterschied pro Aufruf übersteigen. Ein kaputter Patch, der ins Review oder in die Produktion gelangt, kostet deutlich mehr als jeder dieser API-Aufrufe.
Repository-Agenten können stabile Prompt- und Code-Präfixe wiederverwenden. Die offiziellen Preise für gecachten Input liegen bei $0.0028/M für DeepSeek V4 Flash, $0.06/M für MiniMax M3, $0.19/M für Kimi K2.7 Code und $0.075/M für GPT-5.4 mini. Geänderte Dateien und Tool-Traces bleiben frischer Input.
Bei Chat, Klassifizierung und anderen Nicht-Coding-Workloads liegt die erforderliche Fähigkeitsgrenze anders. Der umfassendere Vergleich der günstigsten LLM-APIs behandelt diese Standardtarife separat.
„Groq und Cerebras sind bei der Inferenz rasend schnell, drosseln aber stark, sobald man ein mittleres Volumen erreicht.“ — Bericht eines Entwicklers auf r/ArtificialInteligence
Dieser Bericht ist ein Testfall, keine allgemeingültige Aussage über einen Anbieter. Messt die APIs in der engeren Auswahl mit der Zahl paralleler Worker, die ihr tatsächlich einsetzen wollt.
Welche günstige API zu welchem Coding-Workflow passt
Welche LLM-API fürs Programmieren am günstigsten ist, hängt davon ab, wie Fehler abgefangen werden. DeepSeek ist die günstigste Standardwahl, wenn jeder Patch durch deterministische Prüfungen läuft. Kimi ist in dieser Stichprobe die sicherere Wahl, wenn das Modell selbst Edge Cases abdecken muss.
| Workflow | Empfehlung | Warum | Nicht geeignet, wenn |
|---|---|---|---|
| Prototypen mit Tests und Typecheck | DeepSeek V4 Flash | $0.14/$0.28 und eine korrekte finale Implementierung | Die Automatisierung möglicherweise den ersten Codeblock ohne Prüfung anwendet |
| Unbeaufsichtigte Coding-Agent-Schleifen | Kimi K2.7 Code | Vollständigste Implementierung und Testauswahl in dieser Stichprobe | Latenz oder die niedrigste Tokenrechnung die entscheidende Einschränkung ist |
| Interaktive Editor-Aktionen | GPT-5.4 mini | 13.6s, in diesem Durchlauf deutlich schneller als die anderen drei | Generierte Tests jede genannte Invariante abdecken sollen |
| Budgetarbeit mit großem Kontext | MiniMax M3 | $0.30/$1.20 bis 512K unter dem dauerhaften Rabatt | Strikte Concurrency- und Fehlersemantik für die Aufgabe zentral sind |
Ein winziges allgemeines Chatmodell würde ich nicht allein deshalb einsetzen, weil sein Output $0.08/M kostet. Eine günstige Coding-API muss Patches erzeugen, die die Prüfungen des eigenen Workflows bestehen. Gibt es keine automatisierte Kontrolle, sollte die Vollständigkeit beim ersten Versuch wichtiger sein als der niedrigste Listenpreis.
Günstig starten, gezielt eskalieren statt dauerhaft ein Modell nutzen
Ein zweistufiger Ablauf macht den niedrigsten Tokenpreis nutzbar, ohne ihm blind zu vertrauen. Die Modellauswahl sollte vom Ergebnis deterministischer Checks abhängen, nicht von Prompt-Länge oder einem subjektiven Confidence-Score.
- Den ersten Versuch an DeepSeek V4 Flash senden.
- Formatter, Typechecker, Unit-Tests und alle aufgabenspezifischen versteckten Tests des Repositorys ausführen.
- Den Patch akzeptieren, wenn alle Prüfungen erfolgreich sind.
- Bei einem Fehlschlag die ursprüngliche Aufgabe, den fehlgeschlagenen Patch und kompakte Testausgaben an Kimi K2.7 Code senden; wenn interaktive Latenz zählt, stattdessen GPT-5.4 mini nutzen.
- Die Zahl der Eskalationsversuche begrenzen, damit ein Agent nicht unbegrenzt an einem einzelnen Problem ausgibt.
Dieser Ablauf bewahrt DeepSeeks Sub-Cent-Ökonomie für unkomplizierte Aufgaben und bezahlt den höheren Tarif nur bei gemessenen Fehlschlägen. Eine einzelne OpenAI-kompatible Modellschicht macht den Wechsel zu einer Änderung des Modellnamens statt zu vier separaten Integrationen; das AIReiter LLM API directory stellt die Modelle über einen Endpunkt bereit.
FAQ
Welche ist die günstigste LLM-API fürs Programmieren?
DeepSeek V4 Flash war in diesem Test mit $0.14/M Input und $0.28/M Output die günstigste codingfähige API. Sie erzeugte eine korrekte finale Implementierung, enthielt in ihrer Antwort aber auch einen fehlerhaften verworfenen Entwurf. Deshalb sollte sie mit automatisierten Checks kombiniert werden.
Ist DeepSeek gut genug für Coding-Agenten?
DeepSeek V4 Flash ist gut genug für einen günstigen ersten Versuch, wenn der Agent Tests, Typechecking und Formatierung bestehen muss, bevor ein Patch akzeptiert wird. Bei unbeaufsichtigten Aufgaben ohne starke Checks lieferte Kimi K2.7 Code in dieser Ein-Aufgaben-Stichprobe die vollständigere Antwort.
API-Abrechnung oder Coding-Abo: Was ist günstiger?
Berechnet die monatlichen API-Kosten anhand der gemessenen Input- und Output-Tokens mit den Tarifen aus der Tabelle. Vergleicht diese Summe dann mit dem Abopreis, Request-Limits und der Frage, ob API- oder Agent-Zugang enthalten ist. Keines der beiden Abrechnungsmodelle ist grundsätzlich günstiger.
Die Routing-Regel in einem Satz
Startet Coding-Aufgaben mit DeepSeek V4 Flash, akzeptiert nur Patches, die deterministische Checks bestehen, und eskaliert Fehlschläge an Kimi K2.7 Code beziehungsweise latenzkritische Arbeit an GPT-5.4 mini. Die Preise sind verifiziert; die Qualitätsreihenfolge basiert auf einer eingegrenzten Aufgabe und sollte im eigenen Repository erneut geprüft werden.
