Bestes Open-Source-LLM für Coding: 48-facher Kostenunterschied in unserem Test

Zuletzt aktualisiert: 2026-07-17 10:09:07

Kurze Antwort: GLM-5.2 ist derzeit das stärkste Open-Source-LLM für Coding — bei längerer Nutzung liegt die Qualität der Ausgaben nahe an Claude Sonnet, und es ist das Modell, dem wir die schwierigsten Probleme geben würden. Es ist außerdem langsam und tokenhungrig, daher wählen Sie für schnelle API-Coding-Agents Kimi K2.7 Code, für die niedrigsten Kosten DeepSeek V4 Flash und für Ihre eigene 24-GB-GPU Qwen3.6-27B.

Das ist die Schlussfolgerung daraus, dieselben zwei Programmieraufgaben fünf Open-Source-Flaggschiffen zu geben, mit Claude Opus 4.8 als Closed-Source-Referenz. Alle lieferten korrekten Code. Den Unterschied machte aus, wie viele Tokens sie dafür verbrauchten, und dieser Unterschied war bei den Kosten bis zu 48-fach.

Eine Anmerkung zur Wortwahl: Fast alle davon sind technisch gesehen Open-Weight-Modelle: Die Gewichte sind frei, die Trainingsdaten nicht. Wir sagen „Open Source“, weil das der Begriff ist, nach dem Menschen suchen. Der Unterschied ist nur für eine FAQ-Antwort unten relevant.

Wie wir getestet haben

Zwei Aufgaben, derselbe Prompt für jedes Modell, gesendet am 17. Juli 2026 mit Standardeinstellungen:

  • Aufgabe 1: Schreibe eine Funktion zum Parsen von Dauern mit kniffligen Randfällen (12 Testfälle)
  • Aufgabe 2: Korrigiere eine fehlerhafte Funktion zum Zusammenführen von Intervallen (6 Testfälle)

Wir haben den Code lokal bewertet und pro Durchlauf drei Zahlen erfasst: Erfolgsrate, Ausgabe-Tokens und Ausführungszeit. Die Kosten ergeben sich aus den Tokens multipliziert mit dem Listenpreis des jeweiligen Anbieters, den wir am selben Tag verifiziert haben. Zwei Aufgaben sind ein Testlauf, kein Benchmark, aber es ist die Art von Routineanfrage, die Sie Hunderte Male senden werden.

Die Ergebnisse

Jedes Modell hat jeden Testfall bestanden. Die Tabelle unten dreht sich also um eines: Effizienz:

ModellAusgabetokens (beide Aufgaben)Zeit für Aufgabe 1Kosten
Kimi K2.7 Code2,18345.2s$0.0090
DeepSeek V4 Flash2,23116.7s$0.00066
DeepSeek V4 Pro2,52737.3s$0.0023
MiniMax M35,40936.7s$0.0067
GLM-5.27,13099.3s$0.0318
Claude Opus 4.8 (baseline)5398.1s
Output tokens used by each model to solve the same two coding tasks

Die Token-Spalte ist die eigentliche Geschichte. GLM-5.2 und MiniMax M3 sind „denkende“ Modelle: Standardmäßig schlussfolgern sie vor dem Antworten ausführlich. Dieses Schlussfolgern wird als Output abgerechnet. Für dieselbe korrekte Funktion schrieb GLM-5.2 3x mehr Tokens als Kimi K2.7 Code.

Es wird mit einem Token-Limit noch schlimmer. Als wir Antworten auf 2.048 Tokens begrenzten, verbrauchten beide Thinking-Modelle das gesamte Budget für das Reasoning und lieferten gar keinen Code. Sie zahlen, und bekommen nichts. GLM-5.2 brauchte ein Limit von 16.384 Tokens, bevor es fertig wurde, und seine zwei fehlgeschlagenen Versuche kosteten für sich genommen etwa 0,045 $. Wenn Sie ein Thinking-Modell in einem Coding-Agenten verwenden, erhöhen Sie max_tokens oder schalten Sie Thinking für Routineänderungen aus.

Cost to complete both test tasks at official API prices

Im Vergleich dazu löste Claude Opus 4.8 beide Aufgaben in 539 Tokens. Open Models haben bei der Korrektheit aufgeholt; bei der Kürze liegt die geschlossene Basislinie weiterhin um das 4-Fache vorn.

Die besten Open-Source-Coding-Modelle nach Bereitstellungsebene

Wählen Sie danach aus, wo das Modell ausgeführt wird. Preise gelten pro 1 Mio. Tokens, verifiziert am 2026-07-17.

Stärkstes Modell, wenn Sie darauf warten können: GLM-5.2

Bei harter, mehrstufiger Programmierarbeit kommt die Ausgabequalität von GLM-5.2 dem, was ein Open-Model derzeit an Claude-Niveau heranreicht, am nächsten — es führt bei den agentischen Benchmarks (SWE-Bench Pro, Terminal-Bench 2.1), und in unserer eigenen längeren Nutzung ist es das Modell, dem wir die Probleme anvertrauen, an denen die anderen scheitern. Mehr dazu in unserem GLM-5.2 API guide.

Der Preis dieser Qualität ist Geduld. Es war das langsamste und hungrigste Modell in unserem Test (99,3 s und 5.695 Tokens bei Task 1), und die träge Bereitstellung spiegelt eher die begrenzte GPU-Kapazität auf Seiten des Anbieters wider als das Modell selbst. 1,40 $ rein / 4,40 $ raus, 1 Mio. Kontext, schlichtes MIT. Gib ihm die harten Probleme und ein großes Token-Budget; leite schnelle Bearbeitungen anderswohin.

Am besten für schnelle API-Coding-Agenten: Kimi K2.7 Code

Das token-effizienteste Open-Model, das wir getestet haben: Sein Bugfix benötigte 259 Tokens, mit Claude-ähnlicher Knappheit. Es führt außerdem Kilos Task-Completion-Benchmark mit 60,7 % an.

Preisgestaltung: $0.95 für Eingaben / $4.00 für Ausgaben, $0.19 bei Cache-Treffern. Die einzige wirkliche Einschränkung ist der Kontext: 262K Tokens, während der Rest dieser Liste 1M bietet. Wie es sich im Vergleich zu seinem engsten Rivalen schlägt, sehen Sie unter Kimi K2.7 Code vs GLM-5.2.

Kimi K2.7 Code official pricing page showing $0.95 input and $4.00 output per million tokens

Bester Wert: DeepSeek V4 Flash

$0.14 in / $0.28 out, das mit Abstand günstigste Modell hier, und es hat trotzdem alles bestanden, was wir ihm vorgelegt haben, und war unter den Open-Models am schnellsten. Seine veröffentlichten Ergebnisse (79.0% SWE-Bench Verified, 91.6% LiveCodeBench) liegen innerhalb von zwei Punkten seines großen Bruders. Der Kontext beträgt 1M Tokens, die Lizenz ist schlicht MIT.

Beginnen Sie hier. Wechseln Sie erst zu V4 Pro, wenn bei der Arbeit mit mehreren Dateien die Lücke sichtbar wird.

DeepSeek official pricing docs showing V4 Flash and V4 Pro with OpenAI and Anthropic format endpoints

Am besten auf einer 24-GB-Consumer-GPU: Qwen3.6-27B

Ein kompaktes 27B, das 77,2 % auf SWE-Bench Verified erzielt und mit einem Modell, das auf eine einzelne Consumer-Grafikkarte passt, beinahe auf Flaggschiff-Niveau liegt – deshalb ist es die wiederkehrende Antwort in r/LocalLLaMA-Threads, die mit „Ich habe 24 GB VRAM.“ beginnen.

Sein schnelleres Geschwistermodell Qwen3-Coder-Next (80B insgesamt, nur 3B aktiv pro Token, Apache 2.0) ist der Community-Speed-Tipp: Ein Nutzer betrieb es mit ~20 Tokens/s auf einer einzelnen RX 9070 XT bei vollem 262K-Kontext. Wenn Sie es lieber als API aufrufen möchten, beginnt es bei 0,30 $/1,50 $ über Alibaba Cloud.

Bester Self-Host mit einer einzelnen GPU: Gemma 4 31B

Laut Googles Modellkarte passt das 31B auf eine einzelne 80GB H100 mit einem 256K-Kontext unter Apache 2.0. Die 12B-Variante läuft in 16GB VRAM.

Eine Größenfalle: MoE-Modelle werben mit kleinen „aktiven“ Parameterzahlen, aber man muss trotzdem die gesamten Gewichte speichern. DeepSeek V4 Flash aktiviert 13B pro Token, bringt aber insgesamt 284B auf die Waage, also selbst bei 4-Bit etwa 142GB. Das ist ein Multi-GPU-Projekt, keine Einzelkarte.

Beste Budget-Empfehlung für lange autonome Läufe: MiniMax M3

1 Mio. Kontext für $0.30/$1.20, entwickelt für mehrstündige Agent-Sitzungen — MiniMax hat einen 12-stündigen unbeaufsichtigten Forschungsdurchlauf demonstriert. Es teilt die Denkmodell-Ausführlichkeit, die Sie in der Ergebnistabelle gesehen haben, also planen Sie die Token entsprechend ein. Wenn bei einem langen Lauf Qualität wichtiger ist als Kosten, ist GLM-5.2 oben das Upgrade.

Was dir die Ranglisten nicht verraten

Die Benchmark-Zahlen liegen jetzt dicht beieinander: Stanfords AI Index stellte fest, dass sich der Abstand zwischen dem Modell auf Platz 1 und Platz 10 innerhalb eines Jahres von 11,9 % auf 5,4 % verringert hat. Drei Dinge, die die Score-Tabellen weiterhin verbergen:

Kosten pro Aufgabe sind besser als Kosten pro Token. Der Ausgabepreis von GLM-5.2 in Höhe von $4.40 liegt nahe an Kimis $4.00. Nach den tatsächlichen Token-Zahlen kostet dieselbe Aufgabe 3,5-mal mehr. Kilos Live-Statistiken zeigen den Extremfall: DeepSeek V4 Pro liegt im Durchschnitt bei $15.91 pro abgeschlossenem Benchmark-Versuch bei einem Listenpreis von $0.87.

Dasselbe Modell, anderes Harness, anderes Ergebnis. Ein Modell innerhalb einer gut konstruierten Agent-Loop (strukturierte Tools, Wiederholungsversuche, vernünftige Token-Limits) verhält sich ganz anders als dasselbe Modell in einem rohen Chat-Aufruf. Unsere GLM-Null-Code-Fehler waren eine Konfigurationsinteraktion, kein Fähigkeitsdefizit.

Jeder Benchmark misst eine andere Aufgabe. LiveCodeBench ist algorithmische Generierung; DeepSeek V4 Pro gewinnt ihn mit 93,5 %, über den veröffentlichten Werten der geschlossenen Modelle. SWE-Bench Verified ist Fehlerbehebung auf Repository-Ebene; Claude Mythos 5 führt weiterhin mit 95,5 %, während Open-Models bei etwa 80 % liegen. Ordnen Sie den Benchmark Ihrer tatsächlichen Arbeit zu, bevor Sie einem Ranking vertrauen.

Ersetzen eines Claude-Abonnements

Ein häufiger Auslöser für den Wechsel zu Open Source: die Abo-Grenzen von Claude mitten im Arbeitstag zu erreichen. Die Rechnung geht auf. Unser Zwei-Aufgaben-Test kostete $0.00066 auf DeepSeek V4 Flash; ein paar hundert solcher Aufrufe pro Tag bleiben trotzdem unter einem Dollar.

Der Wechsel ist außerdem weniger umständlich als früher. DeepSeek veröffentlicht einen mit Anthropic kompatiblen Endpoint (api.deepseek.com/anthropic), sodass Claude Code ihn mit einer Änderung der Umgebungsvariablen ansteuern kann; dieselbe Einrichtung funktioniert auch für GLM-5.2. Und wenn Sie Claude für die schwierigen Probleme behalten, während Sie Routinearbeiten an offene Modelle weiterleiten möchten, bieten Plattformen wie AIReiter Claude über dieselbe mit Anthropic kompatible Schnittstelle zu 20 % des Listenpreises an.

Kimi K3: der, den man im Auge behalten sollte

Moonshot hat Kimi K3 am 16. Juli 2026 veröffentlicht, und bei Frontend-Arbeiten hat es bereits das stärkste geschlossene Modell übertroffen: Platz 1 auf der Frontend-Code-Bestenliste mit 1.679 gegenüber 1.631 von Claude Fable 5, und erste Praxiserfahrungen deuten in dieselbe Richtung.

Es ist hier aus einem Grund nicht gerankt: die Gewichte werden am 27. Juli veröffentlicht. Bis dahin ist es eine geschlossene API unter $3/$15. Sobald sie verfügbar sind, wird K3 zum größten bisher veröffentlichten Open-Weight-Modell, und die obigen Frontend-Zahlen deuten darauf hin, dass es um die Spitze dieser Liste mitspielen wird. Wir verfolgen die Veröffentlichung der K3-Open-Weights separat.

Wie man auswählt

1. Wo wird es laufen? Unter 16GB VRAM: eine API verwenden (Gemma 4 12B passt lokal, aber erwarte einen deutlichen Qualitätsverlust). 24GB: Qwen3.6-27B. Ein H100: Gemma 4 31B. API: DeepSeek V4 Flash, bis sich zeigt, dass es nicht ausreicht. 2. Welche Art von Arbeit? Schnelle Bearbeitungen begünstigen knappe Modelle: Kimi K2.7 Code oder DeepSeek. Schwierige Probleme und lange Agentenläufe begünstigen GLM-5.2 (oder MiniMax M3 bei kleinerem Budget), mit großzügigen Token-Budgets. 3. Lizenzbeschränkungen? MIT (GLM, DeepSeek) und Apache 2.0 (Qwen, Gemma) haben keine Haken. Kimis modifizierte MIT fügt eine Namensnennungsregel hinzu, die erst bei sehr großem kommerziellem Maßstab greift.

FAQ

Was ist das beste Open-Source-LLM für das Programmieren im Jahr 2026?

GLM-5.2 hat das höchste Potenzial — bei schwierigen Problemen eine Ausgabe fast auf Claude-Sonnet-Niveau, allerdings auf Kosten der Geschwindigkeit. Kimi K2.7 Code gewinnt bei der Token-Effizienz für API-Agents, Qwen3.6-27B bei lokaler Hardware, DeepSeek V4 Flash bei den Kosten.

Kann ich diese Modelle lokal kostenlos ausführen?

Die Gewichte sind frei; die Hardware ist es nicht. Ein 27B-Modell benötigt eine 24GB-GPU, Gemma 4 31B will 80GB, und die Flaggschiffe mit Billionen Parametern sind nur per API oder Cluster verfügbar.

Was ist der Unterschied zwischen Open Source und Open Weight?

Open-Weight bedeutet freie Gewichte, aber private Trainingsdaten und privaten Code, was nahezu jedes Modell hier beschreibt. Vollständig Open-Source-Modelle (OpenCoder, StarCoder2, IBM Granite Code) veröffentlichen alles, liegen aber in der Leistungsfähigkeit zurück.

Gibt es ein Open-Source-LLM, das so gut wie Claude zum Programmieren ist?

Bei algorithmischen Benchmarks ja: DeepSeek V4 Pro mit 93,5 % auf LiveCodeBench übertrifft die veröffentlichten Werte geschlossener Modelle. Bei Korrekturen auf Repository-Ebene liegt Claude weiterhin vorn (95,5 % gegenüber ~80 % bei SWE-Bench Verified). In unserem Test erreichten die offenen Modelle bei der Korrektheit das Niveau von Claude, verbrauchten aber 4–13-mal mehr Tokens.

Welches Open-Source-LLM ist am besten für C++ oder Nischensprachen?

Kimis K2-Serie hat den stärksten Ruf für Nischensprachen (Moonshot hebt ausdrücklich Zig hervor). Für C++ verweist der Konsens in der Community auf DeepSeek V4 Pro und Qwen3 Coder Next. Wofür Sie sich auch entscheiden, testen Sie es an Ihrer eigenen Codebasis; die Qualität bei Nischensprachen variiert weitaus stärker, als Python-Benchmarks vermuten lassen.