Ein Modell mit 124 Milliarden Parametern klingt normalerweise nach langsamer und teurer Inferenz. Ling 3.0 Flash geht einen anderen Weg: Pro Token werden nur rund 5,1B Parameter aktiviert – und aktuell lässt es sich kostenlos nutzen.
inclusionAI veröffentlichte das Hybrid-Reasoning-Modell am 23. Juli 2026. Es handelt sich um ein Mixture-of-Experts-Modell (MoE) für Agenten-Workloads wie Coding, Tool-Aufrufe, Recherche und lang laufende Aufgaben.
Ling 3.0 Flash im Überblick
Hinter Ling 3.0 Flash steht inclusionAI, die Forschungsgruppe hinter den Modellfamilien Ling und Ring von Ant Group. Ant Group ist das Fintech-Unternehmen hinter Alipay. „Flash“ bezeichnet die schnelle, kosteneffiziente Modellklasse unterhalb der deutlich größeren Flaggschiffmodelle des Konzerns.
Als Mixture-of-Experts-Modell bringt Ling 3.0 Flash insgesamt 124B Parameter mit, aktiviert pro Token aber nur etwa 5,1B davon. Bei Geschwindigkeit und Kosten verhält es sich damit eher wie ein kleines Modell.
Zugleich arbeitet es mit Hybrid Reasoning: Einfache Anfragen beantwortet es direkt, bei schwierigen Aufgaben schaltet es in einen ausführlicheren Denkmodus. inclusionAI zielt damit auf „Production-Scale Agents“ ab – also Workloads, die Tools aufrufen, browsen, Code schreiben und ausführen sowie über viele Schritte hinweg Zustand halten.
Der entscheidende Effizienzgewinn
Der Vergleich mit dem Vorgänger Ling 2.6 Flash zeigt, worauf inclusionAI hinauswill: Die Gesamtzahl der Parameter steigt von 104B auf 124B, während die aktiven Parameter pro Token von 7,4B auf 5,1B sinken.
Mehr Gesamtparameter schaffen mehr Kapazität für gespeichertes Wissen. Weniger aktive Parameter senken dagegen die Kosten für jedes erzeugte Token. Praktisch erhältst du also ungefähr die Inferenzkosten eines ~5B-Modells, greifst dabei aber auf die Kapazität von 124B Parametern zurück.
Besonders relevant ist das für Agenten. Wenn eine Aufgabe über viele Tool-Aufrufe hinweg Tausende Tokens erzeugt, bestimmen die Kosten pro Token die Rechnung. Dann bringt eine geringere Zahl aktiver Parameter mehr als eine größere Zahl auf dem Datenblatt.
Technisch basiert Flash auf einem hybriden Linear-Attention-Stack. inclusionAI beschreibt einen wiederkehrenden Block aus fünf KDA-Schichten mit linearer Attention und einer Full-Attention-Schicht mit MLA. Lineare Attention hält lange Eingaben günstig, während die regelmäßig eingestreute Full-Attention-Schicht die präzise Erinnerung bewahrt, die rein linearen Modellen fehlt. Dadurch erreicht Flash ein natives Kontextfenster von 256K und bietet Spielraum in Richtung 1M. Router weisen dies als 262K aus – die exakte Tokenanzahl beträgt 262.144.
Wofür das Modell gedacht ist
Flash ist auf agentische Aufgaben zugeschnitten, nicht auf offene Chats. inclusionAI nennt eine höhere Genauigkeit bei Tool-Aufrufen, stabilere Aufgaben über lange Abläufe hinweg und bessere Kompatibilität mit gängigen Agent-„Harness“-Frameworks. Auch die Launch-Demos passen dazu: eine 3D-Stadt in Blender, Multi-Agent-Recherche, Office-Aufgaben über MCP und Browser-Apps.
Beim Programmieren positioniert inclusionAI das Modell neben klassischer Codegenerierung besonders für räumliches und strukturelles Schlussfolgern, etwa bei Szenengittern und relativen Positionen.
Ein Vorbehalt zu den Benchmarks: Das Modell ist erst wenige Tage alt. Die verfügbaren Werte stammen daher von inclusionAI selbst oder aus frühen Community-Tests, nicht aus unabhängigen Evaluierungen. inclusionAI zufolge erreicht oder übertrifft Flash bei vielen Aufgaben das Flaggschiffmodell mit rund 1 Billion Parametern – bei einem Bruchteil der aktiven Parameter. In der Ergebnistabelle steht für den Denkmodus ein SWE-Bench-Pro-Wert von 56.63. Bis unabhängige Dritte diese Resultate bestätigen, sind das Herstellerangaben.
Ling 3.0 Flash jetzt kostenlos ausprobieren
Am schnellsten geht es über OpenRouter. Dort ist das Modell als inclusionai/ling-3.0-flash gelistet und zum Start mit $0 für Eingabe sowie $0 für Ausgabe bepreist – kostenlos bis zum 3. August 2026 (Preise geprüft am 24. Juli 2026). Auch bei ZenMux ist es kostenlos verfügbar. Beide Anbieter bieten eine OpenAI-kompatible API.
Ein minimaler Aufruf:
curl https://openrouter.ai/api/v1/chat/completions \
-H "Authorization: Bearer $OPENROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "inclusionai/ling-3.0-flash",
"messages": [{"role": "user", "content": "Write a Python function to parse a CSV."}]
}'
Jeder Client, der bereits mit chat/completions arbeitet, funktioniert nach dem Austausch von Base-URL, Key und Modellstring. Mit einem Model Router kannst du Ling 3.0 Flash außerdem per A/B-Test mit deinem aktuellen Modell auf denselben Prompts vergleichen, ohne etwas umschreiben zu müssen.
Zwei Punkte solltest du einplanen. Das kostenlose Angebot ist eine Aktion, daher ist nach Anfang August mit nutzungsbasierter Abrechnung zu rechnen. Zum Vergleich: Der Vorgänger Ling 2.6 Flash wird mit rund $0.01 für Eingabe und $0.03 für Ausgabe pro 1M Tokens gelistet. Außerdem wurde das Modell zum Start nur von einem Anbieter bedient – Durchsatz und Verfügbarkeit hängen also an diesem einen Backend.
Gibt es die Gewichte zum Download?
Hier enden Suchen nach „Ling 3.0 flash download“ oder „Ling 3.0 flash github“ vorerst in einer Sackgasse. Zum Launch wurden die Gewichte nicht veröffentlicht. Flash ist aktuell ausschließlich per API verfügbar.
Das ist anders als beim Vorgänger: Ling 2.6 Flash erschien mit offenen Gewichten auf Hugging Face und lässt sich heute lokal ausführen. Für Flash 3.0 gilt das nicht.
Wenn du das Modell selbst hosten oder auf eigener Hardware quantisieren möchtest, behalte die inclusionAI Hugging Face page im Blick. Dort liegen die Gewichte von 2.6; sollte die Gruppe ihrem bisherigen Muster folgen, würden dort auch 3.0-Gewichte erscheinen. Bis dahin sind die oben genannten API-Router der einzige Zugang.
Ling 3.0 Flash und Ling 2.6 Flash im Vergleich
| Ling 3.0 Flash | Ling 2.6 Flash | |
|---|---|---|
| Veröffentlicht | 23. Juli 2026 | 21. April 2026 |
| Gesamtparameter | 124B | 104B |
| Aktiv pro Token | ~5.1B | ~7.4B |
| Kontextfenster | 256K nativ (262K bei Routern) | 256K (262K bei Routern) |
| Offene Gewichte | Nicht zum Launch | Ja (Hugging Face) |
| Startpreis | Kostenlos bis 3. August 2026 | ~$0.01 Eingabe / $0.03 Ausgabe pro 1M |
| Schwerpunkt | Hybrid-Reasoning-Agenten, Tool-Nutzung, Coding | Schnelles Instruct-Modell für Agenten |
Kurz gesagt: 3.0 Flash reduziert den aktiven Rechenaufwand, gewinnt gleichzeitig an Gesamtkapazität und ergänzt einen Hybrid-Reasoning-Modus. Zudem erfolgt der Vertrieb API-first. Falls du lokal und offline nutzbare Gewichte brauchst, ist 2.6 Flash weiterhin die herunterladbare Variante.
FAQ
Ist Ling 3.0 Flash kostenlos?
Ja, vorerst. Auf OpenRouter ist es bis zum 3. August 2026 kostenlos, ebenso bei ZenMux. Nach Ablauf des Aktionszeitraums ist mit nutzungsbasierter Abrechnung zu rechnen.
Ist Ling 3.0 Flash Open Source? Kann ich es herunterladen oder auf GitHub finden?
Nicht zum Launch. Es wurden keine Gewichte veröffentlicht, daher ist das Modell nur per API verfügbar und es gibt weder Download noch Repository. Nutze OpenRouter (inclusionai/ling-3.0-flash) oder ZenMux. Das ältere Ling 2.6 Flash ist auf Hugging Face offen verfügbar; mögliche 3.0-Gewichte würden daher wahrscheinlich ebenfalls dort erscheinen.
Ist Ling 3.0 Flash ein chinesisches Modell?
Ja. Es wird von inclusionAI entwickelt, der KI-Forschungsgruppe mit Bezug zu Ant Group, dem chinesischen Fintech-Unternehmen hinter Alipay.
Wie groß ist Ling 3.0 Flash?
Es hat 124B Parameter insgesamt und aktiviert über sein MoE-Design rund 5,1B pro Token. Das native Kontextfenster beträgt 256K; inclusionAI zufolge lässt es sich in Richtung 1M skalieren.
Ling 3.0 Flash oder Ling 2.6 Flash: Welches Modell sollte ich nutzen?
Wähle 3.0 Flash für Hybrid-Reasoning-Agenten und niedrigere Kosten pro Token über die API. Nimm 2.6 Flash, wenn du Gewichte herunterladen und lokal ausführen musst, denn 3.0 ist noch nicht offen verfügbar.
