Ein schnelles Qwen-Modell für Coding und umfangreiche Aufgaben
Qwen3.8 Flash ist Alibabas Geschwindigkeitsstufe von Qwen3.8. Es wurde für Coding, Tool-nutzende Agenten und Dokumente entwickelt, die nicht in einen kurzen Chat passen.
Großes Modell, geringe Kosten
125 Milliarden Parameter insgesamt, wobei etwa 6 Milliarden pro Token genutzt werden. Deshalb bleibt es schnell und günstig genug für Workloads mit hohem Volumen.
1 Million Tokens Kontext
Übergeben Sie eine lange Spezifikation, eine Sammlung von Dateien oder einen langen Agenten-Trace in einer einzigen Anfrage. Eine einzelne Antwort kann bis zu 131.072 Tokens umfassen.
Liest Bilder ebenso wie Text
Das Modell versteht Screenshots, Diagramme und Dokumente, nicht nur reinen Text. Nutzen Sie es, wenn die Aufgabe von Bildschirminhalten ausgeht.
Etwa $0.057 / $0.193
Pro Million Tokens kostet Input etwa $0.057 und Output etwa $0.193 – ungefähr die Hälfte des offiziellen Listenpreises. Gecachter Input ist günstiger. Die Preisanzeige oben zeigt den Live-Tarif.
Die Stärken von Qwen3.8 Flash
Qwens eigene Modellkarte, veröffentlicht mit dem Release im August 2026, bewertet Flash beim Coding und der Tool-Nutzung unter den verglichenen Modellen am höchsten.
Repository-Arbeit
SWE-bench Pro 62.5. SWE-bench Multilingual 81.0. Nutzen Sie es, um Fehler zu finden, mehrere Dateien zu bearbeiten und das Ergebnis zu überprüfen.
Agenten, die Tools aufrufen
DeepSWE 58.7. Toolathlon 73.5. Es meistert mehrstufige Loops: Fehler analysieren, ein Tool aufrufen und es erneut versuchen.
Code und anspruchsvolle Fragen
LiveCodeBench v6 liegt bei 91.9. GPQA Diamond bei 91.7. Kompetitive Programmierung und wissenschaftliche Fragestellungen liegen im Bereich des Möglichen.
Bildschirminhalte analysieren
OSWorld-Teilscore 52.3. MathVision 90.6 bzw. 95.7 mit Code-Ausführung. Screenshots und Diagramme können direkt mit der Frage übergeben werden.
Flash oder Max
Wählen Sie Flash
Coding-Agenten, Test-and-Fix-Loops, lange Dokumente und alle Workloads, bei denen die Kosten eine Rolle spielen. Das 1M-Fenster deckt lange Traces ab, ohne sie aufteilen zu müssen.
Wählen Sie Max
Qwen3.8 Max ist das 2,4-Billionen-Flaggschiff. Nutzen Sie es, wenn Sie das leistungsstärkste Qwen möchten und der Token-Preis zweitrangig ist. Aufrufbar unter /chat/qwen3-8-max.
Identische Anfrage-Struktur
Beide Modelle akzeptieren eine normale Chat-Completion. Setzen Sie für Flash das Modell auf qwen3.8-flash. Erhöhen Sie max tokens, wenn die Antwort einen langen Trace erfordert. Der Standardwert liegt bei 8.192 und das Maximum bei 131.072.
Fragen
Kontext, Preise, Bilder und der Vergleich mit Max.
/ 01Wofür ist Qwen3.8 Flash gedacht?
Schnelles Coding, Tool-nutzende Agenten und lange Dokumente. Es ist das günstigere, schnellere Qwen3.8, keine verkleinerte Kopie von Max.
/ 02Wie lang ist der Kontext?
1 Million Tokens. Eine Antwort kann bis zu 131.072 Tokens umfassen.
/ 03Wie viel kostet es?
Etwa 0,057 $ Input und 0,193 $ Output pro Million Tokens, etwa die Hälfte des offiziellen Listenpreises. Das Lesen aus dem Cache kostet weniger. Es gibt keine zusätzliche Gebühr pro Tool-Aufruf. Der Preisbalken zeigt den Live-Tarif.
/ 04Kann es Bilder verarbeiten?
Ja. Screenshots, Diagramme und Dokumentbilder sind neben Text fester Bestandteil des Modells.
/ 05Wann sollte ich stattdessen Qwen3.8 Max verwenden?
Wenn Sie das Flaggschiff möchten und mehr pro Token zahlen können. Max ist das 2.4T-Modell. Flash ist die Variante für hohe Volumen.