AIREITER
QwenText Chat

Qwen3.8 Flash

Qwen3.8 Flash ist ein schnelles Modell für Coding, Agenten und lange Dokumente. 1M Kontext. Ca. $0.057 Input und $0.193 Output pro Million Tokens.

EingabeOffiziell $0.1143 pro 1 Mio. TokensAIReiter $0.0571 pro 1 Mio. TokensAusgabeOffiziell $0.3857 pro 1 Mio. TokensAIReiter $0.1929 pro 1 Mio. TokensCache-LesenOffiziell $0.0143 pro 1 Mio. TokensAIReiter $0.0071 pro 1 Mio. TokensCache-ErstellungOffiziell $0.1429 pro 1 Mio. TokensAIReiter $0.0714 pro 1 Mio. Tokens
Mit API ausführen

EINGABE

AUSGABE

Example
Generated in
42.7 seconds
Eingabe-Token
134
Ausgabe-Token
2354
Tokens per second
55.13 tokens / second
Time to first token
-

Modelldetails

Verwenden Sie denselben Modellschlüssel im Playground, in API-Anfragen und in internen Workflows.

Modell-ID
qwen3.8-flash
Anbieter
Qwen
Protokoll
OpenAI Chat Completions
Kontextfenster
1,000,000 Token
Maximale Ausgabe
131,072 Token
Eingabe-Token
5.7143 Credits / 1 Mio. Token
Ausgabe-Token
19.2857 Credits / 1 Mio. Token
Cache-Lesen
0.7143 Credits / 1 Mio. Token
Cache-Schreiben
7.1429 Credits / 1 Mio. Token

Ein schnelles Qwen-Modell für Coding und umfangreiche Aufgaben

Qwen3.8 Flash ist Alibabas Geschwindigkeitsstufe von Qwen3.8. Es wurde für Coding, Tool-nutzende Agenten und Dokumente entwickelt, die nicht in einen kurzen Chat passen.

Großes Modell, geringe Kosten

125 Milliarden Parameter insgesamt, wobei etwa 6 Milliarden pro Token genutzt werden. Deshalb bleibt es schnell und günstig genug für Workloads mit hohem Volumen.

1 Million Tokens Kontext

Übergeben Sie eine lange Spezifikation, eine Sammlung von Dateien oder einen langen Agenten-Trace in einer einzigen Anfrage. Eine einzelne Antwort kann bis zu 131.072 Tokens umfassen.

Liest Bilder ebenso wie Text

Das Modell versteht Screenshots, Diagramme und Dokumente, nicht nur reinen Text. Nutzen Sie es, wenn die Aufgabe von Bildschirminhalten ausgeht.

Etwa $0.057 / $0.193

Pro Million Tokens kostet Input etwa $0.057 und Output etwa $0.193 – ungefähr die Hälfte des offiziellen Listenpreises. Gecachter Input ist günstiger. Die Preisanzeige oben zeigt den Live-Tarif.

Die Stärken von Qwen3.8 Flash

Qwens eigene Modellkarte, veröffentlicht mit dem Release im August 2026, bewertet Flash beim Coding und der Tool-Nutzung unter den verglichenen Modellen am höchsten.

Repository-Arbeit

SWE-bench Pro 62.5. SWE-bench Multilingual 81.0. Nutzen Sie es, um Fehler zu finden, mehrere Dateien zu bearbeiten und das Ergebnis zu überprüfen.

Agenten, die Tools aufrufen

DeepSWE 58.7. Toolathlon 73.5. Es meistert mehrstufige Loops: Fehler analysieren, ein Tool aufrufen und es erneut versuchen.

Code und anspruchsvolle Fragen

LiveCodeBench v6 liegt bei 91.9. GPQA Diamond bei 91.7. Kompetitive Programmierung und wissenschaftliche Fragestellungen liegen im Bereich des Möglichen.

Bildschirminhalte analysieren

OSWorld-Teilscore 52.3. MathVision 90.6 bzw. 95.7 mit Code-Ausführung. Screenshots und Diagramme können direkt mit der Frage übergeben werden.

Flash oder Max

Flash ist das Modell, das Sie den ganzen Tag laufen lassen können. Max ist das Flaggschiff, wenn die Aufgabe anspruchsvoller ist als das Budget.
01

Wählen Sie Flash

Coding-Agenten, Test-and-Fix-Loops, lange Dokumente und alle Workloads, bei denen die Kosten eine Rolle spielen. Das 1M-Fenster deckt lange Traces ab, ohne sie aufteilen zu müssen.

02

Wählen Sie Max

Qwen3.8 Max ist das 2,4-Billionen-Flaggschiff. Nutzen Sie es, wenn Sie das leistungsstärkste Qwen möchten und der Token-Preis zweitrangig ist. Aufrufbar unter /chat/qwen3-8-max.

03

Identische Anfrage-Struktur

Beide Modelle akzeptieren eine normale Chat-Completion. Setzen Sie für Flash das Modell auf qwen3.8-flash. Erhöhen Sie max tokens, wenn die Antwort einen langen Trace erfordert. Der Standardwert liegt bei 8.192 und das Maximum bei 131.072.

Fragen

Kontext, Preise, Bilder und der Vergleich mit Max.

/ 01

Wofür ist Qwen3.8 Flash gedacht?

Schnelles Coding, Tool-nutzende Agenten und lange Dokumente. Es ist das günstigere, schnellere Qwen3.8, keine verkleinerte Kopie von Max.

/ 02

Wie lang ist der Kontext?

1 Million Tokens. Eine Antwort kann bis zu 131.072 Tokens umfassen.

/ 03

Wie viel kostet es?

Etwa 0,057 $ Input und 0,193 $ Output pro Million Tokens, etwa die Hälfte des offiziellen Listenpreises. Das Lesen aus dem Cache kostet weniger. Es gibt keine zusätzliche Gebühr pro Tool-Aufruf. Der Preisbalken zeigt den Live-Tarif.

/ 04

Kann es Bilder verarbeiten?

Ja. Screenshots, Diagramme und Dokumentbilder sind neben Text fester Bestandteil des Modells.

/ 05

Wann sollte ich stattdessen Qwen3.8 Max verwenden?

Wenn Sie das Flaggschiff möchten und mehr pro Token zahlen können. Max ist das 2.4T-Modell. Flash ist die Variante für hohe Volumen.