AIREITER

Qwen3.8-Flash-Next: Vorschau auf die Qwen4-Architektur

Zuletzt aktualisiert: 2026-08-28 03:44:30

Alibaba hat am 25. August 2026 auf ModelScope einen Countdown für Qwen3.8-Flash-Next gestartet – ein Modell, das die Architektur der nächsten Generation vorwegnimmt, noch bevor die dazugehörige Produktfamilie überhaupt existiert. Zum Zeitpunkt der Veröffentlichung sollten die Gewichte am 26. August um 23:00 Uhr UTC+8 erscheinen. Der eigentliche Zweck: Das Open-Source-Inferenz-Ökosystem soll genügend Vorlauf bekommen, um Kernel, Quantisierungen und Serving-Unterstützung zu entwickeln, bevor Qwen4 startet.

Was Qwen3.8-Flash-Next ist – und was nicht

Qwen3.8-Flash-Next ist ein multimodales Mixture-of-Experts-Modell (MoE), das auf der für die kommende Qwen4-Familie vorgesehenen Architektur basiert. Qwen4 selbst ist es nicht. Am besten lässt sich das Modell als Technologiedemonstrator verstehen: Es macht die neuen Aufmerksamkeitsmechanismen, die Layer-Struktur und die Sparsity-Muster praktisch zugänglich, damit Inferenz-Frameworks schon vor dem vollständigen Qwen4-Release Unterstützung einbauen können.

Auf der Hugging-Face-Seite des Qwen-Teams wird das Modell als „Upcoming release“ und als „A Preview of the Qwen4 Architecture“ geführt. Die ModelScope-Countdown-Seite trug den Slogan „Onward to the Next-Gen — Lightning-Fast.“ Beide Seiten gehören zu offiziellen Qwen-Kanälen. Der Release ist damit bestätigt – zum Zeitpunkt der Veröffentlichung aber noch nicht vollständig erfolgt.

Qwen3.8-Flash-Next Hugging Face listing

Diese Angaben sind offiziell bestätigt, jene Punkte dagegen weiterhin Spekulation der Community:

Über offizielle Kanäle bestätigtNoch nicht bestätigt
Open-Weight-Release auf ModelScope und Hugging FaceEndgültige Parameterzahlen (125B/6B/51B)
Multimodalität (Vision + Text)Lizenz (wahrscheinlich Apache 2.0 aufgrund bisheriger Releases)
GDN-Hybridarchitektur und Qwen Sparse AttentionBenchmark-Ergebnisse jeglicher Art
FP8-Variante (Qwen/Qwen3.8-Flash-Next-FP8)API-Preise oder Verfügbarkeit
Architekturvorschau auf Qwen4Kontextlänge (spekuliert werden 256K nativ, erweiterbar auf 1M)

Die Zahlen, die derzeit überall zitiert werden – 125B Parameter insgesamt, 6B pro Token aktiv und 51B N-Gramm-Embeddings – stammen aus einer ModelScope-Karte, die kurzzeitig sichtbar war und anschließend vom Qwen-Team gekürzt wurde. Sie sind plausibel und wurden von mehreren unabhängigen Beobachtern übereinstimmend gemeldet. Eine belastbare offizielle Dokumentation sind sie allerdings nicht. SaaSCity-Gründer ghosty brachte es auf den Punkt:

„Wer heute ein Benchmark-Diagramm für dieses Modell veröffentlicht, hat es sich ausgedacht.“

Eine Architektur, die Inferenz-Frameworks vor neue Aufgaben stellt

Drei architektonische Bausteine unterscheiden Qwen3.8-Flash-Next deutlich von den bisherigen Qwen-Modellen. Für jeden davon braucht es neue Kernel-Implementierungen in den Inferenz-Frameworks – eine reine Anpassung der Konfiguration reicht nicht.

GDN-Layer: Rekurrenter Zustand mit fester Größe und weniger Speicherbedarf bei langen Kontexten

Gated Delta Network (GDN) ersetzt in den meisten Layern die klassische Attention. Bei herkömmlichen Transformer-Modellen wächst der KV-Cache mit der Sequenzlänge. GDN arbeitet stattdessen mit einem rekurrenten Zustand fester Größe. In den GDN-Layern bleibt der Speicherbedarf unabhängig von der Kontextlänge konstant, während die Berechnung linear statt quadratisch skaliert. Die Full-Attention-Layer der Hybridarchitektur verwenden weiterhin einen KV-Cache, um präzise Abrufe zu ermöglichen.

In der Praxis werden lange Kontexte dadurch deutlich günstiger. Eine Unterhaltung mit 100K Tokens benötigt nicht automatisch Speicher für einen KV-Cache derselben Größe. Für die Qwen3.8-Architektur wird auf Basis einer kurzzeitig sichtbaren ModelScope-Karte eine Mischung aus 69 GDN-Layern und 23 Full-Attention-Layern berichtet – also ein Verhältnis von ungefähr 3:1. Die Full-Attention-Layer sichern die Qualität beim globalen Abruf, während die GDN-Layer den Großteil der Sequenzverarbeitung übernehmen.

Für Qwen ist das Prinzip nicht völlig neu. Qwen3-Next (September 2025) führte Gated DeltaNet mit 80B Parametern insgesamt und 3B aktiven Parametern ein. Auch die Qwen3.5/3.6/3.7-Familie soll laut Berichten auf ein ähnliches Hybridmuster gesetzt haben. Neu ist bei Flash-Next vor allem die Größenordnung: 125B Parameter in dieser Architektur – ergänzt um die beiden folgenden Komponenten.

QSA: Sparse Attention, über deren genaue Funktionsweise noch wenig bekannt ist

Qwen Sparse Attention (QSA) wird auf der Modellkarte genannt, aber nicht näher erklärt. Nach Einschätzung der Community ersetzt QSA dichte Attention durch ein sparsames Muster: Jedes Token greift nur auf eine Teilmenge anderer Tokens zu, nicht auf die gesamte Sequenz. Offen ist, ob dafür lernbare Sparsity, Block-Sparsity, Sliding Windows oder eine Kombination dieser Verfahren zum Einsatz kommen. Erst der technische Bericht wird zeigen, ob QSA lediglich eine schrittweise Verbesserung oder tatsächlich ein neuer Attention-Grundbaustein ist.

Die 51B-N-Gramm-Tabelle: Speculative Decoding ohne separates Draft-Modell

Das ungewöhnlichste Merkmal ist eine Embedding-Tabelle mit 51B Parametern für N-Gramme. Die derzeitige Arbeitshypothese der Community: Sie dient als schneller Token-Lookup-Mechanismus – im Grunde als integriertes Draft-Modell für Speculative Decoding. Statt ein separates kleines Modell zu betreiben, das die nächsten Tokens vorschlägt und anschließend vom Hauptmodell überprüfen lässt, liefert die N-Gramm-Tabelle direkt günstige Kandidaten für das nächste Token.

Die offenen Fragen sind erheblich: Muss die Tabelle vollständig im VRAM liegen oder lässt sie sich per Memory Mapping einbinden? Wie verhält sie sich bei Quantisierung? Ist sie in der Angabe von 125B enthalten oder kommt sie zusätzlich dazu? Solange der technische Bericht oder erste Community-Benchmarks diese Punkte nicht klären, sollte die Zahl von 51B bei der Deployment-Planung als variable Größe und nicht als fixer Kostenfaktor behandelt werden.

Wo Flash-Next im Qwen-Stammbaum einzuordnen ist

Flash-Next ist eher ein paralleler Entwicklungszweig als der nächste Schritt einer linearen Modellgeneration:

ModellVeröffentlichtParameter gesamtAktive ParameterRolle
Qwen3-NextSep 202580B3BErster Test der GDN-Architektur
Qwen3.8-27BAug 202627B (dicht)27BLeistungsstarkes Dense-Modell der Mittelklasse
Qwen3.8-MaxAug 2026~2.4T~95BOffenes Flaggschiffmodell
Qwen3.8-Flash-NextAug 26, 2026~125B~6BArchitekturvorschau auf Qwen4
Qwen4TBD (Monate)UnbekanntUnbekanntVollständige Next-Gen-Familie

Als grobe Faustformel verwendet die Community derzeit: sqrt(125B x 6B) = 27B. Wenn diese Näherung trägt, könnte Flash-Next eine Qualität liefern, die ungefähr einem 27B-Dense-Modell entspricht, während der Rechenaufwand bei der Inferenz eher in der Größenordnung eines 6B-Modells liegt. Lucas Souza von Beer And Code weist allerdings zu Recht darauf hin: Das ist eine Faustregel, kein Theorem. Die Qualität des Routings, der Trainingsdaten und der Beitrag der N-Gramm-Tabelle sind bislang nicht vermessen.

Die Strategie wird in mehreren Community-Analysen als „Plattformstrategie statt Benchmark-Strategie“ beschrieben. Inferenz-Frameworks wie llama.cpp, vLLM und SGLang sollen Kernel-Unterstützung integrieren, bevor Qwen4 erscheint. Unsloth hat bereits angekündigt, an Day-Zero-Support zu arbeiten.

Lässt sich das Modell überhaupt ausführen? Der Hardware-Realitätscheck

FormatUngefährer Speicherbedarf der Gewichte
BF16 / FP16~250 GB
FP8~125 GB
Q4 / 4 Bit~65–70 GB

Diese Werte gelten nur für die Gewichte – Kontext, KV-Cache und Laufzeit-Overhead sind noch nicht eingerechnet. Ein auf Q4 quantisiertes Modell benötigt für die Hauptgewichte ungefähr 65–70 GB, hinzu kommt der Speicherbedarf der 51B-N-Gramm-Tabelle. Muss diese Tabelle im VRAM liegen, steigt der Gesamtbedarf über das hinaus, was die meisten Einzelrechner bewältigen können. Lässt sie sich in den Arbeitsspeicher auslagern, könnte ein System mit 128 GB oder mehr gemeinsamem Speicher ausreichen – etwa ein maximal ausgestattetes Mac Studio (M2 Ultra / M3 Ultra), AMD Strix Halo oder NVIDIA DGX Spark. Eine einzelne RTX 4090 oder 5090 reicht nicht aus.

Auf Reddit widersprach u/KURD_1_STAN der Beschreibung als „lokalfreundliches“ Modell: „Bei so hohen RAM-Preisen – wie kann man das lokal-freundlich nennen?“ Die Lücke zwischen dem Marketing mit „6B aktiv“ und einem Speicherbedarf von 250 GB ist real. Auf X merkte @Dicklong1999 an, dass das Sparse-Aktivierungsmuster für Besitzer entsprechender Hardware durchaus eine vernünftige Generierungsgeschwindigkeit ermöglichen könnte. Für „125B können normale Nutzer das lokale Ausführen im Grunde vergessen“.

Was bei API-Verfügbarkeit und Preisen zu erwarten ist

Preise und Verfügbarkeit der API für Qwen3.8-Flash-Next waren zum Zeitpunkt der Veröffentlichung noch nicht bekannt. Qwen3.8-Max kostet laut der offiziellen Qwen-Preisseite 2,00 $ pro Million Input-Tokens und 6,00 $ pro Million Output-Tokens. Mit 6B aktiven Parametern dürfte Flash-Next deutlich günstiger ausfallen. Die FP8-Variante halbiert den Speicherbedarf der Gewichte gegenüber BF16 und bietet sich damit als Format für API-Serving an. Die tatsächliche Verfügbarkeit hängt von der Unterstützung durch die Inferenz-Frameworks ab – nach dem Release der Gewichte lohnt sich ein Blick in die Kataloge der Anbieter.

Was du vor dem Release der Gewichte erledigen solltest

Für Entwickler und Forschende, die prüfen möchten, ob Qwen3.8-Flash-Next für den eigenen Stack relevant ist, bietet sich folgende Checkliste an:

1. Hardware prüfen. Wer das Modell lokal betreiben möchte, sollte sicherstellen, dass mindestens 128 GB gemeinsamer Speicher oder ein Multi-GPU-System vorhanden sind. Falls nicht, bleibt der Zugriff über eine API.

2. Das Hugging-Face-Repository beobachten. Die Modellkarte wird voraussichtlich die erste belastbare Quelle für tatsächliche Spezifikationen, Lizenz und Kontextlänge sein. Am besten huggingface.co/Qwen/Qwen3.8-Flash-Next speichern.

3. Die eigene Evaluierung vorbereiten. Benchmark-Prompts und Auswertungsskripte sollten vor dem Release bereitstehen. Die ersten 24 Stunden an Community-Benchmarks werden mehr Aussagekraft haben als beliebige offizielle Zahlen.

4. Keine Produktions-Workloads umstellen. Unabhängige Benchmarks gibt es noch nicht. Die Architektur ist neu, die Laufzeitunterstützung steckt noch in den Kinderschuhen und die Lizenz ist unbestätigt. Für die Evaluierung ist das Modell interessant – nicht für Aufgaben, bei denen ein Ausfall unmittelbar Geld kostet.

5. Wer Inferenz-Tools pflegt, sollte jetzt anfangen. Die Kombination aus GDN und QSA erfordert Kernel-Arbeit, keine bloßen Konfigurationsänderungen. Wer die Architektur früh versteht, kann schneller Support ausliefern.

FAQ

Wann sind die Gewichte verfügbar?

Der ModelScope-Countdown verwies auf den 26. August 2026 gegen 23:00 Uhr UTC+8. Spiegelungen auf Hugging Face erscheinen typischerweise innerhalb weniger Stunden nach einem ModelScope-Release. Das Qwen-Team bestätigte den Zeitplan über offizielle Kanäle: @Alibaba_Qwen teaserte „what surprise we're dropping tonight“, während @QwenDevs das Modell direkt beim Namen nannte.

Ist das Qwen4?

Nein. Es handelt sich um eine Vorschau auf die Qwen4-Architektur, die unter der Bezeichnung Qwen3.8 veröffentlicht wird. Qwen4 selbst wird in Monaten, nicht in Wochen erwartet. Flash-Next soll dem Ökosystem Zeit geben, die Laufzeitunterstützung vorzubereiten, bevor die vollständige Familie erscheint.

Welche Lizenz verwendet das Modell?

Das ist noch nicht bestätigt. Die jüngeren Open-Weight-Releases von Qwen (Qwen3.8-27B, Qwen3.8-Max) wurden unter Apache 2.0 veröffentlicht, was auch hier das wahrscheinlichste Ergebnis ist. Sobald die Gewichte verfügbar sind, sollte die Angabe auf der Modellkarte überprüft werden.

Lässt sich das Modell auf einer RTX 4090 ausführen?

Nein. Selbst in Q4-Quantisierung benötigen allein die Hauptgewichte ungefähr 65–70 GB. Eine einzelne RTX 4090 verfügt über 24 GB. Erforderlich ist ein System mit mindestens 128 GB gemeinsamem Speicher (Mac Studio, Strix Halo) oder mehrere GPUs mit viel VRAM.

Ist das Modell besser als Qwen3.8-27B?

Das ist unbekannt. Benchmarks gibt es noch nicht. Die Heuristik sqrt(125B x 6B) = 27B deutet auf eine vergleichbare Qualität zu einem 27B-Dense-Modell hin, ist aber eine Schätzung und keine Messung. Für eine belastbare Einschätzung muss man unabhängige Evaluierungen für den jeweiligen Anwendungsfall abwarten.

Wie schnell wird das Modell sein?

Die Zahl von 6B aktiven Parametern pro Token deutet auf eine Generierungsgeschwindigkeit hin, die eher einem kleinen Modell als einem 125B-Schwergewicht entspricht. Allerdings sind das Speicherzugriffsmuster der N-Gramm-Tabelle und die Effizienz der GDN-Kernel noch unbekannt. Erste Community-Benchmarks werden diese Fragen beantworten.

Wird das Modell auf API-Plattformen verfügbar sein?

Sehr wahrscheinlich. Die FP8-Variante ist geradezu für API-Serving prädestiniert. AIReiter und andere Plattformen nehmen Qwen-Modelle üblicherweise innerhalb weniger Tage nach einem Gewichts-Release auf. Der Engpass ist die Unterstützung der neuartigen Attention-Mechanismen durch die Frameworks.

Was ist aus dem Qwen3-Next des vergangenen Jahres geworden?

Qwen3-Next startete im September 2025 mit 80B Parametern insgesamt und 3B aktiven Parametern und führte Gated DeltaNet ein. Das Modell war ein Architekturtest im kleineren Maßstab und zeigte, dass der GDN-Hybridansatz funktionieren kann. Flash-Next ist die hochskalierte Fortsetzung. Der X-Nutzer @LufzzLiz bezeichnete die Next-Serie des vergangenen Jahres als „was a letdown“ – genau deshalb sind Benchmarks diesmal besonders wichtig.