Qwen-Image-3.0: Was ist neu und wie man es verwendet

Zuletzt aktualisiert: 2026-07-21 07:20:59

In seinen Startbeispielen erstellt Qwen-Image-3.0 in einem einzigen Durchgang eine neunteilige Infografik: eine Herleitung aus der Physik, einen Beweis aus der Gruppentheorie, ein medizinisches Diagramm, einen Vergleich aus der Zellbiologie, wobei jedes Panel mit eigenen beschrifteten Diagrammen und Bildunterschriften gefüllt ist und jede Zeile kleingedruckten Textes weiterhin lesbar bleibt. Dieses eine Bild ist die klarste Zusammenfassung dessen, wofür das Bildmodell der dritten Generation von Qwen, veröffentlicht am 21. Juli 2026, tatsächlich gedacht ist.

Qwen-Image-3.0 official sample: a nine-panel infographic, each cell a separate complex diagram, generated as one image

*Offizielles Qwen-Image-3.0-Beispiel (über qwen.ai). Qwen sagt, dass das vollständige Gitter aus einem einzigen Prompt stammt und nicht aus neun Renderings zusammengesetzt wurde.*

Qwen fasst die Veröffentlichung mit einem Wort zusammen: „实“, ungefähr *substanziell* oder *praktisch*. Während 1.0 nach Genauigkeit strebte und 2.0 nach Reichweite, ist 3.0 auf produktive Arbeit ausgerichtet: Zeitungen, Storyboards, Prüfungsunterlagen, verschachtelte UI-Mockups und akademische Abbildungen, die auf den ersten Blick stimmig bleiben. Es geht weniger um ein einzelnes hübsches Bild als um dichte, informationsreiche Layouts, die bis ins Kleingedruckte korrekt bleiben.

Was Qwen-Image-3.0 tatsächlich ist

Qwen-Image-3.0 ist ein text-to-image foundation model vom Qwen-Team bei Alibaba, der dritte Eintrag in einer Reihe, deren besondere Stärke seit Langem das Text-Rendering ist. Qwen beschreibt die Generationen als eine Entwicklung: 1.0 war „präzise“, 2.0 war „präzise, vielfältig, vollständig, schön, echt“, und 3.0 ist „substanziell“. In der Praxis bedeutet das, dass es auf die Szenen abzielt, bei denen sich die meisten Bildgeneratoren noch immer schwertun (eine vollständige Zeitungsseite, ein Storyboard mit mehreren Panels, ein Screenshot innerhalb eines Screenshots), sodass die Ausgabe direkt in einen Design-, Bildungs-, E-Commerce- oder Content-Workflow übernommen werden kann.

Die drei Upgrades, die wichtig sind

Qwen ordnet die Veröffentlichung um drei Säulen herum. Ohne den Marketing-Sprech bringt Ihnen jede davon etwas Konkretes.

Rich Content: 4,5-k-Token-Prompts und komplexe One-Shot-Layouts

Die entscheidende Zahl ist die Prompt-Länge. Qwen-Image-3.0 akzeptiert bis zu 4,5k Tokens Eingabe, ein großer Sprung gegenüber der von der vorherigen Generation verarbeiteten Anweisungslänge von ungefähr 1k Tokens. Ein Token ist ein Textbaustein, den das Modell liest, daher bedeutet eine höhere Token-Zahl, dass Sie eine dichtere, stärker strukturierte Szene in einem Zug beschreiben können.

Max prompt input tokens: Qwen-Image-2.0 vs 3.0

Dieses Budget schaltet zwei Dinge frei. Das erste nennt Qwen *horizontales* Layout: das oben gezeigte Neun-Panel-Raster, bei dem jede Zelle ihre eigene detaillierte Infografik ist und das Ganze in einem Durchgang erzeugt wird. Nach Qwens Angaben hat es etwa 3,7k Tokens gekostet, dieses Raster vollständig zu beschreiben, weshalb die erhöhte Obergrenze wichtig ist: Das alte Limit konnte die Anweisung nicht aufnehmen.

Das Zweite ist *Tiefe*: das Verschachteln von Oberflächen in Oberflächen. Qwens Beispiel rendert ein VS-Code-Fenster, das ein Qwen-Chatfenster enthält, das einen WeChat-Chat enthält, der ein Kaffeeposter enthält; jede Ebene behält dabei ihre eigene realistische UI. Wenn Ihre Arbeit Mockups, Dashboards oder geschichtete Szenen umfasst, ist das das Upgrade, auf das Sie achten sollten.

Realistische Details: kleiner Text, der lesbar bleibt

Textdarstellung war schon lange die stärkste Eigenschaft der Qwen-Serie, und 3.0 senkt die Untergrenze auf 10px kleine Schrift, die lesbar bleibt. In den Beispielen hält das auch in schwierigen Fällen stand: eine ganze Seite akademisches LaTeX mit korrekten Hoch- und Tiefstellungen, griechischen Buchstaben und Theorem-Nummerierung; eine Zeitung mit dichtem Fließtext auf realistischem Papier; winzige Beschriftungen für Anmerkungen auf einer wissenschaftlichen Tafel.

Qwen-Image-3.0 official sample: an English-language research plate with fine labels, scale bars, and macro-level texture

*Offizielles Qwen-Image-3.0-Beispiel (über qwen.ai): eine Tafel im Taxonomie-Stil, aufgebaut um ein Foto herum, mit kleinen Beschriftungen und 0,5-mm-Maßstabsleisten, die scharf bleiben.*

Das Herausragende an diesen Beispielen ist, dass die kleine Schrift nicht zu einem unleserlichen Brei zusammenfällt. Bildunterschriften, Fußnoten und Achsenbeschriftungen behalten ihre Form auch bei Größen, bei denen unverständlicher Text normalerweise der Fehlerfall ist. Die Detailtreue geht auch über Text hinaus: Qwen zeigt Hauttexturen auf Poren- und Haarniveau, die an fotorealistische Darstellung heranreichen, und eine Bearbeitung, die ein beschädigtes traditionelles Tuschegemälde wiederherstellt, fehlende Bereiche auffüllt und zugleich den ursprünglichen Pinselstrich bewahrt.

Reiches Wissen: 12 Sprachen, 100+ Stile und webverbundene Ausgabe

Die dritte Säule ist die Breite. Qwen-Image-3.0 rendert 12 Sprachen nativ (Japanisch, Koreanisch und Spanisch gehören zu den Demos), unterstützt über 100 Kunststile und mehrere Schriftarten und erzeugt überzeugende simulierte UIs für Web, Spiele und Livestreams.

Qwen-Image-3.0 official sample: a dense, multi-section knowledge infographic with dozens of small captions

*Offizielles Qwen-Image-3.0-Beispiel (über qwen.ai): ein Wissensposter mit einem einzigen Bild, acht Abschnitten und Dutzenden kleiner Beschriftungen, alle lesbar.*

Zwei Fähigkeiten stachen besonders hervor. Es erstellt detaillierte Referenz-Infografiken aus einem echten Foto: Das oben gezeigte Bild ergänzt zu einem Ausgangsbild Taxonomie-Labels, Morphologie-Hinweise, eine vergrößerte Detailansicht und einen Maßstabsbalken. Und Qwen zeigt, wie es Live-Informationen aus dem Web abruft und in einer Demo eine Wettervorhersage-Grafik für eine bestimmte Stadt und ein bestimmtes Datum erzeugt. Das geht über „zeichne, was ich beschreibe“ hinaus in Richtung „zeichne, was aktuell ist“ — obwohl man, wie bei jeder erzeugten Darstellung, die Fakten vor dem Verlassen darauf noch prüfen würde.

Wie es sich mit anderen textstarken Bildmodellen vergleicht

Wenn Sie ein Modell für textlastige oder layoutlastige Arbeit auswählen, sind dies die realistischen Alternativen. Die unten stehenden Bewertungen sind richtungsweisend, nicht benchmarkbasiert: Qwen hat für 3.0 keine Scores veröffentlicht, daher wäre es geraten, irgendeine direkte Gegenüberstellung als Tatsache zu behandeln.

ModellTextdarstellungKomplexe LayoutsBearbeitungZugriffsmethode
Qwen-Image-3.0Sehr stark; 10px lesbar, LaTeX-NiveauSehr stark; 4,5k-Token, 9-Panel-One-ShotJa (Anmerkungen, Wiederherstellung)Qwen Studio, Qwen API
Qwen-Image-2.0StarkGut; ~1k-TokenJa (einheitlich)Qwen Studio, Endpunkte von Drittanbietern
Nano Banana ProGutGutJaGoogle; einheitliche API
Seedream 5 ProGutGutJaByteDance; einheitliche API
GPT-Image-2GutGutJaOpenAI; einheitliche API

Wenn Sie diese selbst vergleichen, trennen drei Tests ein „textfähiges“ Modell von einem zuverlässigen: ob kleine Schrift auch im Postermaßstab lesbar bleibt, ob Mehrbild-Layouts ihre Struktur behalten, statt zu einem Brei zu verschwimmen, und ob das Modell das echte Schriftsystem einer Sprache beibehält, statt es nur näherungsweise nachzubilden. Qwen hat die 3.0-Version genau um diese drei Punkte herum aufgebaut. Wenn Sie Nano Banana Pro, Seedream 5 oder GPT-Image-2 bereits über eine einzige API wie AIReiter nutzen, beachten Sie, dass Qwen-Image-3.0 in diesem Katalog noch nicht enthalten ist; derzeit läuft es nur auf der eigenen Plattform von Qwen.

Wie Sie Qwen-Image-3.0 heute ausprobieren können

Am Starttag ist der zuverlässige Weg Qwens eigene Plattform:

  • Qwen Studio auf chat.qwen.ai, im Web, auf iOS, Android, macOS und Windows. Es ist der direkteste Weg zum Modell am Starttag; öffne das Bildtool und gib dort deine Anweisung ein.
  • Qwen's API platform (Qwen Cloud) für programmatischen Zugriff.
  • Die Qwen-Image-Modellkarten auf Hugging Face für die technischen Details der Familie.

Um die Stärke von 4,5k Tokens auszunutzen, schreiben Sie einen Prompt, der die Struktur ausdrücklich festlegt: Benennen Sie jedes Panel, seine Überschrift und den genauen Text, den Sie darin haben möchten, statt nur einen einzelnen vagen Satz zu verwenden. Eine Vorlage zum Anpassen:

Erstelle ein einzelnes 2x2-Infografikposter, "Coffee Brew Methods".
Oben links — "Pour Over": 3 Schritte mit Beschriftungen (Filter spülen, 30 s aufblühen lassen, in Kreisen gießen), kleine Bildunterschrift "1:16 ratio, 92°C".
Oben rechts — "French Press": beschriftete Illustration, Bildunterschrift "4 min steep, coarse grind".
Unten links — "Espresso": Querschnitt eines Shots mit beschrifteten Schichten (crema, body, heart), Bildunterschrift "9 bar, 25-30s".
Unten rechts — "AeroPress": nummerierte Schritte, Bildunterschrift "inverted method".
Einheitlicher Flat-Illustration-Stil, gut lesbare kleine Bildunterschriften, weißer Hintergrund.

Je konkreter die Layout-Anweisung, desto mehr der neuen Funktionalität verwenden Sie tatsächlich.

Ein Vorbehalt aus den Tests am Launch-Tag: Am 21. Juli gab ein Drittanbieter-qwen/text-to-image-Endpunkt, den ich ausprobiert habe (über den Kie-Marktplatz), nach Annahme des Auftrags wiederholt 500-Fehler zurück. Das ist nur ein Anbieter, kein Beweis für einen ausfallweiten Plattformfehler, aber wenn heute ein nachgelagerter Qwen-Endpunkt bei Ihnen fehlschlägt, ist der sichere Weg, direkt zu Qwen Studio zu gehen, bis sich die Mirrors stabilisieren.

Was wir immer noch nicht wissen

Da dies vor Stunden gestartet ist, sind einige Dinge noch nicht öffentlich, und Sie sollten jeder Person, die sie als Tatsache darstellt, skeptisch gegenüberstehen:

  • Preise. In Qwens Ankündigung gibt es keine API-Preisübersicht. Jegliche spezifischen Kosten pro Bild, die Sie heute sehen, sind eine Schätzung.
  • Offene Gewichte. Frühere Qwen-Bildmodelle waren herunterladbar, aber Qwen hat nicht gesagt, ob die Gewichte von 3.0 veröffentlicht werden. In der Community wurde offen darüber diskutiert, ob Qwen sich in Richtung geschlossener Modelle bewegt, also gehen Sie nicht davon aus, dass Sie 3.0 bereits selbst hosten können.
  • Parameter und Benchmarks. Zu dieser Veröffentlichung wurden weder eine Parameterzahl noch ein Benchmark-Score genannt. Zahlen, die kursieren, gehören normalerweise zu 2.0.

FAQ

Ist Qwen Image 3 kostenlos?

Sie können Qwen-Image-3.0 über Qwen Studio unter chat.qwen.ai verwenden, das kostenlosen Zugriff auf die Qwen-Chat- und Bild-Tools bietet. Qwen hat die API-Preise noch nicht veröffentlicht, daher sind die Kosten für die programmatische Nutzung im bezahlten Tarif noch unbekannt.

Kann ich Qwen-Image-3.0 herunterladen?

Nicht bestätigt. Der Launch-Post von Qwen nennt nicht, ob die Gewichte von 3.0 zum Download offen verfügbar sein werden. Frühere Versionen waren auf Hugging Face verfügbar, aber behandeln Sie 3.0 bis auf Weiteres als nur in der Cloud nutzbar, bis Qwen etwas anderes sagt.

Wie unterscheidet sich Qwen Image 3 von 2.0?

Die größten Änderungen sind ein Sprung von ungefähr 1k auf 4.5k Token Prompt-Eingabe, lesbare 10px-Kleintextdarstellung, komplexe Layouts in einem einzigen Durchgang wie ein Raster mit neun Panels, nativer Text in 12 Sprachen und webbasiertes Generieren. Qwen beschreibt dies als den Wandel von „gut aussehend“ zu „nützlich“.

Unterstützt Qwen Image 3 nicht-englischen Text?

Ja. Qwen sagt, dass es 12 Sprachen nativ rendert, und die Demos umfassen Japanisch, Koreanisch und Spanisch, die jeweils in der echten Schrift der Sprache statt in angenäherten Zeichen dargestellt werden.

Wo kann ich Qwen Image 3 online verwenden?

Qwen Studio (chat.qwen.ai) ist der offizielle Online-Zugang mit Web- und Mobile-Apps. Programmatischer Zugriff ist über Qwens API-Plattform verfügbar.