Ende Juli 2026 kamen MiniMax H3 und Flux 3 im Abstand weniger Tage auf den Markt. Kurz darauf ließ die Reddit-Community beide Modelle mit identischen Prompts gegeneinander antreten. Ein eindeutiger Gesamtsieger ergibt sich daraus nicht: H3 punktet bei Auflösung, Klangqualität und der Steuerung über multimodale Referenzen. Flux 3 spielt seine Stärken bei kreativer Bandbreite, Clip-Länge und cineastischer Stilisierung aus. Entscheidend ist also, welche Ausgabeanforderungen in deinem Workflow Priorität haben.
Die Specs, die den Unterschied machen
Bei den Grundlagen liegen MiniMax H3 und Flux 3 nah beieinander: Beide erzeugen Videos inklusive nativem Audio aus Text- und Bildvorgaben. Bei den technischen Grenzen gehen ihre Ansätze jedoch deutlich auseinander:
| Merkmal | MiniMax H3 | Flux 3 Video |
|---|---|---|
| Maximale Auflösung | 2K (standardmäßig) | 720p / 1080p |
| Maximale Dauer | 15 Sekunden | 20 Sekunden |
| Audio | Nativer Stereo-Sound | Immer aktiv (Umgebung + Dialog) |
| Referenzeingaben | Bis zu 9 Bilder, 3 Videos, 3 Audiodateien (Limit: 12 Dateien) | Startbild oder erstes + letztes Bild |
| Open Weights | Ja (HuggingFace) | Nein (nur Early-Access-API) |
| Modi | Text-zu-Video, Bild-zu-Video, Referenz-zu-Video, erstes/letztes Bild | Text-zu-Video, Bild-zu-Video, Video-zu-Video, Keyframe-zu-Video, Audio-Fortsetzung |
H3 liefert maximal 2K, endet aber nach 15 Sekunden. Flux 3 kommt auf 20 Sekunden, bleibt jedoch bei 1080p. Eine wichtige Einschränkung im Workflow: Laut der MiniMax V2 API-Dokumentation schließen sich Referenzmodus und Modus mit erstem/letztem Frame bei H3 gegenseitig aus.
Was ein 10-Sekunden-Clip kostet
Die Preisstruktur fällt je nach Anbieter sehr unterschiedlich aus. MiniMax verkauft H3 direkt über seine Plattform-API, während Flux 3 über den Early Access von Black Forest Labs und Partnerplattformen verfügbar ist.
| Anbieter | Modell | Auflösung | Kosten pro Sekunde | Kosten für 10 Sekunden |
|---|---|---|---|---|
| MiniMax platform | H3 | 2K | $0.13 | $1.30 |
| MiniMax platform | H3 | 768p (Beta) | $0.09 | $0.90 |
| fal.ai | H3 | 2K | $0.26 | $2.60 |
| LetzAI | Flux 3 | 720p | ~100 Credits/s | ~1.000 Credits |
| LetzAI | Flux 3 | 1080p | ~160 Credits/s | ~1.600 Credits |
Über die direkte MiniMax-API ist H3 mit $0.13/s für 2K am günstigsten erhältlich, also $1.95 für 15 Sekunden. Bei fal.ai kostet dieselbe Leistung mit $0.26/s doppelt so viel. Die Credits von Flux 3 und die Dollarpreise von MiniMax lassen sich ohne Kenntnis des jeweiligen Umrechnungskurses nicht direkt vergleichen.
Audio: Hier liegt H3 vorn
Ein Reddit-Nutzer, der beide Modelle mit denselben Prompts getestet hat, formulierte es sehr deutlich:
"Eine Sache ist mir aufgefallen, besonders mit Kopfhörern: Bei Audio macht Minimax H3 Flux 3 absolut FERTIG. In den letzten beiden Clips ist es besonders offensichtlich. Setz Kopfhörer auf, schließ die Augen, spiel das Video noch einmal ab und hör nur auf den Unterschied bei der Tonqualität. Flux 3 ist nicht bloß schlechter – das Audio ist deutlich schlechter." - GrayingGamer, r/StableDiffusion
H3 erzeugt nativen Stereo-Sound: Dialoge, Umgebungsgeräusche und physische Effekte werden in einem echten Stereofeld abgemischt. Flux 3 liefert ebenfalls immer Audio – es gibt keinen Schalter zum Deaktivieren – und einzelne Stimmen können natürlicher klingen. Die Umgebungs- und Atmosphärenebene wirkt jedoch merklich flacher. Gerade bei Naturdokumentationen und Animationen schafft H3 mit seiner Klangkulisse eine Immersion, die Flux 3 nicht erreicht.
Bei den Stimmen ist das Bild differenzierter: Die Wikingerfigur von Flux 3 klang für einige Zuhörer natürlicher, während die Cartoon-Stimme und die Dokumentationsnarration von H3 als ausdrucksstärker wahrgenommen wurden. Sendefertigen Ton liefert keines der beiden Modelle, doch beim Sounddesign für die Umgebung hat H3 einen klaren Vorsprung.
Bildqualität: Je nach Szene andere Sieger
In einem Reddit-Vergleich mit vier Prompts entschied jedes Modell andere Szenen für sich:
Flux 3 lag vorn bei: einer cineastischen Wikingerschiff-Szene und einem Flug auf einem Drachen aus der Ich-Perspektive. Flux 3 lieferte ein besseres filmisches Color Grading, überzeugendere menschliche Figuren in Bewegung und insgesamt eine stärkere Kino-Ästhetik. Besonders bei historischen Looks mit Filmkorn, Lens Compression und Golden-Hour-Licht spielt das Modell von BFL seine Stärken aus.
H3 lag vorn bei: einer Naturdokumentation über ein kristallgeflügeltes Wesen im Wasser sowie einem animierten 2D-Cartoon mit einem Skelettmädchen. H3 brachte bei 2K schärfere Details, konsistentere Texturen auf den Flügeln des Wesens und ausdrucksstärkere Charakteranimation im Cartoon-Stil. Die Sprecherstimme der Dokumentation war sauber auf das Timing der Bilder abgestimmt.
Ein wichtiger Vorbehalt: Im Reddit-Test trat das quantisierte int8-Consumer-Modell von H3 gegen die vollständige API-Version von Flux 3 an. Der Kommentator Pyros-SD-Models merkte an, H3 sehe bei voller bf16-Präzision in der Wikingerszene „deutlich besser aus als das, was OP gepostet hat“. Das deutet darauf hin, dass die Open-Weights-Version bei voller Präzision den Abstand zur cineastischen Qualität der quantisierten Variante verringern könnte. Die Ergebnisse stammen aus einem einzelnen Test mit vier Prompts und nicht aus einem systematischen Benchmark.
Bei der physikalischen Plausibilität bleiben beide Modelle inkonsistent. Reddit-Nutzer kaidu beobachtete: „So gut H3 auch ist, es gibt immer noch viele Glitches und Physikprobleme. Seltsamerweise treten sie ziemlich willkürlich auf. In deinen Beispielen etwa: Der Drache, der auf dem Wasser läuft, sieht sehr realistisch aus, während die rudernden Menschen absolut furchtbar aussehen.“ Auch Flux 3 scheitert punktuell ähnlich willkürlich – die Laufzyklen in der Wikingerszene wurden als „furchtbar“ beschrieben.
Multimodale Referenzen: H3 mit klarem Vorsprung
Laut der MiniMax V2 API kann H3 in einer einzelnen Generierung bis zu 9 Bilder, 3 Videoclips und 3 Audioclips als Referenzen verarbeiten, bei einem Limit von 12 Dateien. Die Anweisung kann in natürlicher Sprache erfolgen: „Übernimm die Hitchcock-Kamerabewegung aus Video 1, lass die Figur aus Bild 2 singen und passe den Gesang an Audio 3 an.“ Die Verknüpfung der Referenzen übernimmt H3 intern.
Flux 3 beschränkt sich laut der FLUX-3-Dokumentation von BFL auf ein Startbild für Bild-zu-Video oder ein Paar aus erstem und letztem Frame für Keyframe-Animationen. Ein Stilreferenzbild, ein Video als Bewegungsreferenz und eine Audioreferenz lassen sich nicht gleichzeitig einspeisen.
Für kommerzielle Workflows – Produktaufnahmen, markenkonsistente Werbeinhalte oder figurenzentrierte Szenen mit durchgängigen Referenzen – ist das ein entscheidender funktionaler Unterschied. Der Haken: In der H3-API schließen sich Referenzmodus und Modus mit erstem/letztem Frame gegenseitig aus. Multimodale Referenzen und Keyframes an den Endpunkten lassen sich daher nicht im selben API-Aufruf kombinieren.
Anbieter, APIs und Verfügbarkeit
| Zugangsweg | MiniMax H3 | Flux 3 |
|---|---|---|
| Offizielle API | platform.minimax.io | bfl.ai/models/flux-3 (Early Access) |
| Drittanbieter-API | fal.ai, Krea, OpenArt, Sogni | LetzAI, Comfy Cloud, fal.ai |
| Open Weights | HuggingFace | Noch nicht (FLUX 3 Dev geplant) |
| Lokale Ausführung | ComfyUI (int8/bf16 GGUF) | Nein |
H3 erschien nur wenige Tage nach dem Launch mit offenen Weights und ist inzwischen auf HuggingFace verfügbar. Entwickler führen das Modell lokal über ComfyUI mit quantisierten GGUF-Versionen aus. Flux 3 bleibt Closed Source. Im Launch-Plan von BFL ist eine Open-Weights-Veröffentlichung unter dem Namen „FLUX 3 Dev“ vorgesehen, ein Datum gibt es jedoch nicht.
Welches Modell passt zu welchem Einsatz?
| Deine Priorität | Empfehlung | Warum |
|---|---|---|
| Maximale Auflösung | H3 | Natives 2K gegenüber dem 1080p-Limit von Flux 3 |
| Längster Einzelclip | Flux 3 | 20 Sekunden gegenüber 15 Sekunden bei H3 |
| Audioqualität | H3 | Stereo-Sound und reichhaltigere Umgebungsgeräusche |
| Multimodale Referenzen | H3 | 9 Bilder + Video + Audio in einem Aufruf |
| Cineastischer / Retro-Look | Flux 3 | Besseres Color Grading und stärkere Filmästhetik |
| Veröffentlichter Direktpreis der API | H3 | $0.13/s für 2K direkt bei MiniMax; die Credit-Preise von Flux 3 variieren je nach Anbieter |
| Video-zu-Video | Flux 3 | H3 bietet V2V nicht über denselben Endpunkt an |
| Open Weights / lokal | H3 | Weights sind bereits verfügbar, Flux 3 bleibt geschlossen |
| Kommerzielles Produktvideo | H3 | Text- und Markendarstellung, Referenzkonsistenz, 2K-Details |
| Kreatives Filmemachen | Flux 3 | Bessere promptgesteuerte Art Direction und größere Stilbandbreite |
Das Muster ist klar: H3 ist die bessere Wahl, wenn Präzision, Auflösung, Referenztreue oder veröffentlichte Direktpreise der API zählen. Flux 3 empfiehlt sich, wenn kreative Ausrichtung wichtiger ist als technische Spezifikationen – ebenso für längere Einstellungen, stilisierte Ästhetik und Video-zu-Video-Workflows.
Lassen sich Clips über das Zeitlimit hinaus verlängern?
Ja, allerdings auf unterschiedliche Weise. Im Modus mit erstem und letztem Frame lässt sich bei H3 das letzte Bild eines Clips als Startbild des nächsten verwenden. So können zwei 15-Sekunden-Clips zu einer Sequenz von ungefähr 30 Sekunden verbunden werden. Der gemeinsame Keyframe hält Bildaufbau und Figurenidentität auf Kurs. Flux 3 unterstützt laut der Beschreibung von BFL „agentic chaining“: Einzelne Clips werden mithilfe visueller Referenzen zu Sequenzen mit mehreren Einstellungen verknüpft, damit Figuren über Szenen hinweg konsistent bleiben. Keines der beiden Modelle erzeugt einen einzelnen Clip über sein jeweiliges Limit hinaus, doch mit Planung lassen sich beide verlängern.
FAQ
Lässt sich MiniMax H3 lokal ausführen?
Ja. MiniMax veröffentlichte die H3-Modell-Weights auf HuggingFace kurz nach dem Launch. Community-Konfigurationen für ComfyUI stehen im int8- und bf16-GGUF-Format bereit. Das Modell mit voller Präzision benötigt viel VRAM, quantisierte Varianten laufen jedoch auf Consumer-GPUs.
Welches Modell rendert Text in Videos besser?
Nach den offiziellen Tests von MiniMax zeigt H3 eine stärkere Darstellung von Text und Markenlogos innerhalb generierter Videoframes. Das ist besonders für Werbe-Workflows relevant, in denen Produktnamen oder UI-Texte korrekt im Ergebnis erscheinen müssen.