AIREITER

MiniMax H3 vs. Flux 3 Video: Direktvergleich 2026

Zuletzt aktualisiert: 2026-08-07 03:15:22

Ende Juli 2026 kamen MiniMax H3 und Flux 3 im Abstand weniger Tage auf den Markt. Kurz darauf ließ die Reddit-Community beide Modelle mit identischen Prompts gegeneinander antreten. Ein eindeutiger Gesamtsieger ergibt sich daraus nicht: H3 punktet bei Auflösung, Klangqualität und der Steuerung über multimodale Referenzen. Flux 3 spielt seine Stärken bei kreativer Bandbreite, Clip-Länge und cineastischer Stilisierung aus. Entscheidend ist also, welche Ausgabeanforderungen in deinem Workflow Priorität haben.

Offizielle Ankündigungsseite von MiniMax H3 mit 2K-Video und nativem Stereo-Sound

Die Specs, die den Unterschied machen

Bei den Grundlagen liegen MiniMax H3 und Flux 3 nah beieinander: Beide erzeugen Videos inklusive nativem Audio aus Text- und Bildvorgaben. Bei den technischen Grenzen gehen ihre Ansätze jedoch deutlich auseinander:

MerkmalMiniMax H3Flux 3 Video
Maximale Auflösung2K (standardmäßig)720p / 1080p
Maximale Dauer15 Sekunden20 Sekunden
AudioNativer Stereo-SoundImmer aktiv (Umgebung + Dialog)
ReferenzeingabenBis zu 9 Bilder, 3 Videos, 3 Audiodateien (Limit: 12 Dateien)Startbild oder erstes + letztes Bild
Open WeightsJa (HuggingFace)Nein (nur Early-Access-API)
ModiText-zu-Video, Bild-zu-Video, Referenz-zu-Video, erstes/letztes BildText-zu-Video, Bild-zu-Video, Video-zu-Video, Keyframe-zu-Video, Audio-Fortsetzung

H3 liefert maximal 2K, endet aber nach 15 Sekunden. Flux 3 kommt auf 20 Sekunden, bleibt jedoch bei 1080p. Eine wichtige Einschränkung im Workflow: Laut der MiniMax V2 API-Dokumentation schließen sich Referenzmodus und Modus mit erstem/letztem Frame bei H3 gegenseitig aus.

Offizielle FLUX-3-Blogseite von Black Forest Labs zu multimodalen Videofunktionen

Was ein 10-Sekunden-Clip kostet

Die Preisstruktur fällt je nach Anbieter sehr unterschiedlich aus. MiniMax verkauft H3 direkt über seine Plattform-API, während Flux 3 über den Early Access von Black Forest Labs und Partnerplattformen verfügbar ist.

AnbieterModellAuflösungKosten pro SekundeKosten für 10 Sekunden
MiniMax platformH32K$0.13$1.30
MiniMax platformH3768p (Beta)$0.09$0.90
fal.aiH32K$0.26$2.60
LetzAIFlux 3720p~100 Credits/s~1.000 Credits
LetzAIFlux 31080p~160 Credits/s~1.600 Credits

Über die direkte MiniMax-API ist H3 mit $0.13/s für 2K am günstigsten erhältlich, also $1.95 für 15 Sekunden. Bei fal.ai kostet dieselbe Leistung mit $0.26/s doppelt so viel. Die Credits von Flux 3 und die Dollarpreise von MiniMax lassen sich ohne Kenntnis des jeweiligen Umrechnungskurses nicht direkt vergleichen.

Audio: Hier liegt H3 vorn

Ein Reddit-Nutzer, der beide Modelle mit denselben Prompts getestet hat, formulierte es sehr deutlich:

"Eine Sache ist mir aufgefallen, besonders mit Kopfhörern: Bei Audio macht Minimax H3 Flux 3 absolut FERTIG. In den letzten beiden Clips ist es besonders offensichtlich. Setz Kopfhörer auf, schließ die Augen, spiel das Video noch einmal ab und hör nur auf den Unterschied bei der Tonqualität. Flux 3 ist nicht bloß schlechter – das Audio ist deutlich schlechter." - GrayingGamer, r/StableDiffusion

H3 erzeugt nativen Stereo-Sound: Dialoge, Umgebungsgeräusche und physische Effekte werden in einem echten Stereofeld abgemischt. Flux 3 liefert ebenfalls immer Audio – es gibt keinen Schalter zum Deaktivieren – und einzelne Stimmen können natürlicher klingen. Die Umgebungs- und Atmosphärenebene wirkt jedoch merklich flacher. Gerade bei Naturdokumentationen und Animationen schafft H3 mit seiner Klangkulisse eine Immersion, die Flux 3 nicht erreicht.

Bei den Stimmen ist das Bild differenzierter: Die Wikingerfigur von Flux 3 klang für einige Zuhörer natürlicher, während die Cartoon-Stimme und die Dokumentationsnarration von H3 als ausdrucksstärker wahrgenommen wurden. Sendefertigen Ton liefert keines der beiden Modelle, doch beim Sounddesign für die Umgebung hat H3 einen klaren Vorsprung.

Bildqualität: Je nach Szene andere Sieger

In einem Reddit-Vergleich mit vier Prompts entschied jedes Modell andere Szenen für sich:

Flux 3 lag vorn bei: einer cineastischen Wikingerschiff-Szene und einem Flug auf einem Drachen aus der Ich-Perspektive. Flux 3 lieferte ein besseres filmisches Color Grading, überzeugendere menschliche Figuren in Bewegung und insgesamt eine stärkere Kino-Ästhetik. Besonders bei historischen Looks mit Filmkorn, Lens Compression und Golden-Hour-Licht spielt das Modell von BFL seine Stärken aus.

H3 lag vorn bei: einer Naturdokumentation über ein kristallgeflügeltes Wesen im Wasser sowie einem animierten 2D-Cartoon mit einem Skelettmädchen. H3 brachte bei 2K schärfere Details, konsistentere Texturen auf den Flügeln des Wesens und ausdrucksstärkere Charakteranimation im Cartoon-Stil. Die Sprecherstimme der Dokumentation war sauber auf das Timing der Bilder abgestimmt.

Ein wichtiger Vorbehalt: Im Reddit-Test trat das quantisierte int8-Consumer-Modell von H3 gegen die vollständige API-Version von Flux 3 an. Der Kommentator Pyros-SD-Models merkte an, H3 sehe bei voller bf16-Präzision in der Wikingerszene „deutlich besser aus als das, was OP gepostet hat“. Das deutet darauf hin, dass die Open-Weights-Version bei voller Präzision den Abstand zur cineastischen Qualität der quantisierten Variante verringern könnte. Die Ergebnisse stammen aus einem einzelnen Test mit vier Prompts und nicht aus einem systematischen Benchmark.

Bei der physikalischen Plausibilität bleiben beide Modelle inkonsistent. Reddit-Nutzer kaidu beobachtete: „So gut H3 auch ist, es gibt immer noch viele Glitches und Physikprobleme. Seltsamerweise treten sie ziemlich willkürlich auf. In deinen Beispielen etwa: Der Drache, der auf dem Wasser läuft, sieht sehr realistisch aus, während die rudernden Menschen absolut furchtbar aussehen.“ Auch Flux 3 scheitert punktuell ähnlich willkürlich – die Laufzyklen in der Wikingerszene wurden als „furchtbar“ beschrieben.

Multimodale Referenzen: H3 mit klarem Vorsprung

Laut der MiniMax V2 API kann H3 in einer einzelnen Generierung bis zu 9 Bilder, 3 Videoclips und 3 Audioclips als Referenzen verarbeiten, bei einem Limit von 12 Dateien. Die Anweisung kann in natürlicher Sprache erfolgen: „Übernimm die Hitchcock-Kamerabewegung aus Video 1, lass die Figur aus Bild 2 singen und passe den Gesang an Audio 3 an.“ Die Verknüpfung der Referenzen übernimmt H3 intern.

Flux 3 beschränkt sich laut der FLUX-3-Dokumentation von BFL auf ein Startbild für Bild-zu-Video oder ein Paar aus erstem und letztem Frame für Keyframe-Animationen. Ein Stilreferenzbild, ein Video als Bewegungsreferenz und eine Audioreferenz lassen sich nicht gleichzeitig einspeisen.

Für kommerzielle Workflows – Produktaufnahmen, markenkonsistente Werbeinhalte oder figurenzentrierte Szenen mit durchgängigen Referenzen – ist das ein entscheidender funktionaler Unterschied. Der Haken: In der H3-API schließen sich Referenzmodus und Modus mit erstem/letztem Frame gegenseitig aus. Multimodale Referenzen und Keyframes an den Endpunkten lassen sich daher nicht im selben API-Aufruf kombinieren.

Anbieter, APIs und Verfügbarkeit

ZugangswegMiniMax H3Flux 3
Offizielle APIplatform.minimax.iobfl.ai/models/flux-3 (Early Access)
Drittanbieter-APIfal.ai, Krea, OpenArt, SogniLetzAI, Comfy Cloud, fal.ai
Open WeightsHuggingFaceNoch nicht (FLUX 3 Dev geplant)
Lokale AusführungComfyUI (int8/bf16 GGUF)Nein

H3 erschien nur wenige Tage nach dem Launch mit offenen Weights und ist inzwischen auf HuggingFace verfügbar. Entwickler führen das Modell lokal über ComfyUI mit quantisierten GGUF-Versionen aus. Flux 3 bleibt Closed Source. Im Launch-Plan von BFL ist eine Open-Weights-Veröffentlichung unter dem Namen „FLUX 3 Dev“ vorgesehen, ein Datum gibt es jedoch nicht.

Welches Modell passt zu welchem Einsatz?

Deine PrioritätEmpfehlungWarum
Maximale AuflösungH3Natives 2K gegenüber dem 1080p-Limit von Flux 3
Längster EinzelclipFlux 320 Sekunden gegenüber 15 Sekunden bei H3
AudioqualitätH3Stereo-Sound und reichhaltigere Umgebungsgeräusche
Multimodale ReferenzenH39 Bilder + Video + Audio in einem Aufruf
Cineastischer / Retro-LookFlux 3Besseres Color Grading und stärkere Filmästhetik
Veröffentlichter Direktpreis der APIH3$0.13/s für 2K direkt bei MiniMax; die Credit-Preise von Flux 3 variieren je nach Anbieter
Video-zu-VideoFlux 3H3 bietet V2V nicht über denselben Endpunkt an
Open Weights / lokalH3Weights sind bereits verfügbar, Flux 3 bleibt geschlossen
Kommerzielles ProduktvideoH3Text- und Markendarstellung, Referenzkonsistenz, 2K-Details
Kreatives FilmemachenFlux 3Bessere promptgesteuerte Art Direction und größere Stilbandbreite

Das Muster ist klar: H3 ist die bessere Wahl, wenn Präzision, Auflösung, Referenztreue oder veröffentlichte Direktpreise der API zählen. Flux 3 empfiehlt sich, wenn kreative Ausrichtung wichtiger ist als technische Spezifikationen – ebenso für längere Einstellungen, stilisierte Ästhetik und Video-zu-Video-Workflows.

Lassen sich Clips über das Zeitlimit hinaus verlängern?

Ja, allerdings auf unterschiedliche Weise. Im Modus mit erstem und letztem Frame lässt sich bei H3 das letzte Bild eines Clips als Startbild des nächsten verwenden. So können zwei 15-Sekunden-Clips zu einer Sequenz von ungefähr 30 Sekunden verbunden werden. Der gemeinsame Keyframe hält Bildaufbau und Figurenidentität auf Kurs. Flux 3 unterstützt laut der Beschreibung von BFL „agentic chaining“: Einzelne Clips werden mithilfe visueller Referenzen zu Sequenzen mit mehreren Einstellungen verknüpft, damit Figuren über Szenen hinweg konsistent bleiben. Keines der beiden Modelle erzeugt einen einzelnen Clip über sein jeweiliges Limit hinaus, doch mit Planung lassen sich beide verlängern.

FAQ

Lässt sich MiniMax H3 lokal ausführen?

Ja. MiniMax veröffentlichte die H3-Modell-Weights auf HuggingFace kurz nach dem Launch. Community-Konfigurationen für ComfyUI stehen im int8- und bf16-GGUF-Format bereit. Das Modell mit voller Präzision benötigt viel VRAM, quantisierte Varianten laufen jedoch auf Consumer-GPUs.

Welches Modell rendert Text in Videos besser?

Nach den offiziellen Tests von MiniMax zeigt H3 eine stärkere Darstellung von Text und Markenlogos innerhalb generierter Videoframes. Das ist besonders für Werbe-Workflows relevant, in denen Produktnamen oder UI-Texte korrekt im Ergebnis erscheinen müssen.