Lancés à quelques jours d'intervalle à la fin juillet 2026, MiniMax H3 et Flux 3 ont rapidement été mis à l'épreuve par des utilisateurs de Reddit, avec les mêmes prompts. Aucun ne l'emporte sur tous les tableaux : H3 se distingue par la résolution, la fidélité audio et le contrôle via références multimodales ; Flux 3 prend l'avantage sur l'amplitude créative, la durée des clips et la stylisation cinématographique. Le bon choix dépend donc avant tout des contraintes de production qui comptent pour vous.
Les spécifications qui font vraiment la différence
Sur le socle, MiniMax H3 et Flux 3 se ressemblent : les deux génèrent de la vidéo avec audio natif à partir de texte ou d'images. Mais leurs limites techniques ne sont pas les mêmes :
| Fonctionnalité | MiniMax H3 | Flux 3 Video |
|---|---|---|
| Résolution maximale | 2K (par défaut) | 720p / 1080p |
| Durée maximale | 15 secondes | 20 secondes |
| Audio | Son stéréo natif | Toujours activé (ambiance + dialogues) |
| Entrées de référence | Jusqu'à 9 images, 3 vidéos, 3 audios (limite de 12 fichiers) | Image de départ, ou première + dernière image |
| Poids ouverts | Oui (HuggingFace) | Non (API Early Access uniquement) |
| Modes | Texte vers vidéo, image vers vidéo, référence vers vidéo, première/dernière image | Texte vers vidéo, image vers vidéo, vidéo vers vidéo, image-clé vers vidéo, prolongation audio |
H3 monte à 2K, mais ses clips s'arrêtent à 15 secondes. Flux 3 va jusqu'à 20 secondes, avec un plafond fixé à 1080p. Point important côté workflow : selon la documentation de l'API MiniMax V2, le mode références et le mode première/dernière image de H3 ne peuvent pas être utilisés simultanément.
Le prix réel d'un clip de 10 secondes
Les tarifs varient fortement selon le fournisseur. MiniMax commercialise H3 directement via l'API de sa plateforme, tandis que Flux 3 est proposé via Black Forest Labs Early Access et des plateformes partenaires.
| Fournisseur | Modèle | Résolution | Coût par seconde | Coût d'un clip de 10 s |
|---|---|---|---|---|
| Plateforme MiniMax | H3 | 2K | $0.13 | $1.30 |
| Plateforme MiniMax | H3 | 768p (bêta) | $0.09 | $0.90 |
| fal.ai | H3 | 2K | $0.26 | $2.60 |
| LetzAI | Flux 3 | 720p | ~100 crédits/s | ~1 000 crédits |
| LetzAI | Flux 3 | 1080p | ~160 crédits/s | ~1 600 crédits |
L'API directe de MiniMax est l'accès le moins cher à H3 : $0.13/s en 2K, soit $1.95 pour 15 secondes. Chez fal.ai, le tarif double, à $0.26/s. Impossible, en revanche, de comparer directement les crédits de Flux 3 aux dollars de MiniMax sans connaître le taux de conversion en dollars des crédits de chaque fournisseur.
Audio : l'avantage net de H3
Un utilisateur de Reddit ayant testé les mêmes prompts sur les deux modèles l'a formulé sans détour :
"Un point que j'ai remarqué, surtout au casque : Minimax H3 ÉCRASE littéralement Flux 3 côté audio. C'est particulièrement évident dans les deux derniers clips, mais si vous avez un casque, fermez les yeux, relancez la vidéo et écoutez simplement l'écart de qualité audio. Flux 3 n'est pas juste moins bon : l'audio est clairement moins bon." - GrayingGamer, r/StableDiffusion
H3 génère un son stéréo natif : dialogues, bruitages et ambiance sont répartis dans un véritable champ stéréo. Flux 3 inclut systématiquement de l'audio, sans option pour le désactiver, et certains timbres de voix peuvent paraître plus naturels. En revanche, sa couche sonore d'ambiance et d'environnement est sensiblement plus plate. Dans les scènes de documentaire animalier ou d'animation, le paysage sonore de H3 apporte une immersion que Flux 3 n'atteint pas.
La comparaison des voix est plus nuancée. La voix du personnage viking de Flux 3 a semblé plus naturelle à certains auditeurs, tandis que les voix de narration documentaire et de dessin animé de H3 ont été jugées plus expressives. Aucun des deux modèles ne produit un son prêt pour la diffusion professionnelle, mais H3 conserve un avantage clair en matière de design sonore environnemental.
Qualité visuelle : chacun brille selon la scène
Dans une comparaison Reddit sur quatre prompts, chaque modèle s'est imposé dans des scènes différentes :
Avantage Flux 3 : une scène cinématographique de drakkar viking et un vol à dos de dragon en vue subjective. Flux 3 offrait un étalonnage plus filmique, des personnages humains plus crédibles en mouvement et un rendu cinéma plus affirmé. L'esthétique de film d'époque — grain, compression de l'objectif, lumière dorée de fin de journée — est précisément le terrain où le modèle de BFL excelle.
Avantage H3 : un documentaire animalier montrant une créature aux ailes de cristal traversant l'eau, ainsi qu'un dessin animé 2D avec une jeune fille squelette. H3 a livré davantage de détails grâce à la 2K, une meilleure cohérence de texture sur les ailes de la créature et une animation de personnage plus expressive dans le style cartoon. La voix off du documentaire suivait également proprement le rythme des images.
Une réserve importante s'impose : le testeur Reddit comparait le modèle H3 grand public quantifié en int8 à la version API complète de Flux 3. Le commentateur Pyros-SD-Models a relevé que H3 en précision bf16 complète paraît "bien meilleur que ce que l'OP a publié" dans la scène viking. Le modèle à poids ouverts en pleine précision pourrait donc réduire l'écart cinématographique observé avec la version quantifiée. Ces résultats reposent sur un seul test de quatre prompts, et non sur un benchmark systématique.
La physique reste inconstante chez les deux modèles. L'utilisateur Reddit kaidu observe : "Même si H3 est bon, il présente encore beaucoup de glitches et de problèmes de physique. Curieusement, ils semblent surgir de façon assez aléatoire. Dans tes exemples, par exemple : le dragon qui marche sur l'eau paraît très réaliste, tandis que les gens qui rament sont absolument catastrophiques." Flux 3 connaît des échecs arbitraires similaires : ses cycles de marche dans la scène viking ont été qualifiés d'"horribles".
Références multimodales : le vrai atout de H3
D'après l'API MiniMax V2, H3 accepte dans une même génération jusqu'à 9 images, 3 clips vidéo et 3 clips audio en référence, dans la limite de 12 fichiers. Vous pouvez lui donner une instruction en langage naturel telle que : "Reprends le mouvement de caméra d'Hitchcock de la Vidéo 1, fais chanter le personnage de l'Image 2, avec des voix correspondant à l'Audio 3." H3 effectue lui-même les correspondances entre ces éléments.
Flux 3 se limite à une image de départ pour l'image-vers-vidéo, ou à une paire première et dernière image pour l'animation par images-clés, selon la documentation FLUX 3 de BFL. Il n'est pas possible de lui fournir en même temps une image de référence stylistique, une vidéo de référence de mouvement et une référence audio.
Pour les workflows commerciaux — plans produit, publicités cohérentes avec une marque, scènes à personnages nécessitant une continuité avec les références — l'écart fonctionnel est décisif. En contrepartie, l'API de H3 impose une séparation entre le mode références et le mode première/dernière image. Impossible de combiner références multimodales et images-clés de début et de fin dans le même appel API.
Accès et écosystème de fournisseurs
| Mode d'accès | MiniMax H3 | Flux 3 |
|---|---|---|
| API officielle | platform.minimax.io | bfl.ai/models/flux-3 (Early Access) |
| API tierce | fal.ai, Krea, OpenArt, Sogni | LetzAI, Comfy Cloud, fal.ai |
| Poids ouverts | HuggingFace | Pas encore (FLUX 3 Dev prévu) |
| Déploiement local | ComfyUI (int8/bf16 GGUF) | Non |
H3 a publié ses poids ouverts quelques jours après son lancement, et ils sont désormais disponibles sur HuggingFace. Les développeurs peuvent l'exécuter localement via ComfyUI, avec des versions GGUF quantifiées. Flux 3 reste fermé : le plan de lancement de BFL prévoit une version à poids ouverts appelée "FLUX 3 Dev", mais sans date annoncée.
Quel modèle choisir ?
| Votre priorité | Choisissez | Pourquoi |
|---|---|---|
| Résolution maximale | H3 | 2K native, contre un plafond de 1080p pour Flux 3 |
| Clip unique le plus long | Flux 3 | 20 secondes, contre 15 pour H3 |
| Qualité audio | H3 | Son stéréo et ambiance plus riche |
| Références multimodales | H3 | 9 images + vidéo + audio dans un seul appel |
| Rendu cinématographique / rétro | Flux 3 | Étalonnage et esthétique filmique supérieurs |
| Tarif API direct publié | H3 | $0.13/s en 2K directement chez MiniMax ; les crédits Flux 3 varient selon le fournisseur |
| Vidéo vers vidéo | Flux 3 | H3 ne propose pas V2V via le même endpoint |
| Poids ouverts / local | H3 | Poids disponibles dès maintenant ; Flux 3 est fermé |
| Vidéo produit commerciale | H3 | Rendu du texte et des marques, cohérence des références, détail 2K |
| Réalisation créative | Flux 3 | Meilleure direction artistique par prompt et plus grande variété de styles |
Le schéma est simple : choisissez H3 dès lors que la précision, la résolution, la fidélité aux références ou un tarif API direct publié sont prioritaires. Préférez Flux 3 lorsque la direction créative prime sur les caractéristiques techniques, avec des plans plus longs, une esthétique stylisée et des workflows vidéo-vers-vidéo.
Peut-on enchaîner des clips au-delà de la durée maximale ?
Oui, mais l'approche diffère selon le modèle. Le mode première/dernière image de H3 permet d'utiliser la dernière image d'un clip comme image de départ du suivant. Il devient ainsi possible d'assurer la continuité entre deux clips de 15 secondes, pour une séquence d'environ 30 secondes. L'image-clé commune maintient la composition et l'identité des personnages. Flux 3 prend en charge l'"agentic chaining" : comme l'explique BFL, cette méthode relie des clips individuels en séquences multi-plans à l'aide de références visuelles afin de préserver la cohérence des personnages d'une scène à l'autre. Aucun des deux modèles ne génère un clip unique au-delà de sa limite annoncée, mais les deux peuvent être prolongés avec un minimum de planification.
FAQ
Peut-on exécuter MiniMax H3 en local ?
Oui. Peu après le lancement, MiniMax a publié les poids du modèle H3 sur HuggingFace. Des configurations communautaires pour ComfyUI existent aux formats GGUF int8 et bf16. Le modèle en pleine précision exige beaucoup de VRAM, mais les versions quantifiées tournent sur des GPU grand public.
Quel modèle rend le mieux le texte dans les vidéos ?
Selon les tests officiels de MiniMax, H3 démontre de meilleures capacités de rendu du texte et des logos de marque au sein des images vidéo générées. C'est un point clé pour les workflows publicitaires où les noms de produits ou le texte d'interface doivent apparaître correctement dans le résultat.