Lancés à quelques jours d’intervalle fin juillet 2026, Flux 3 de Black Forest Labs et Seedance 2.5 de ByteDance génèrent tous deux des vidéos avec audio synchronisé. Leur différence la plus concrète se joue sur la durée : Flux 3 s’arrête à 20 secondes par clip, tandis que Seedance 2.5 monte à 30 secondes et autorise deux extensions.
Durée des clips : 20 secondes contre 30, puis les extensions
Flux 3 produit des clips allant jusqu’à 20 secondes en une seule génération, en HD (720p) ou en Full HD (1080p via upscaling), avec un audio natif généré en même temps que l’image. Pour construire des séquences plus longues, Black Forest Labs documente l’enchaînement agentique : des clips individuels reliés en séquences multi-plans. Le modèle propose aussi la continuation vidéo : fournissez jusqu’à quatre secondes de vidéo et d’audio existants, puis laissez-le prolonger la scène. Un mode brouillon permet de visualiser une version peu coûteuse avant de lancer le rendu final.
Seedance 2.5 peut générer jusqu’à 30 secondes d’un coup, puis accepter deux extensions, ce qui porte la durée narrative totale vers 90 secondes dans le même workflow d’extension. La page du modèle de ByteDance présente le récit multi-plans et la continuité entre les coupes comme des capacités centrales, et non comme des workflows additionnels.
Dans les faits, l’écart est de 10 secondes par génération, mais aussi d’approche. Flux 3 demande d’assembler des clips plus courts via des points de continuation explicites ; Seedance 2.5 prolonge la création dans un même pipeline. Pour une publicité de 60 secondes, Flux 3 nécessite au moins trois segments chaînés de 20 secondes, là où Seedance 2.5 peut la produire avec une génération de 30 secondes et une extension.
Peut-on dépasser 20 secondes en enchaînant des clips avec Flux 3 ? Oui : l’enchaînement agentique relie plusieurs clips de 20 secondes, et la fonction de continuation vidéo accepte 4 secondes de vidéo et d’audio en entrée pour générer le segment suivant.
Jusqu’où Seedance 2.5 peut-il aller avec les extensions ? Une génération de 30 secondes suivie de deux extensions produit environ 90 secondes de séquence continue. ByteDance ne documente pas de plafond strict au-delà de cette limite de deux extensions.
Audio natif et dialogues
Les deux modèles créent l’audio au sein même du système vidéo, et non lors d’une étape de post-production distincte. La différence tient au niveau de contrôle et aux possibilités de montage.
Flux 3 génère un audio natif pour toutes les sorties vidéo documentées : dialogues, effets sonores et ambiance sont produits dans le même passage que les visuels. Black Forest Labs met en avant les dialogues multilingues avec synchronisation labiale en anglais, chinois, espagnol, français, allemand, japonais, portugais, russe, italien, indonésien, turc, hindi et pendjabi.
Seedance 2.5 adopte une approche qui combine génération et montage. Sa génération conjointe audio-vidéo couvre les mêmes besoins — dialogues, ambiance et effets sonores — tandis que le modèle documente l’édition audiovisuelle après la génération initiale.
Retours de communauté, et non tests contrôlés : un utilisateur de Reddit ayant comparé les deux modèles sur le même prompt a résumé son constat ainsi : « He was typing on the numbers key tho lol. But audio seems better in Flux » (Mr__Earthling, r/Seedance_AI). Un autre commentateur a écrit : « Flux got the audio quality and film grade really well » (Icy_Foundation3534).
Seedance 2.5 propose-t-il un audio natif ? Oui. La génération conjointe audio-vidéo est une fonction centrale, et le modèle prend en charge la synchronisation labiale ainsi que l’édition audiovisuelle à partir du résultat généré.
Références visuelles et modes de contrôle
| Fonctionnalité | Flux 3 | Seedance 2.5 |
|---|---|---|
| Texte vers vidéo | ✅ | ✅ |
| Image vers vidéo | ✅ (animation ou référence visuelle) | ✅ |
| Vidéo vers vidéo | ✅ (reprend personnage/éléments dans une nouvelle scène) | ❌ non documenté |
| Images-clés vers vidéo | ✅ (définition des images de début et de fin) | ❌ non documenté |
| Continuation vidéo-audio | ✅ (à partir de 4 s d’entrée) | ✅ (deux extensions) |
| Contrôle par vidéo de référence | ❌ non documenté | ✅ |
| Édition audiovisuelle | ❌ non documenté | ✅ |
| Mode brouillon | ✅ (aperçu peu coûteux avant le rendu final) | ❌ non documenté |
| Dialogues multilingues | ✅ (14+ langues avec synchronisation labiale) | ✅ (fonction décrite, liste de langues non publiée) |
Le système de références de Flux 3 mise sur des points de contrôle explicites — images-clés, continuation vidéo et vidéo-vers-vidéo — alors que Seedance 2.5 privilégie le contrôle par vidéo de référence et l’édition audiovisuelle après génération. Cette distinction compte selon que votre workflow exige des transitions précises par images-clés avec Flux 3, ou l’utilisation d’une vidéo existante comme guide de style avec Seedance 2.5.
Résolution et rendu visuel
Flux 3 sort nativement en 720p, avec une option 1080p via upscaling. Black Forest Labs présente ce choix comme une décision délibérée pour l’accès anticipé : les évaluations préliminaires reposaient sur des clips de 10 secondes en 720p avec audio. Parmi les atouts visuels du modèle figurent une bonne génération typographique, une grande variété de styles — de séquences caméscope spontanées à l’animation et aux rendus cinématographiques — ainsi que la capture des expressions faciales.
Seedance 2.5 génère nativement jusqu’en 4K, selon la page du modèle de ByteDance. Son plafond de résolution dépasse donc ce que Flux 3 propose aujourd’hui. L’annonce de ByteDance met l’accent sur des mouvements plus fluides, des visuels plus cohérents et un réalisme accru.
Un utilisateur a écrit : « Flux seem to have nailed the style more, Seedance seem to have nailed the realism more » (EbbAppropriate9421, r/Seedance_AI). Un autre a ajouté que « Seedance 2.0 really sucks at doing any low quality video style. » Ces commentaires portent sur Seedance 2.0 : ils constituent donc un contexte communautaire indicatif, pas une preuve des performances de Seedance 2.5.
Le rendu de texte représente une autre différence visible. Un commentateur Reddit a relevé : « why is no one talking about the text generation?! seedance 2 is awful at text!! Looks like flux 3 nailed it » (digitalml). Les capacités typographiques de Flux 3 s’étendent aux designs animés, ce qui en fait le meilleur choix pour les scènes contenant du texte à l’écran, des maquettes d’interface ou des éléments graphiques de marque.
Flux 3 peut-il générer en 4K ? Pas actuellement. La sortie native est en 720p, avec du 1080p via upscaling. Seedance 2.5 prend en charge la 4K native : c’est son avantage décisif en matière de résolution.
Combien coûte un clip ?
| Durée | Flux 3 (0,17 $/s) | Seedance 2.5 480p (0,30 $/s) | Seedance 2.5 720p (0,60 $/s) |
|---|---|---|---|
| 10 secondes | 1,70 $ | 3,00 $ | 6,00 $ |
| 20 secondes | 3,40 $ | 6,00 $ | 12,00 $ |
| 30 secondes | 5,10 $ | 9,00 $ | 18,00 $ |
| 60 secondes | 10,20 $ | 18,00 $ | 36,00 $ |
Flux 3 est facturé 0,17 $ par seconde via OpenRouter, soit 3,40 $ pour un clip de 20 secondes. La page tarifaire de BFL n’a pas encore publié de paliers propres à Flux 3 au-delà du tarif d’accès anticipé.
Le prix de Seedance 2.5 varie selon la résolution : 0,30 $ par seconde de sortie en 480p et 0,60 $ par seconde en 720p, d’après le guide API de piapi.ai. Une génération de 30 secondes en 720p coûte 18,00 $, soit plus de cinq fois le prix d’un clip Flux 3 de 20 secondes.
À noter : le tarif du palier de sortie 4K de Seedance 2.5 n’a pas encore été publié par ByteDance ni par ses partenaires API. Le tableau ci-dessus couvre uniquement les résolutions 480p et 720p.
Flux 3 est-il moins cher que Seedance 2.5 ? À 0,17 $/s contre 0,30–0,60 $/s, Flux 3 coûte 43–72 % moins cher par seconde de vidéo générée.
Accès aux modèles et politique de contenu
Flux 3 est disponible en accès anticipé via l’API BFL et OpenRouter. Black Forest Labs s’est associé à Cinder pour l’évaluation de sécurité avant publication et applique un filtrage de contenu sur toutes les modalités prises en charge.
Seedance 2.5 est accessible depuis la plateforme Volcano Engine de ByteDance, l’interface grand public Dreamina et des fournisseurs tiers tels qu’ApiPass.
Peut-on utiliser les deux avec la même API ? Pas nativement. Flux 3 est disponible via l’API de BFL et OpenRouter ; Seedance 2.5 passe par Volcano Engine de ByteDance et des fournisseurs partenaires. Une passerelle API unifiée telle qu’AIReiter peut toutefois router les requêtes vers les deux modèles depuis un point d’accès unique, ce qui simplifie la facturation et la gestion des clés lors de tests comparatifs.
Quel modèle choisir selon votre workflow ?
| Cas d’usage | Modèle recommandé | Pourquoi |
|---|---|---|
| Récits longs (60 s+) | Seedance 2.5 | 30 s de génération + deux extensions = ~90 s dans un seul pipeline |
| Contenu riche en typographie | Flux 3 | Bon rendu du texte à l’écran et des designs animés |
| Production avec budget serré | Flux 3 | 0,17 $/s contre 0,30–0,60 $/s — moins de la moitié du coût, quelle que soit la durée |
| Sortie en résolution 4K | Seedance 2.5 | 4K native, contre un plafond de 720p/1080p upscalé pour Flux 3 |
| Multi-plans avec images-clés explicites | Flux 3 | Les fonctions images-clés vers vidéo et V2V offrent un contrôle précis des transitions |
| Montage audio après génération | Seedance 2.5 | L’édition audiovisuelle est documentée comme fonction post-génération |
| Rendus stylisés / bruts / spontanés | Flux 3 | Grande diversité de styles, y compris des esthétiques non cinématographiques |
| Réalisme propre et mouvement fluide | Seedance 2.5 | Détails organiques et mouvements plus fluides selon l’annonce de ByteDance |
| Workflows avec vidéo de référence | Seedance 2.5 | Le contrôle par vidéo de référence est une fonction documentée de premier plan |
Si votre production repose sur des plans longs sans interruption, la résolution 4K ou le contrôle par vidéo de référence, Seedance 2.5 est le choix le plus solide malgré son coût supérieur. Si vous recherchez de la typographie, des esthétiques stylisées, un contrôle précis par images-clés ou le tarif à la seconde le plus bas, Flux 3 l’emporte ; son enchaînement agentique peut aussi réduire l’écart de durée sur des séquences multi-plans. Reste une inconnue : les raccords entre les clips chaînés de Flux 3 tiendront-ils aussi proprement à grande échelle que les extensions intégrées au pipeline de Seedance 2.5 ? Seuls des tests de production prolongés permettront de répondre.
À lire aussi :