A finales de julio de 2026 llegaron dos modelos de vídeo con IA separados por apenas unos días: Flux 3, de Black Forest Labs, y Seedance 2.5, de ByteDance. Los dos generan vídeo con audio sincronizado, pero la diferencia más inmediata está en la duración: Flux 3 se queda en clips de hasta 20 segundos, mientras que Seedance 2.5 alcanza los 30 segundos y permite dos extensiones.
Duración de los vídeos y cómo funcionan las extensiones
Flux 3 genera clips de hasta 20 segundos en una sola pasada, en HD (720p) o Full HD (1080p mediante escalado), con audio nativo creado al mismo tiempo que el vídeo. Para secuencias más largas, Black Forest Labs documenta el encadenamiento agéntico, que conecta clips individuales en secuencias con varios planos, y la continuación de vídeo: se aportan hasta cuatro segundos de vídeo y audio existentes para que el modelo continúe desde ahí. También incluye un modo borrador para previsualizar una versión de bajo coste antes de lanzar el renderizado final.
Seedance 2.5 genera hasta 30 segundos de una vez y permite dos extensiones, con lo que la duración total puede acercarse a los 90 segundos dentro del mismo flujo de extensión. La página del modelo de ByteDance presenta la narrativa multplano y la continuidad entre cortes como capacidades centrales, no como procesos complementarios.
En la práctica, la diferencia son 10 segundos más por generación y dos filosofías distintas para alargar el metraje. Con Flux 3 hay que enlazar clips cortos mediante puntos de continuación explícitos; Seedance 2.5 permite extender el contenido dentro de una única cadena de generación. Para un anuncio de 60 segundos, Flux 3 necesita al menos tres segmentos de 20 segundos encadenados, mientras que Seedance 2.5 puede hacerlo con una generación de 30 segundos y una extensión.
¿Se pueden encadenar clips de más de 20 segundos con Flux 3? Sí. El encadenamiento agéntico conecta varios clips de 20 segundos, y la función de continuación de vídeo acepta 4 segundos de vídeo de entrada con audio para generar el siguiente segmento.
¿Hasta qué duración llega Seedance 2.5 con extensiones? Una generación inicial de 30 segundos y dos extensiones dan aproximadamente 90 segundos de metraje continuo. ByteDance no documenta un límite estricto más allá del máximo de dos extensiones.
Audio nativo y diálogos
Ambos modelos generan el audio como parte del sistema de vídeo, no como una fase independiente de posproducción. La diferencia está en el nivel de control y en las opciones de edición.
Flux 3 produce audio nativo en todas sus salidas de vídeo documentadas: diálogos, efectos de sonido y ambiente se generan en la misma pasada que los elementos visuales. Black Forest Labs destaca los diálogos multilingües con sincronización labial en inglés, chino, español, francés, alemán, japonés, portugués, ruso, italiano, indonesio, turco, hindi y panyabí.
Seedance 2.5 apuesta por una combinación de generación y edición. Su generación conjunta de audio y vídeo cubre diálogos, ambiente y efectos de sonido, y el modelo documenta además la edición audiovisual después de la generación inicial.
Observaciones de la comunidad, no pruebas controladas: un usuario de Reddit que comparó ambos modelos con el mismo prompt comentó: "Aunque estaba tecleando en la fila de números, jaja. Pero el audio parece mejor en Flux" (Mr__Earthling, r/Seedance_AI). Otro participante señaló: "Flux ha resuelto muy bien tanto la calidad de audio como el acabado cinematográfico" (Icy_Foundation3534).
¿Seedance 2.5 tiene audio nativo? Sí. La generación conjunta de audio y vídeo es una función central, y el modelo admite sincronización labial y edición audiovisual sobre el resultado generado.
Modos de referencia y control
| Capacidad | Flux 3 | Seedance 2.5 |
|---|---|---|
| Texto a vídeo | ✅ | ✅ |
| Imagen a vídeo | ✅ (animación o referencia visual) | ✅ |
| Vídeo a vídeo | ✅ (mantiene personajes/elementos en una escena nueva) | ❌ no documentado |
| Fotogramas clave a vídeo | ✅ (define los fotogramas inicial y final) | ❌ no documentado |
| Continuación de vídeo y audio | ✅ (desde 4 s de entrada) | ✅ (dos extensiones) |
| Control mediante vídeo de referencia | ❌ no documentado | ✅ |
| Edición audiovisual | ❌ no documentado | ✅ |
| Modo borrador | ✅ (vista previa de bajo coste antes del renderizado final) | ❌ no documentado |
| Diálogo multilingüe | ✅ (más de 14 idiomas con sincronización labial) | ✅ (descrito, sin lista de idiomas publicada) |
El sistema de referencias de Flux 3 gira en torno a puntos de control explícitos, como los fotogramas clave, la continuación de vídeo y el vídeo a vídeo. Seedance 2.5, en cambio, se centra en el control por vídeo de referencia y la edición audiovisual posterior a la generación. La diferencia importa si tu flujo exige transiciones precisas entre fotogramas clave, donde Flux 3 tiene ventaja, o si prefieres aportar un vídeo existente para guiar el estilo, terreno de Seedance 2.5.
Resolución y calidad visual
Flux 3 entrega vídeo a 720p de forma nativa, con 1080p disponible mediante escalado. Black Forest Labs presenta esta decisión como propia de una fase de acceso anticipado: las evaluaciones preliminares utilizaron clips de 10 segundos a 720p con audio. Entre sus puntos fuertes visuales están la generación de tipografía, una amplia variedad de estilos —desde vídeo espontáneo de videocámara hasta animación y estética cinematográfica— y la captura de expresiones faciales humanas.
Seedance 2.5 renderiza de forma nativa hasta 4K, según la página del modelo de ByteDance, por lo que su techo de resolución supera al de Flux 3 en su estado actual. El anuncio de ByteDance destaca movimientos más fluidos, mayor consistencia visual y más realismo.
Un usuario escribió: "Flux parece haber clavado mejor el estilo; Seedance parece haber clavado mejor el realismo" (EbbAppropriate9421, r/Seedance_AI). Otro añadió que "Seedance 2.0 es realmente malo haciendo estilos de vídeo de baja calidad". Estos comentarios se refieren a Seedance 2.0, así que sirven como contexto orientativo de la comunidad, no como evidencia del rendimiento de Seedance 2.5.
La representación de texto es otra diferencia visible. Un comentarista de Reddit preguntó: "¿Por qué nadie habla de la generación de texto? ¡Seedance 2 es terrible con el texto! Parece que Flux 3 lo ha clavado" (digitalml). La capacidad tipográfica de Flux 3 también abarca diseños animados, lo que lo convierte en la opción más sólida para escenas con texto en pantalla, maquetas de interfaz o gráficos de marca.
¿Flux 3 puede generar en 4K? De momento, no. Su salida nativa es 720p y alcanza 1080p mediante escalado. Seedance 2.5 admite hasta 4K de forma nativa, una ventaja decisiva en resolución.
Cuánto cuesta generar un clip
| Duración | Flux 3 ($0.17/s) | Seedance 2.5 480p ($0.30/s) | Seedance 2.5 720p ($0.60/s) |
|---|---|---|---|
| 10 segundos | $1.70 | $3.00 | $6.00 |
| 20 segundos | $3.40 | $6.00 | $12.00 |
| 30 segundos | $5.10 | $9.00 | $18.00 |
| 60 segundos | $10.20 | $18.00 | $36.00 |
Flux 3 cuesta $0.17 por segundo a través de OpenRouter, así que un clip de 20 segundos sale por $3.40. La página de precios de BFL todavía no ha publicado niveles específicos para Flux 3 más allá de la tarifa de acceso anticipado.
El precio de Seedance 2.5 depende de la resolución: $0.30 por segundo de salida a 480p y $0.60 por segundo a 720p, según la guía de API de piapi.ai. Una generación de 30 segundos a 720p cuesta $18.00, más de cinco veces lo que vale un clip de 20 segundos de Flux 3.
Nota: ByteDance y sus socios de API todavía no han publicado el precio del nivel de salida 4K de Seedance 2.5. La tabla anterior cubre únicamente 480p y 720p.
¿Flux 3 es más barato que Seedance 2.5? Con $0.17/s frente a $0.30–$0.60/s, Flux 3 cuesta entre un 43 % y un 72 % menos por segundo de vídeo generado.
Acceso a proveedores y política de contenidos
Flux 3 está disponible en acceso anticipado mediante la API de BFL y OpenRouter. Black Forest Labs se asoció con Cinder para evaluar la seguridad antes del lanzamiento y aplica filtrado de contenido en todas las modalidades compatibles.
Seedance 2.5 se puede utilizar a través de la plataforma Volcano Engine de ByteDance, la interfaz de consumo Dreamina y proveedores externos como ApiPass.
¿Puedo usar ambos con la misma API? No de forma nativa. Flux 3 está disponible mediante la API de BFL y OpenRouter; Seedance 2.5, a través de Volcano Engine de ByteDance y proveedores asociados. Una pasarela de API unificada como AIReiter puede dirigir solicitudes a ambos modelos desde un único endpoint, simplificando la facturación y la gestión de claves al compararlos en paralelo.
Qué modelo encaja mejor en cada flujo de trabajo
| Caso de uso | Modelo recomendado | Motivo |
|---|---|---|
| Narrativas largas (60 s+) | Seedance 2.5 | 30 s de generación + dos extensiones = ~90 s en una sola cadena |
| Contenido con mucha tipografía | Flux 3 | Buena representación de texto en pantalla y diseños animados |
| Producción con presupuesto ajustado | Flux 3 | $0.17/s frente a $0.30–$0.60/s: menos de la mitad del coste a cualquier duración |
| Salida en resolución 4K | Seedance 2.5 | 4K nativo frente al límite de 720p/1080p mediante escalado de Flux 3 |
| Multiplano con fotogramas clave explícitos | Flux 3 | Keyframe-to-video y V2V ofrecen control preciso sobre las transiciones |
| Edición de audio tras la generación | Seedance 2.5 | La edición audiovisual está documentada como función posterior a la generación |
| Estéticas estilizadas, crudas o espontáneas | Flux 3 | Gran diversidad estilística y buen manejo de estéticas no cinematográficas |
| Realismo limpio y movimiento fluido | Seedance 2.5 | Detalles orgánicos y movimiento más fluido, según el anuncio de ByteDance |
| Flujos basados en vídeo de referencia | Seedance 2.5 | El control por vídeo de referencia es una función principal documentada |
Si tu producción depende de clips largos sin interrupciones, resolución 4K o control mediante vídeo de referencia, Seedance 2.5 es la opción más sólida pese a su mayor coste. Si necesitas tipografía, estéticas estilizadas, control preciso con fotogramas clave o el precio más bajo por segundo, Flux 3 sale ganando; además, su encadenamiento agéntico puede reducir la desventaja de duración en secuencias multplano. Sigue sin resolverse si las uniones del encadenamiento de Flux 3 aguantarán una producción a escala con la misma limpieza que las extensiones integradas de Seedance 2.5. Solo las pruebas continuadas en producción podrán responderlo.
Lecturas relacionadas: