Em poucos dias, no fim de julho de 2026, dois modelos de vídeo com IA chegaram ao mercado: o Flux 3, da Black Forest Labs, e o Seedance 2.5, da ByteDance. Os dois geram vídeo com áudio sincronizado, mas a diferença mais imediata está na duração: o Flux 3 para em 20 segundos por clipe, enquanto o Seedance 2.5 chega a 30 segundos e permite duas extensões.
Duração dos vídeos e como funcionam as extensões
O Flux 3 cria vídeos de até 20 segundos em uma única geração, em HD (720p) ou Full HD (1080p por upscaling), com áudio nativo gerado junto das imagens. Para sequências mais longas, a Black Forest Labs documenta o encadeamento agêntico, que conecta clipes individuais em sequências com vários planos, e a continuação de vídeo. Nesta última, você fornece até quatro segundos de vídeo e áudio existentes para que o modelo prossiga a partir dali. Há ainda um modo de rascunho para visualizar uma versão mais barata antes de partir para a renderização final.
O Seedance 2.5 gera até 30 segundos de uma vez e aceita duas extensões, ampliando a janela narrativa para perto de 90 segundos dentro do mesmo fluxo de extensão. Na página do modelo, a ByteDance apresenta narrativa com múltiplos planos e continuidade entre cortes como recursos centrais, não como etapas adicionais.
Na prática, são 10 segundos a mais por geração e duas filosofias diferentes para alongar a cena. No Flux 3, você encadeia clipes mais curtos com pontos explícitos de continuação; no Seedance 2.5, a extensão acontece no próprio pipeline de geração. Para um anúncio de 60 segundos, o Flux 3 exige pelo menos três segmentos encadeados de 20 segundos. Já o Seedance 2.5 pode chegar ao mesmo resultado com uma geração de 30 segundos e uma extensão.
É possível passar de 20 segundos no Flux 3? Sim. O encadeamento agêntico liga vários clipes de 20 segundos, e o recurso de continuação aceita 4 segundos de vídeo e áudio de entrada para gerar o próximo trecho.
Até que duração o Seedance 2.5 chega com extensões? Uma geração de 30 segundos com duas extensões resulta em aproximadamente 90 segundos de filmagem contínua. A ByteDance não documenta um limite rígido além do máximo de duas extensões.
Áudio nativo e diálogos
Nos dois modelos, o áudio faz parte da geração de vídeo, e não de uma etapa separada de pós-produção. A diferença está no nível de controle e nas possibilidades de edição.
O Flux 3 gera áudio nativo em todas as saídas de vídeo documentadas: diálogos, efeitos sonoros e som ambiente são produzidos na mesma passagem que cria o visual. A Black Forest Labs destaca diálogos multilíngues com sincronização labial em inglês, chinês, espanhol, francês, alemão, japonês, português, russo, italiano, indonésio, turco, hindi e punjabi.
O Seedance 2.5 segue uma abordagem conjunta de geração e edição. Sua geração integrada de áudio e vídeo cobre diálogo, ambiência e efeitos sonoros, enquanto o modelo também documenta edição audiovisual após a geração inicial.
Observações da comunidade, não testes controlados: um usuário do Reddit que comparou os modelos com o mesmo prompt relatou a diferença de áudio em primeira mão: "He was typing on the numbers key tho lol. But audio seems better in Flux" (Mr__Earthling, r/Seedance_AI). Outro comentário afirmou: "Flux got the audio quality and film grade really well" (Icy_Foundation3534).
O Seedance 2.5 tem áudio nativo? Sim. A geração conjunta de áudio e vídeo é um recurso central, e o modelo oferece sincronização labial e edição audiovisual sobre o material gerado.
Modos de referência e controle
| Recurso | Flux 3 | Seedance 2.5 |
|---|---|---|
| Texto para vídeo | ✅ | ✅ |
| Imagem para vídeo | ✅ (animação ou referência visual) | ✅ |
| Vídeo para vídeo | ✅ (leva personagem/elementos para uma nova cena) | ❌ não documentado |
| Keyframe para vídeo | ✅ (define quadros inicial/final) | ❌ não documentado |
| Continuação de vídeo e áudio | ✅ (a partir de entrada de 4 s) | ✅ (duas extensões) |
| Controle por vídeo de referência | ❌ não documentado | ✅ |
| Edição audiovisual | ❌ não documentado | ✅ |
| Modo de rascunho | ✅ (prévia de baixo custo antes da renderização final) | ❌ não documentado |
| Diálogo multilíngue | ✅ (14+ idiomas com sincronização labial) | ✅ (descrito, sem lista de idiomas publicada) |
O sistema de referências do Flux 3 privilegia pontos de controle explícitos, como keyframes, continuação de vídeo e vídeo para vídeo. O Seedance 2.5 se concentra no controle por vídeo de referência e na edição audiovisual depois da geração. Essa diferença pesa conforme o fluxo: transições precisas entre keyframes favorecem o Flux 3; usar um vídeo existente para orientar o estilo favorece o Seedance 2.5.
Resolução e qualidade visual
O Flux 3 entrega 720p nativamente, com 1080p disponível via upscaling. A Black Forest Labs posiciona isso como uma decisão deliberada de acesso antecipado: as avaliações preliminares usaram clipes de 10 segundos em 720p com áudio. Entre os pontos fortes visuais do modelo estão a boa geração de tipografia, ampla variedade de estilos — de filmagens espontâneas em camcorder a animações e cenas cinematográficas — e a captura de expressões faciais humanas.
O Seedance 2.5 renderiza nativamente em até 4K, segundo a página do modelo da ByteDance. Isso lhe dá um teto de resolução que o Flux 3, em sua forma atual, não alcança. O anúncio da ByteDance destaca movimentos mais suaves, visuais mais consistentes e maior realismo.
Um usuário resumiu assim: "Flux seem to have nailed the style more, Seedance seem to have nailed the realism more" (EbbAppropriate9421, r/Seedance_AI). Outro acrescentou que "Seedance 2.0 really sucks at doing any low quality video style." Como esses comentários se referem ao Seedance 2.0, eles servem apenas como contexto da comunidade, e não como evidência do desempenho do Seedance 2.5.
A renderização de texto é outra diferença visível. Um comentarista no Reddit observou: "why is no one talking about the text generation?! seedance 2 is awful at text!! Looks like flux 3 nailed it" (digitalml). A capacidade tipográfica do Flux 3 também abrange designs animados, o que faz dele a opção mais forte para cenas com texto na tela, mockups de interface ou gráficos de marca.
O Flux 3 consegue gerar em 4K? Ainda não. A saída nativa é 720p, com 1080p por upscaling. O Seedance 2.5 suporta até 4K nativamente, sua vantagem decisiva em resolução.
Quanto custa gerar um clipe
| Duração | Flux 3 (US$ 0,17/s) | Seedance 2.5 480p (US$ 0,30/s) | Seedance 2.5 720p (US$ 0,60/s) |
|---|---|---|---|
| 10 segundos | US$ 1,70 | US$ 3,00 | US$ 6,00 |
| 20 segundos | US$ 3,40 | US$ 6,00 | US$ 12,00 |
| 30 segundos | US$ 5,10 | US$ 9,00 | US$ 18,00 |
| 60 segundos | US$ 10,20 | US$ 18,00 | US$ 36,00 |
O Flux 3 custa US$ 0,17 por segundo via OpenRouter, o que leva um clipe de 20 segundos a US$ 3,40. A página de preços da BFL ainda não publicou faixas específicas para o Flux 3 além da tarifa de acesso antecipado.
O preço do Seedance 2.5 varia com a resolução: US$ 0,30 por segundo gerado em 480p e US$ 0,60 por segundo em 720p, de acordo com o guia de API da piapi.ai. Uma geração de 30 segundos em 720p custa US$ 18,00 — mais de cinco vezes o valor de um clipe de 20 segundos no Flux 3.
Observação: o preço da faixa de saída em 4K do Seedance 2.5 ainda não foi publicado pela ByteDance nem por seus parceiros de API. A tabela acima cobre apenas 480p e 720p.
O Flux 3 é mais barato que o Seedance 2.5? Sim. A US$ 0,17/s, contra US$ 0,30–US$ 0,60/s, o Flux 3 custa de 43% a 72% menos por segundo de vídeo gerado.
Acesso pelos provedores e política de conteúdo
O Flux 3 está disponível em acesso antecipado pela API da BFL e pelo OpenRouter. A Black Forest Labs fez parceria com a Cinder para a avaliação de segurança antes do lançamento e aplica filtragem de conteúdo em todas as modalidades compatíveis.
O Seedance 2.5 pode ser acessado pela plataforma Volcano Engine, da ByteDance, pela interface de consumo Dreamina e por provedores terceirizados como a ApiPass.
Posso usar os dois pela mesma API? Não de forma nativa. O Flux 3 está disponível pela API da BFL e pelo OpenRouter; o Seedance 2.5, pelo Volcano Engine da ByteDance e por provedores parceiros. Um gateway de API unificado como o AIReiter pode encaminhar requisições aos dois modelos por um único endpoint, simplificando cobrança e gerenciamento de chaves nos testes lado a lado.
Qual modelo faz mais sentido para seu fluxo
| Caso de uso | Modelo recomendado | Motivo |
|---|---|---|
| Narrativas longas (60 s+) | Seedance 2.5 | Geração de 30 s + duas extensões = ~90 s no mesmo pipeline |
| Conteúdo com muita tipografia | Flux 3 | Boa renderização de texto na tela e designs animados |
| Produção com orçamento apertado | Flux 3 | US$ 0,17/s contra US$ 0,30–US$ 0,60/s — menos da metade do custo em qualquer duração |
| Saída em resolução 4K | Seedance 2.5 | 4K nativo, contra o limite de 720p/1080p por upscaling do Flux 3 |
| Múltiplos planos com keyframes explícitos | Flux 3 | Keyframe para vídeo e V2V oferecem controle preciso das transições |
| Edição de áudio após a geração | Seedance 2.5 | Edição audiovisual documentada como recurso pós-geração |
| Visual estilizado, cru ou espontâneo | Flux 3 | Grande diversidade de estilos e bom desempenho fora da estética cinematográfica |
| Realismo limpo e movimento fluido | Seedance 2.5 | Detalhes orgânicos e movimento mais suave, segundo o anúncio da ByteDance |
| Fluxos com vídeo de referência | Seedance 2.5 | Controle por vídeo de referência é um recurso documentado de primeira classe |
Se sua produção depende de clipes longos sem interrupção, resolução 4K ou controle por vídeo de referência, o Seedance 2.5 é a escolha mais forte, apesar do preço maior. Se você precisa de tipografia, estética estilizada, controle preciso por keyframes ou da menor tarifa por segundo, o Flux 3 leva vantagem — e seu encadeamento agêntico pode reduzir a diferença de duração em sequências com vários planos. Ainda resta saber se as emendas do encadeamento do Flux 3 se sustentam em escala tão bem quanto as extensões integradas ao pipeline do Seedance 2.5; isso só será respondido com testes contínuos em produção.
Leitura relacionada: