Lançado pela ByteDance em 5 de agosto de 2026, o SeedRealtime não é apenas mais um modelo de voz em tempo real. Trata-se de um LLM audiovisual nativamente full-duplex, capaz de combinar áudio, vídeo e texto de ponta a ponta no mesmo sistema — sem depender de um módulo externo para determinar quem deve falar e quando. Para desenvolvedores, porém, há uma limitação importante: no lançamento, ele não tem API pública nem preços divulgados e está integrado apenas aos produtos da própria ByteDance.
O que é o SeedRealtime
Desenvolvido pela equipe Seed da ByteDance, o modelo reúne áudio, vídeo e texto em uma única arquitetura. Em vez de enviar dados de uma etapa para outra, ele percebe, interpreta, decide e responde diretamente sobre fluxos multimodais contínuos.
A proposta da ByteDance é simples de resumir: ver, ouvir e falar ao mesmo tempo. Cada resposta leva em conta, simultaneamente, aquilo que está sendo dito e o que aparece na cena. O SeedRealtime integra a linha de modelos Seed, ao lado do Seed2.1 — família de LLMs que alimenta o Doubao —, do Seedance para geração de vídeo, do Seedream para imagens, do Seed Audio 1.0 para geração de áudio e do Seed GR-RL voltado à robótica.
Ele não se encaixa perfeitamente nas categorias tradicionais. Não é um modelo de TTS, porque além de gerar fala também a entende; não é um modelo de visão, pois enxerga para sustentar a conversa; e tampouco é só mais um bot de voz em tempo real.
Por que o full-duplex é o ponto central
Em um sistema full-duplex, o modelo consegue escutar e responder simultaneamente. Ele acompanha continuamente quem está falando e identifica a hora certa de entrar na conversa, de forma mais próxima de uma interação humana. A ByteDance afirma que o SeedRealtime faz isso ao unificar som, visão, tempo e expressão em um modelo de ponta a ponta, em vez de montar o produto com módulos independentes.
A IA conversacional em tempo real costuma seguir dois caminhos mais antigos. Sistemas em cascata encadeiam ASR, ou fala para texto, com um LLM ou VLM e, depois, TTS, ou texto para fala. Essa estrutura é modular e mais fácil de depurar, mas cada transferência adiciona latência e perde informações. Tom de voz, sobreposição de falas, sotaques e contexto visual frequentemente se perdem já na etapa de ASR. Já os modelos de voz de ponta a ponta eliminam essas passagens e tendem a soar mais naturais, mas muitos ainda usam um detector externo de atividade de voz, o VAD, para decidir de quem é a vez. Na prática, continuam sendo half-duplex: uma pergunta, uma resposta.
O SeedRealtime reúne percepção, compreensão, tomada de decisão e expressão em um único modelo. Tudo funciona em paralelo sobre fluxos contínuos de áudio e vídeo, sem um VAD externo definindo os turnos da conversa.
| Abordagem | Como funciona | Duplex | Gestão de turnos | Principal limitação |
|---|---|---|---|---|
| Em cascata (ASR + LLM/VLM + TTS) | Módulos encadeados em sequência | Half-duplex | Finalização fixa | Latência e perda de informação a cada transferência |
| Ponta a ponta + VAD externo | Um modelo com detector externo de turnos | Half-duplex | VAD externo | Ainda opera no formato uma pergunta, uma resposta |
| SeedRealtime | Modelo audiovisual unificado de ponta a ponta | Full-duplex (alegado) | Interna e multimodal | É o mais novo; as capacidades foram descritas pelo fornecedor |
O desafio aumenta com vídeo, já que imagens não têm as pausas naturais da fala. O modelo precisa decidir o tempo todo a qual objeto prestar atenção, qual voz importa e se aquele é o momento de responder, sem reagir indevidamente a ruídos do ambiente.
As três frentes demonstradas pela ByteDance
A ByteDance organiza o comportamento do SeedRealtime em três capacidades: entendimento conjunto de áudio e vídeo, interação proativa e timing conversacional natural. Em vez de apresentar tabelas de benchmarks, a empresa demonstra cada ponto em cenários concretos.
Entendimento integrado de áudio e vídeo
O modelo usa o que está acontecendo na cena para resolver ambiguidades na fala. Se alguém pergunta “como faço isso?”, o SeedRealtime cruza a tela, os gestos, o olhar e as ações anteriores para entender a que “isso” se refere.
Em uma demonstração da ByteDance, uma pessoa apresenta quatro amigos, um por um, durante um jantar. O SeedRealtime associa os nomes aos rostos e mantém cada voz vinculada à identidade correta enquanto o grupo planeja uma viagem com preferências conflitantes: um quer praia, outro não suporta calor e outro tem alergia a frutos do mar. Em um restaurante de Sichuan, ele lê pela câmera um cardápio apenas em chinês, recomenda pratos em inglês e explica por que o prato “fish-fragrant pork” não leva peixe.
Interação proativa
O modelo também pode se manifestar por iniciativa própria quando a situação muda, sem esperar uma pergunta. Durante uma visita a um museu, o usuário pede: “me avise quando vir o suporte de bronze com um tigre devorando um cervo”. O SeedRealtime acompanha a câmera até que a peça apareça e então faz o lembrete, acrescentando contexto sobre o objeto.
Ao observar alguém despejar grãos de café inteiros diretamente em um porta-filtro, ele intervém: antes, é preciso moê-los até obter um pó fino. Depois da extração, sugere reduzir a próxima tirada em dois a três segundos com base na cor do creme. Chamadas de ferramentas, como pesquisas e reservas, aparecem integradas a essas respostas, e não como uma etapa separada.
Timing de conversa mais natural
O SeedRealtime decide quando falar, pausar ou permanecer em silêncio a partir do contexto multimodal, além de evitar acionamentos indevidos. Em um aeroporto movimentado de Pequim, ele ignora uma menção casual de um acompanhante ao “voo do Velho Li”. Mas, quando recebe uma pergunta, recupera informações do painel de partidas que já saíram da tela e então busca online a localização da esteira de bagagens. Em casa, enquanto um dos pais conversa ao telefone ao fundo, o modelo mantém o foco em corrigir a pronúncia em inglês de uma criança.
Na avaliação humana de ponta a ponta da ByteDance, o SeedRealtime reduz aproximadamente pela metade os problemas de ritmo em conversas audiovisuais quando comparado a modelos em cascata. Isso inclui menos interrupções no meio de frases, menos respostas lentas após pausas e menos acionamentos falsos por ruído, além de uma taxa maior de turnos concluídos de forma fluida e completa. São avaliações conduzidas pelo próprio fornecedor, não benchmarks independentes.
SeedRealtime vs. GPT-4o Realtime, Gemini Live e stacks em cascata
Na prática, a questão é como o SeedRealtime se diferencia dos sistemas em tempo real que desenvolvedores já podem usar. A resposta honesta é que a maior parte das APIs “realtime” existentes é centrada em áudio. O diferencial alegado do SeedRealtime é modelar áudio e vídeo conjuntamente em modo full-duplex.
A Realtime API da OpenAI e o Gemini Live, recurso para consumidores do Google com sua Live API para desenvolvedores, oferecem conversas em tempo real e baixa latência, mas se concentram em áudio: fala entra, fala sai. A visão é tratada separadamente, e a gestão de turnos ainda depende de endpointing ou VAD. O posicionamento do SeedRealtime está na combinação de fusão audiovisual nativa, timing full-duplex decidido dentro do modelo, intervenções proativas e uso de ferramentas incorporado à conversa.
| Modelo | Modalidades nativas | Duplex | Gestão de turnos | Proatividade / uso de ferramentas | API pública |
|---|---|---|---|---|---|
| SeedRealtime | Áudio + vídeo + texto (integrados) | Full-duplex (alegado) | Interna e multimodal | Sim, integrado à conversa | Não (no lançamento) |
| GPT-4o Realtime API | Áudio + texto | Tempo real, gerenciado por VAD | Endpointing externo | Por meio de function tools | Sim |
| Gemini Live / Live API | Áudio + texto (câmera no app de consumo) | Tempo real, gerenciado por VAD | Endpointing externo | Limitado | Sim (Live API, áudio) |
| Stack em cascata | Texto (áudio via ASR/TTS) | Half-duplex | Fixa | Personalizado | Monte o seu |
As vantagens do SeedRealtime vêm das próprias demonstrações e avaliações da ByteDance; não há comparação direta publicada com GPT-4o realtime ou Gemini Live. Portanto, a tabela acima deve ser lida como posicionamento de arquitetura, não como superioridade medida.
Desenvolvedores já podem usar o SeedRealtime?
No lançamento de 5 de agosto de 2026, o SeedRealtime não estava disponível como API para desenvolvedores. A ByteDance afirma que o modelo está “totalmente implementado”, mas isso se refere à distribuição dentro de seus próprios produtos, e não a um endpoint aberto que qualquer pessoa possa chamar.
No lançamento, não há API pública, página de preços ou documentação para desenvolvedores do SeedRealtime. O braço de APIs comerciais da ByteDance é o Volcengine (火山引擎), que hospeda a família de modelos Doubao: LLMs Seed 2.1 Pro e Turbo, Seed-ASR, Seed-TTS e outros. O SeedRealtime não aparece na lista nesse momento, e retransmissores de terceiros não oferecem uma alternativa audiovisual em tempo real.
Para equipes que precisam hoje de um endpoint em tempo real, as opções mais realistas no curto prazo seguem sendo centradas em áudio: a Realtime API da OpenAI, a Live API do Google ou um stack em cascata desenvolvido internamente. O SeedRealtime é, por enquanto, uma arquitetura para acompanhar. A ByteDance não informou uma data para uma API em tempo real no Volcengine ou BytePlus.
Perguntas frequentes
O SeedRealtime está disponível ao público?
Desde o lançamento em 5 de agosto de 2026, ele está implantado nos produtos da própria ByteDance. No entanto, não há um aplicativo público ou endpoint chamado SeedRealtime para o qual seja possível se cadastrar.
O SeedRealtime tem API?
Não no lançamento. A ByteDance não liberou acesso por API, preços ou documentação para desenvolvedores. O provável destino futuro seria a família de APIs Doubao do Volcengine, que ainda não lista o SeedRealtime.
Qual é a diferença entre SeedRealtime e GPT-4o realtime?
A Realtime API do GPT-4o é centrada em áudio: fala entra e fala sai. O SeedRealtime afirma modelar áudio e vídeo conjuntamente em um único modelo full-duplex, que também decide seu próprio timing e age de modo proativo. Ainda não existe uma comparação independente direta entre os dois.
O SeedRealtime é gratuito?
No lançamento, não existe produto independente nem API com preço definido. Por isso, a comparação entre gratuito e pago ainda não se aplica: trata-se de uma capacidade incorporada aos produtos da ByteDance.
O que significa “full-duplex” em um modelo de IA?
Significa que o modelo consegue escutar e responder ao mesmo tempo, acompanhando continuamente o estado da conversa e decidindo por conta própria quando falar ou pausar, em vez de ficar limitado a turnos de uma pergunta seguida de uma resposta.
Leituras relacionadas
- Preços da OpenAI Realtime API — o endpoint de áudio em tempo real que desenvolvedores já podem chamar hoje
- Qwen Audio 3 Realtime — outro modelo de fala em tempo real para comparação