실시간 음성 AI는 이제 낯선 기술이 아니다. 하지만 ByteDance가 2026년 8월 5일 공개한 SeedRealtime은 음성만 빠르게 주고받는 모델과는 출발점이 다르다. 오디오와 비디오를 하나의 엔드투엔드 모델 안에서 함께 처리하며, 누가 언제 말할지 판단하는 외부 모듈도 두지 않는다. 다만 개발자 관점에서는 분명한 제약이 있다. 출시 시점에 공개 API와 가격 정책이 없으며, ByteDance 자체 제품 안에서만 제공된다.
SeedRealtime은 어떤 모델인가
ByteDance Seed 팀이 만든 SeedRealtime은 오디오, 비디오, 텍스트를 단일 아키텍처로 결합한다. 여러 처리 단계를 오가며 데이터를 넘기는 대신, 연속적인 멀티모달 스트림을 바탕으로 인식·이해·판단·응답을 한 흐름에서 수행하는 구조다.
ByteDance는 이를 두고 ‘보고, 듣고, 동시에 말하는’ 상호작용이라고 설명한다. 들리는 소리와 보이는 장면이 매 응답에 함께 반영되는 실시간 대화 방식이다. SeedRealtime은 Seed 모델 라인업에 속하며, Doubao를 구동하는 LLM 계열 Seed2.1, 영상 생성 모델 Seedance, 이미지 생성 모델 Seedream, 오디오 생성 모델 Seed Audio 1.0, 로보틱스 모델 Seed GR-RL과 나란히 위치한다.
기존 분류로는 설명이 깔끔하지 않다. 음성을 생성하면서도 이해하므로 단순 TTS 모델이 아니고, 대화를 위해 장면을 인식한다는 점에서 일반적인 비전 모델도 아니다. 그저 또 하나의 실시간 음성 챗봇으로 보기에도 어렵다.
핵심은 ‘풀듀플렉스’에 있다
풀듀플렉스는 모델이 듣는 동시에 응답할 수 있다는 뜻이다. 실제 사람끼리 대화하듯 누가 말하고 있는지, 언제 끼어들어야 하는지를 지속적으로 판단한다. SeedRealtime은 이를 여러 모듈을 조립해 구현하는 대신, 소리·시각 정보·시간 흐름·표현을 하나의 엔드투엔드 모델에 통합해 달성한다고 주장한다.
기존 실시간 AI는 크게 두 방식 사이에서 발전해 왔다. 캐스케이드 방식은 ASR(음성-텍스트 변환) 뒤에 LLM 또는 VLM, 다시 TTS(텍스트-음성 변환)를 순차적으로 연결한다. 모듈 단위라 디버깅하기는 좋지만, 단계가 넘어갈 때마다 지연과 정보 손실이 생긴다. 말투, 겹쳐 말하기, 억양, 시각적 맥락도 ASR 단계에서 사라지기 쉽다. 엔드투엔드 음성 모델은 이런 전달 단계를 줄여 더 자연스럽게 들리지만, 대다수는 여전히 외부 음성 활동 감지기(VAD)로 발화 차례를 정한다. 결국 질문 하나에 답변 하나가 이어지는 사실상 하프듀플렉스 구조다.
SeedRealtime은 외부 VAD가 차례를 결정하지 않는다. 연속된 오디오·비디오 스트림 위에서 인식, 이해, 의사결정, 표현을 하나의 모델이 병렬로 처리한다.
| 접근 방식 | 작동 구조 | 듀플렉스 | 발화 차례 결정 | 주요 한계 |
|---|---|---|---|---|
| 캐스케이드 방식 (ASR + LLM/VLM + TTS) | 모듈을 순차적으로 연결 | 하프 | 고정된 발화 종료 판정 | 단계 전환마다 생기는 지연과 정보 손실 |
| 엔드투엔드 + 외부 VAD | 단일 모델과 외부 발화 감지기 | 하프 | 외부 VAD | 여전히 질문 하나, 답변 하나의 흐름 |
| SeedRealtime | 통합 오디오·비디오 엔드투엔드 모델 | 풀(주장 기준) | 내부 멀티모달 판단 | 신규 모델이며 기능은 벤더 설명에 기반 |
특히 비디오는 음성처럼 자연스러운 휴지 구간이 없다. 모델은 배경 소음에 반응하지 않으면서도 어떤 물체에 주목할지, 누구의 목소리가 중요한지, 지금 말해야 할 순간인지를 계속 판단해야 한다.
ByteDance가 제시한 세 가지 역량
ByteDance는 SeedRealtime 소개 글에서 핵심 동작을 세 가지로 묶는다. 오디오·비디오 통합 이해, 능동적 상호작용, 자연스러운 대화 타이밍이다. 벤치마크 표보다 구체적인 사용 시나리오를 통해 각 기능을 보여준다.
오디오와 영상을 함께 이해하는 능력
모델은 현재 장면을 활용해 모호한 발화를 해석한다. 사용자가 “이거 어떻게 해?”라고 물으면, 화면 속 대상과 손짓, 시선, 앞선 행동을 함께 보고 여기서 ‘이거’가 무엇인지 판단하는 식이다.
ByteDance 데모에서는 사용자가 저녁 식사 자리에서 친구 네 명을 한 명씩 소개하자, SeedRealtime이 이름과 얼굴을 연결하고 각 인물의 목소리까지 정체성과 계속 매칭한다. 이후 일행이 여행 계획을 세울 때도 한 사람은 해변을 원하고, 다른 사람은 더위를 싫어하며, 또 다른 사람은 해산물 알레르기가 있다는 상충하는 선호를 반영한다. 쓰촨 음식점에서는 카메라로 중국어 메뉴를 읽고 영어로 메뉴를 추천하며, ‘위샹러우쓰(fish-fragrant pork)’에 생선이 들어가지 않는 이유도 설명한다.
먼저 상황을 알아차리고 개입하는 능력
장면이 바뀌면 질문을 기다리지 않고 먼저 말을 건넬 수 있다는 점도 특징이다. 박물관을 둘러보던 사용자가 “청동 호식록을 보면 알려줘”라고 하면, SeedRealtime은 카메라 영상을 지켜보다 해당 유물이 나타나는 순간 알림과 함께 작품 설명을 제공한다.
누군가 커피 원두를 그대로 포터필터에 붓는 모습을 보면, 먼저 고운 가루로 분쇄해야 한다고 말한다. 추출 뒤에는 크레마 색을 근거로 다음 샷은 2~3초 짧게 추출하라고 제안한다. 조회나 예약 같은 도구 호출도 별도 단계로 분리하지 않고 이런 대화 응답에 자연스럽게 녹여 넣는다.
대화 흐름에 맞춘 타이밍
SeedRealtime은 멀티모달 맥락을 바탕으로 말할지, 멈출지, 조용히 있을지를 결정하며 잘못된 트리거도 억제한다. 붐비는 베이징 공항에서 동행자가 무심코 ‘라오리의 비행기’를 언급해도 반응하지 않지만, 질문을 받으면 이미 화면에서 사라진 출발 안내판 정보를 떠올린 뒤 수하물 벨트 위치는 온라인에서 찾아본다. 집에서는 부모가 배경에서 통화 중이어도, 아이의 영어 발음 교정이라는 본래 작업에 집중한다.
ByteDance의 엔드투엔드 인간 평가에 따르면, SeedRealtime은 캐스케이드 모델 대비 오디오·비디오 대화의 페이싱 문제를 약 절반으로 줄였다. 문장 중간 끊김, 멈춘 뒤 느린 반응, 소음으로 인한 오작동이 감소했고, 한 번의 턴이 자연스럽고 완전하게 마무리되는 비율도 높아졌다는 결과다. 다만 독립 벤치마크가 아니라 벤더가 직접 수행한 평가라는 점은 고려해야 한다.
SeedRealtime, GPT-4o Realtime, Gemini Live, 캐스케이드 스택의 차이
실무적으로 중요한 질문은 이미 개발자가 호출할 수 있는 실시간 시스템과 무엇이 다르냐는 것이다. 솔직히 말하면, 기존 ‘realtime’ API 대부분은 오디오 중심이다. SeedRealtime의 차별점은 오디오와 비디오를 함께 모델링하면서 풀듀플렉스 상호작용을 구현한다는 주장에 있다.
OpenAI의 Realtime API와 Google의 소비자 기능 Gemini Live, 그리고 개발자용 Live API는 모두 저지연 실시간 대화 인터페이스다. 다만 기본적으로 음성 입력과 출력이 중심이며, 비전은 별도로 처리되고 발화 차례 역시 엔드포인팅이나 VAD에 의존한다. SeedRealtime이 내세우는 포지션은 네 가지의 결합이다. 네이티브 오디오·비디오 융합, 모델 내부의 풀듀플렉스 타이밍 판단, 능동적 응답, 그리고 대화에 통합된 도구 사용이다.
| 모델 | 네이티브 모달리티 | 듀플렉스 | 발화 차례 결정 | 능동성 / 도구 사용 | 공개 API |
|---|---|---|---|---|---|
| SeedRealtime | 오디오 + 비디오 + 텍스트 (융합) | 풀(주장 기준) | 내부 멀티모달 판단 | 예, 대화에 통합 | 없음(출시 시점) |
| GPT-4o Realtime API | 오디오 + 텍스트 | 실시간, VAD 관리 | 외부 엔드포인팅 | 함수 도구로 지원 | 있음 |
| Gemini Live / Live API | 오디오 + 텍스트 (소비자 앱에서는 카메라) | 실시간, VAD 관리 | 외부 엔드포인팅 | 제한적 | 있음(Live API, 오디오) |
| 캐스케이드 스택 | 텍스트 (ASR/TTS로 오디오 처리) | 하프 | 고정 | 직접 구현 | 직접 구축 |
SeedRealtime의 장점은 ByteDance 자체 데모와 평가를 바탕으로 한 것이다. GPT-4o Realtime이나 Gemini Live와의 공개 정면 비교 결과는 아직 없다. 위 비교는 측정된 우위가 아니라 아키텍처와 제품 포지셔닝의 차이로 봐야 한다.
개발자가 지금 SeedRealtime을 쓸 수 있나
2026년 8월 5일 출시 기준으로 SeedRealtime은 개발자 API로 제공되지 않는다. ByteDance가 ‘완전 배포됐다’고 표현한 것은 누구나 호출할 수 있는 공개 엔드포인트가 열렸다는 뜻이 아니라, 회사 자체 제품에 적용됐다는 의미다.
출시 시점에는 SeedRealtime용 공개 API, 가격 페이지, 개발자 문서가 모두 없다. ByteDance의 상용 API 사업은 Doubao 모델군을 제공하는 Volcengine(火山引擎)이다. 이곳에서는 Seed 2.1 Pro 및 Turbo LLM, Seed-ASR, Seed-TTS 등을 제공하지만, 출시 시점의 목록에는 SeedRealtime이 없다. 서드파티 릴레이 서비스 역시 이를 대체할 실시간 오디오·비디오 기능을 제공하지 않는다.
오늘 바로 실시간 엔드포인트가 필요한 팀이라면 현실적인 선택지는 여전히 오디오 중심이다. OpenAI Realtime API, Google Live API, 또는 자체 구축 캐스케이드 스택을 검토해야 한다. SeedRealtime은 당장 도입할 도구라기보다 지켜볼 아키텍처에 가깝다. ByteDance는 Volcengine 또는 BytePlus 실시간 API의 출시 일정을 밝히지 않았다.
FAQ
SeedRealtime은 일반에 공개됐나?
2026년 8월 5일 출시 시점부터 ByteDance 자체 제품에는 배포돼 있다. 하지만 사용자가 가입해 쓸 수 있는 SeedRealtime이라는 이름의 공개 앱이나 엔드포인트는 없다.
SeedRealtime API가 있나?
출시 시점에는 없다. ByteDance는 API 접근 권한, 가격, 개발자 문서를 공개하지 않았다. 향후 제공된다면 Volcengine의 Doubao API 제품군이 유력하지만, 현재 목록에는 SeedRealtime이 없다.
SeedRealtime은 GPT-4o Realtime과 어떻게 다른가?
GPT-4o의 Realtime API는 음성 입력과 음성 출력을 중심으로 한다. SeedRealtime은 오디오와 비디오를 단일 풀듀플렉스 모델에서 함께 처리하고, 자체적으로 발화 타이밍을 판단하며 능동적으로 행동한다는 점을 내세운다. 아직 독립적인 정면 비교는 없다.
SeedRealtime은 무료인가?
출시 시점에는 별도 제품이나 가격이 책정된 API가 없다. 따라서 무료·유료를 논하기는 이르며, 현재는 ByteDance 제품 내부 기능으로 제공된다.
AI 모델에서 ‘풀듀플렉스’는 무슨 뜻인가?
모델이 듣는 동시에 응답하고, 대화 상태를 계속 추적하면서 언제 말하거나 멈출지를 스스로 판단한다는 의미다. 질문 하나를 받은 뒤 답 하나를 내놓는 고정된 턴 구조에 묶이지 않는다.
함께 읽기
- OpenAI Realtime API pricing — 현재 개발자가 실제로 호출할 수 있는 실시간 오디오 엔드포인트
- Qwen Audio 3 Realtime — 비교해 볼 만한 또 다른 실시간 음성 모델