AIREITER

SeedRealtime: аудиовизуальная full-duplex LLM от ByteDance

Последнее обновление: 2026-08-05 07:03:04

5 августа 2026 года ByteDance представила SeedRealtime — нативную аудиовизуальную full-duplex LLM. Главное здесь не просто работа с голосом в реальном времени: таких решений уже немало. Отличие SeedRealtime в том, что звук и видео объединены в одной сквозной модели, а момент для реплики она определяет сама — без внешнего модуля, который решает, кто сейчас говорит. Для разработчиков есть и важное ограничение: на старте у модели нет публичного API и цен, а доступна она только внутри продуктов ByteDance.

SeedRealtime launch announcement on ByteDance's Seed site, headlined "An Audio-Visual Full-Duplex LLM" and dated August 5, 2026.

Что представляет собой SeedRealtime

Модель создана командой Seed в ByteDance. В единой архитектуре она сочетает аудио, видео и текст: непрерывно воспринимает мультимодальный поток, понимает контекст, принимает решения и отвечает, не передавая данные между отдельными этапами обработки.

ByteDance описывает этот подход как способность одновременно «смотреть, слушать и говорить». Каждая реплика учитывает и услышанное, и увиденное в реальном времени. В линейке моделей Seed SeedRealtime соседствует с Seed2.1 — семейством LLM, на котором работает Doubao, — а также с Seedance для генерации видео, Seedream для генерации изображений, Seed Audio 1.0 для генерации аудио и робототехнической моделью Seed GR-RL.

The SeedRealtime model card on ByteDance's Seed models page, shown alongside Seed2.1, Seedance 2.5, Seedream 5.0 Pro, Seed Audio 1.0, and Seed GR-RL.

В привычные категории SeedRealtime не укладывается. Это не TTS-модель, поскольку она не только генерирует речь, но и понимает её; не просто модель компьютерного зрения, поскольку визуальное восприятие подчинено диалогу; и не очередной голосовой бот с низкой задержкой.

Почему ключевое слово здесь — full-duplex

Full-duplex означает, что модель способна одновременно слушать и отвечать. Она постоянно отслеживает, кто говорит и когда уместно вступить в разговор, как это происходит в живом общении. По заявлению SeedRealtime, этого удалось добиться за счёт объединения звука, изображения, тайминга и выразительности в одной сквозной модели, а не подключения отдельных модулей.

Системы общения с ИИ в реальном времени долго опирались на два подхода. Каскадные системы последовательно соединяют ASR — распознавание речи, — LLM или VLM и TTS — синтез речи. Их проще отлаживать благодаря модульной структуре, но каждая передача между компонентами добавляет задержку и теряет часть информации. Интонация, наложение голосов, акцент и визуальный контекст нередко исчезают уже на этапе ASR. Сквозные голосовые модели убирают эти переходы и звучат естественнее, однако большинство из них всё ещё полагается на внешний детектор голосовой активности, VAD, чтобы понять, чья сейчас очередь говорить. В результате они фактически остаются half-duplex: один вопрос — один ответ.

В SeedRealtime восприятие, понимание, принятие решений и выражение ответа собраны в одной модели. Все эти процессы идут параллельно поверх непрерывных аудиовизуальных потоков, а внешний VAD для определения очередности реплик не нужен.

ПодходПринцип работыДуплексностьСмена говорящегоОсновной недостаток
Каскадный (ASR + LLM/VLM + TTS)Последовательная цепочка модулейHalf-duplexФиксированное определение конца фразыЗадержки и потеря данных при каждой передаче
Сквозная модель + внешний VADОдна модель и внешний детектор очередностиHalf-duplexВнешний VADВсё ещё схема «один вопрос — один ответ»
SeedRealtimeЕдиная сквозная аудиовизуальная модельFull-duplex, по заявлению ByteDanceВнутреннее мультимодальное решениеНовая модель; возможности описаны самим разработчиком

Особая сложность связана с видео: в отличие от речи, в нём нет естественных пауз. Модели приходится постоянно решать, на каком объекте сосредоточиться, чей голос важен и стоит ли сейчас вмешиваться, не реагируя при этом на фоновый шум.

Три ключевые возможности SeedRealtime

ByteDance в анонсе SeedRealtime выделяет три направления: совместное понимание аудио и видео, проактивное взаимодействие и естественный тайминг разговора. Вместо бенчмарков компания показывает сценарии применения.

ByteDance's launch post for SeedRealtime, dated August 5, 2026, listing the three core breakthroughs.

Понимание аудио и видео в одном контексте

Модель использует происходящее в кадре, чтобы снять неоднозначность в речи. Если пользователь спрашивает: «Как мне сделать это?», SeedRealtime анализирует экран, жесты, направление взгляда и предыдущие действия, чтобы понять, что именно имеется в виду.

В демо ByteDance пользователь по очереди знакомит модель с четырьмя друзьями за ужином. SeedRealtime сопоставляет имена с лицами, а затем связывает голос каждого человека с его личностью, пока компания планирует поездку с взаимоисключающими пожеланиями: один хочет на пляж, другой не переносит жару, третий страдает аллергией на морепродукты. В сычуаньском ресторане модель читает через камеру меню только на китайском, рекомендует блюда на английском и объясняет, почему в «свинине с рыбным ароматом» на самом деле нет рыбы.

Проактивные подсказки

Модель может заговорить сама, заметив изменение в сцене, а не ждать прямого вопроса. Например, посетитель музея просит: «Напомни мне, когда увидишь подставку с бронзовым тигром, пожирающим оленя». SeedRealtime следит за видеопотоком и, когда экспонат попадает в кадр, напоминает о нём и добавляет информацию о предмете.

Увидев, как человек засыпает цельные кофейные зёрна прямо в портафильтр, модель вмешивается и советует сначала смолоть их в мелкий порошок. После экстракции она предлагает сократить следующий пролив на две-три секунды, ориентируясь на цвет крема. Вызовы инструментов — например, поиск информации и бронирование — вплетены в такие ответы, а не вынесены в отдельный шаг.

Естественный ритм разговора

SeedRealtime сама определяет, когда говорить, делать паузу или молчать, опираясь на мультимодальный контекст, и не срабатывает на ложные сигналы. В переполненном пекинском аэропорту она игнорирует случайное упоминание спутником «рейса Старого Ли», но по запросу вспоминает информацию с табло вылетов, уже исчезнувшую с экрана, а затем выходит в интернет за данными о ленте выдачи багажа. Дома, когда один из родителей разговаривает по телефону на фоне, модель продолжает помогать ребёнку исправлять английское произношение.

Согласно сквозной оценке с участием людей, проведённой ByteDance, по сравнению с каскадными моделями SeedRealtime примерно вдвое сокращает проблемы с темпом аудиовизуального диалога: реже перебивает посреди фразы, медлит после пауз и реагирует на шум. Также выше доля реплик, которые проходят плавно и полностью. Это внутренняя оценка компании, а не независимый бенчмарк.

SeedRealtime на фоне GPT-4o Realtime, Gemini Live и каскадных систем

Практический вопрос — чем SeedRealtime отличается от систем реального времени, которые разработчики уже могут вызывать через API. Честный ответ таков: большинство существующих realtime API сосредоточено на аудио, тогда как ключевое заявление SeedRealtime — совместная обработка аудио и видео в full-duplex режиме.

Realtime API от OpenAI и пользовательская функция Gemini Live от Google с её разработческим Live API обеспечивают разговор в реальном времени с низкой задержкой. Однако в их основе лежит аудио — речь на входе и речь на выходе; работа со зрительным контекстом устроена отдельно, а смена реплик всё ещё зависит от определения конца высказывания или VAD. SeedRealtime позиционируется иначе: нативное объединение аудио и видео, внутреннее определение тайминга в full-duplex режиме, проактивные реплики и использование инструментов прямо в ходе диалога.

МодельНативные модальностиДуплексностьСмена говорящегоПроактивность / инструментыПубличный API
SeedRealtimeАудио + видео + текст, объединённые в одной моделиFull-duplex, по заявлению ByteDanceВнутреннее мультимодальное решениеДа, встроены в диалогНет, на старте
GPT-4o Realtime APIАудио + текстРеальное время, управление через VADВнешнее определение конца фразыЧерез function toolsДа
Gemini Live / Live APIАудио + текст, камера в пользовательском приложенииРеальное время, управление через VADВнешнее определение конца фразыОграниченноДа, Live API для аудио
Каскадная системаТекст, аудио через ASR/TTSHalf-duplexФиксированнаяНастраивается самостоятельноСобственная сборка

Преимущества SeedRealtime основаны на демо и оценках самой ByteDance: опубликованного прямого сравнения с GPT-4o realtime или Gemini Live пока нет. Поэтому таблицу выше стоит воспринимать как сравнение архитектурного позиционирования, а не как доказательство измеримого превосходства.

Можно ли уже использовать SeedRealtime в разработке?

На момент запуска 5 августа 2026 года SeedRealtime недоступна в виде API для разработчиков. ByteDance заявляет, что модель «полностью развёрнута», но речь идёт о внедрении во внутренние продукты компании, а не об открытом endpoint, доступном любому желающему.

На старте для SeedRealtime нет публичного API, страницы с тарифами и документации для разработчиков. Коммерческое API-направление ByteDance — Volcengine (火山引擎), где размещено семейство моделей Doubao: LLM Seed 2.1 Pro и Turbo, Seed-ASR, Seed-TTS и другие. В день запуска SeedRealtime в этом списке отсутствует, а сторонние сервисы-посредники не предлагают полноценной замены для работы с аудио и видео в реальном времени.

Для команд, которым endpoint реального времени нужен уже сейчас, реалистичные варианты по-прежнему ориентированы на аудио: Realtime API от OpenAI, Live API от Google или самостоятельно собранная каскадная система. За SeedRealtime стоит следить прежде всего как за архитектурным ориентиром. Дату появления realtime API в Volcengine или BytePlus ByteDance не называла.

FAQ

SeedRealtime доступна широкой публике?

С момента запуска 5 августа 2026 года модель развёрнута во внутренних продуктах ByteDance, но публичного приложения или endpoint под названием SeedRealtime, на который можно зарегистрироваться, нет.

Есть ли у SeedRealtime API?

На старте — нет. ByteDance не выпустила API-доступ, цены или документацию для разработчиков. Вероятным местом появления модели в будущем может стать семейство Doubao API на Volcengine, но SeedRealtime там пока не представлена.

Чем SeedRealtime отличается от GPT-4o realtime?

Realtime API для GPT-4o ориентирован на аудио: речь поступает на вход и синтезируется на выходе. SeedRealtime заявляет о совместной обработке аудио и видео в одной full-duplex модели, которая сама выбирает момент для реплики и может действовать проактивно. Независимого прямого сравнения пока нет.

SeedRealtime бесплатна?

На момент запуска нет отдельного продукта или API с указанной ценой, поэтому вопрос «бесплатная или платная» пока неприменим: это возможность, встроенная в продукты ByteDance.

Что означает full-duplex для ИИ-модели?

Это означает, что модель может одновременно слушать и отвечать, непрерывно отслеживая состояние разговора. Она сама решает, когда говорить или сделать паузу, вместо жёсткой схемы «один вопрос — один ответ».

Читайте также