ByteDance SeedRealtime: одна модель видит, слышит и говорит одновременно
ByteDance Seed выпустила SeedRealtime — нативный аудиовизуальный full-duplex LLM, который обрабатывает аудио, видео и текст в единой архитектуре без цепочки ASR+VLM+TTS. Модель уже работает в приложении Doubao. Технического отчёта, весов и API пока нет.
ByteDance Seed анонсировала SeedRealtime — LLM, которая смотрит в камеру, слушает голос и отвечает в реальном времени, всё в одной модели, без привычной цепочки отдельных компонентов.
Что такое SeedRealtime и чем она отличается
Больинство реал-тайм голосовых продуктов строятся как cascade: распознавание речи (ASR) -> языковая модель (VLM) -> синтез речи (TTS). Каждый переход добавляет задержку и «роняет» часть контекста.
SeedRealtime убирает этот пайплайн. Восприятие, понимание, принятие решения и генерация ответа работают параллельно внутри одной архитектуры. Переключение очереди разговора (turn-taking) тоже встроено в модель - внешний детектор голосовой активности (VAD) не нужен.
По данным ByteDance, внутренняя оценка с участием людей показала вдвое меньше проблем с паузами по сравнению с cascade-стеками. Конкретных цифр задержки и открытых бенчмарков команда не публиковала.
Три заявленных прорыва от Seed
Команда называет три ключевых улучшения:
- совместное понимание аудио и видео
- проактивное взаимодействие (модель говорит сама, без вопроса)
- естественный ритм разговора
Четыре сценария, которые реально что-то показывают
ByeDance опубликовала семь демо-сценариев. Четыре из них содержательные.
Привязка личности к голосу. На шумном ужине модель запоминает имена и лица по мере знакомства, а потом связывает каждый голос с конкретным человеком - даже если несколько людей говорят одновременно о разных вещах.
Проактивная речь по отложенной инструкции. В Хэбэйском музее пользователь просит предупредить, когда в кадре появится конкретный бронзовый экран-стенд. Камера продолжает панорамировать, модель следит и сама подаёт голос в нужный момент. Тот же принцип - при быстром листании статьи по ResNet: модель замечает раздел «3.4 Implementation», останавливается и зачитывает learning rate, momentum и weight decay.
Прерывание по визуальному состоянию. Пока пользователь готовит эспрессо, модель прерывает его, когда видит, что цельные зёрна попали в портафильтр. Потом смотрит на крему и предлагает сократить экстракцию на 2-3 секунды.
Игнорирование лишнего и память о пропавшем контексте. В аэропорту Пекин Дасин посторонний разговор о чужом рейсе не вызывает реакции. Когда пользователь сам задаёт вопрос, модель отвечает из информации с табло, которая уже ушла с экрана, и дополнительно ищет данные о карусели выдачи багажа онлайн.
Где работает и что доступно
SeedRealtime уже встроена в Doubao - потребительский ИИ-ассистент ByteDance. Там её можно попробовать прямо сейчас.
Но если ты хочешь использовать её в своём продукте - пока никак. ByteDance не опубликовала технический отчёт, не раскрыла количество параметров, не выложила веса и не объявила об API на Volcano Engine или BytePlus.
Что это значит
Dля тех, кто делает голосовые продукты с камерой, SeedRealtime - это подтверждение архитектурного направления: cascade уходит, нативный мультимодальный full-duplex приходит. Конкретного инструмента для интеграции ещё нет, но сам подход теперь отработан на реальном продукте в Doubao.
Если ты строишь что-то похожее - ориентируйся на эти четыре сценария как на планку: идентификация говорящих, проактивность без триггера, визуальная коррекция в реальном времени, устойчивость к шуму и память за пределами текущего кадра.
Источник: Michal Sutter, MarkTechPost, 10 августа 2026