VCLVibe Coding LabИИ в работе — без VPN
Подписаться
НейросетиНовостиСтатус нейросетейДоступ из РФ
РАЗДЕЛЫ
ТуториалыАвтоматизацииИнструментыВайбкодинг
БИБЛИОТЕКИ
ПромптыШаблоныMCP-серверыГлоссарийПодписаться в Telegram
ГлавнаяНовостиByteDance SeedRealtime: одна модель видит, слышит и говорит одновременно
НовостьРелизseedrealtime

ByteDance SeedRealtime: одна модель видит, слышит и говорит одновременно

VCL
Редакция
Vibe Coding Lab
10 августа 2026обновлено 10.08
3 мин чтения
КОРОТКО

ByteDance Seed выпустила SeedRealtime — нативный аудиовизуальный full-duplex LLM, который обрабатывает аудио, видео и текст в единой архитектуре без цепочки ASR+VLM+TTS. Модель уже работает в приложении Doubao. Технического отчёта, весов и API пока нет.

ByteDance Seed анонсировала SeedRealtime — LLM, которая смотрит в камеру, слушает голос и отвечает в реальном времени, всё в одной модели, без привычной цепочки отдельных компонентов.

Что такое SeedRealtime и чем она отличается

Больинство реал-тайм голосовых продуктов строятся как cascade: распознавание речи (ASR) -> языковая модель (VLM) -> синтез речи (TTS). Каждый переход добавляет задержку и «роняет» часть контекста.

SeedRealtime убирает этот пайплайн. Восприятие, понимание, принятие решения и генерация ответа работают параллельно внутри одной архитектуры. Переключение очереди разговора (turn-taking) тоже встроено в модель - внешний детектор голосовой активности (VAD) не нужен.

По данным ByteDance, внутренняя оценка с участием людей показала вдвое меньше проблем с паузами по сравнению с cascade-стеками. Конкретных цифр задержки и открытых бенчмарков команда не публиковала.

Три заявленных прорыва от Seed

Команда называет три ключевых улучшения:

  • совместное понимание аудио и видео
  • проактивное взаимодействие (модель говорит сама, без вопроса)
  • естественный ритм разговора

Четыре сценария, которые реально что-то показывают

ByeDance опубликовала семь демо-сценариев. Четыре из них содержательные.

Привязка личности к голосу. На шумном ужине модель запоминает имена и лица по мере знакомства, а потом связывает каждый голос с конкретным человеком - даже если несколько людей говорят одновременно о разных вещах.

Проактивная речь по отложенной инструкции. В Хэбэйском музее пользователь просит предупредить, когда в кадре появится конкретный бронзовый экран-стенд. Камера продолжает панорамировать, модель следит и сама подаёт голос в нужный момент. Тот же принцип - при быстром листании статьи по ResNet: модель замечает раздел «3.4 Implementation», останавливается и зачитывает learning rate, momentum и weight decay.

Прерывание по визуальному состоянию. Пока пользователь готовит эспрессо, модель прерывает его, когда видит, что цельные зёрна попали в портафильтр. Потом смотрит на крему и предлагает сократить экстракцию на 2-3 секунды.

Игнорирование лишнего и память о пропавшем контексте. В аэропорту Пекин Дасин посторонний разговор о чужом рейсе не вызывает реакции. Когда пользователь сам задаёт вопрос, модель отвечает из информации с табло, которая уже ушла с экрана, и дополнительно ищет данные о карусели выдачи багажа онлайн.

Где работает и что доступно

SeedRealtime уже встроена в Doubao - потребительский ИИ-ассистент ByteDance. Там её можно попробовать прямо сейчас.

Но если ты хочешь использовать её в своём продукте - пока никак. ByteDance не опубликовала технический отчёт, не раскрыла количество параметров, не выложила веса и не объявила об API на Volcano Engine или BytePlus.

Что это значит

Dля тех, кто делает голосовые продукты с камерой, SeedRealtime - это подтверждение архитектурного направления: cascade уходит, нативный мультимодальный full-duplex приходит. Конкретного инструмента для интеграции ещё нет, но сам подход теперь отработан на реальном продукте в Doubao.

Если ты строишь что-то похожее - ориентируйся на эти четыре сценария как на планку: идентификация говорящих, проактивность без триггера, визуальная коррекция в реальном времени, устойчивость к шуму и память за пределами текущего кадра.


Источник: Michal Sutter, MarkTechPost, 10 августа 2026

Marktechpost · 10 августа
Свежие новости — в Telegram
Главное за день — коротко, без воды.
Подписаться