Волна ИИПодписаться
← Назад
Модели и агенты

ByteDance показала SeedRealtime: одна модель смотрит, слушает и говорит без задержек

10.08.2026 · marktechpost.com ↗

ByteDance Seed выпустила SeedRealtime — модель, которая объединяет аудио, видео и текст в одной архитектуре и взаимодействует в реальном времени через непрерывные мультимодальные потоки, а не по одному запросу за раз. В компании заявляют о трёх прорывах: совместное понимание аудио и видео, проактивное взаимодействие и естественный тайминг разговора.

Главная цель — заменить каскад из ASR, VLM и TTS, который добавляет задержки и теряет информацию между этапами. SeedRealtime выполняет восприятие, понимание, принятие решений и выражение параллельно внутри одной end-to-end модели. Переключение реплик тоже происходит внутри модели, без внешнего детектора голосовой активности, как в большинстве текущих систем.

Модель уже работает в приложении Doubao, но для неё нет технического отчёта, параметров, открытых весов или API на Volcano Engine и BytePlus. Сейчас сторонние команды не могут её интегрировать. Пока доступна только сама идея: проверенная эталонная архитектура и новый ориентир для продуктов с голосом и камерой в реальном времени.

Источник: marktechpost.com
← Все новости AI Wave