Волна ИИПодписаться
← Назад
Модели и агенты

Meta выпустила Muse Voice Transcribe: одна нейросеть вместо трёх — распознаёт речь, определяет говорящего и понимает, когда замолчали

02.09.2026 · marktechpost.com ↗

Большинство продакшн-систем для обработки голоса — это три склеенных компонента: один распознаёт речь, второй разделяет говорящих, третий определяет, когда пользователь закончил. Каждый переход между ними добавляет задержку и новую точку отказа. Muse Voice Transcribe от Meta Superintelligence Labs схлопывает все три задачи в одну авторегрессионную модель. Meta называет её своей первой моделью восприятия аудио в реальном времени.

Технически это модель из семейства Muse Spark. Аудио поступает чанками по 80 мс с частотой 12.5 Гц. Каждый чанк превращается в один мягкий токен. Модель решает: распознать токен и продолжить слушать или выдать текстовый токен. Когда модель предсказывает audio-токен, он заменяется реальным следующим чанком; когда stream заканчивается, вставляется end-of-stream токен, и модель выводит оставшийся текст без запроса нового аудио. Задержка (delay) обучается с помощью reinforcement learning — комбинируется награда за точность и награда за скорость, что ставит модель на Парето-фронт по сравнению с системами Soniox, Cartesia и ElevenLabs.

Для диаризации в тот же поток добавлены специальные токены: turn-токен отмечает возможную смену говорящего, speaker-токен идентифицирует диктора с небольшой задержкой. Endpointing использует start-of-speech и end-of-speech токены. Все задачи обучаются совместно с дополнительными наградами поверх основной ASR-награды. Модель поддерживает 70+ языков, 25 из которых тщательно проверены на старте, включая native code-switching — переключение между языками внутри предложения.

По бенчмаркам: первое место на Artificial Analysis для стримингового ASR и публичных тестов диаризации (данные от 1 сентября 2026). Финальный WER — 3.1% при задержке 0.16 с после окончания речи (Cartesia Ink-2: 3.4% при 0.43 с, ElevenLabs Scribe v2: 3.6% при 0.14 с). На первой частичной транскрипции WER 3.6% при 0.13 с. Средняя ошибка диаризации — 17.5% (на AMI-IHM, AMI-SDM, VoxConverse). Цена: $3 за 1000 минут аудио ($0.18/час). Модель уже работает в диктовке Meta AI для Mac и Muse Code. Веса не опубликованы, только хостинг API.

Источник: marktechpost.com
← Все новости AI Wave