Волна ИИПодписаться
← Назад
Модели и агенты

Microsoft выкатила стриминговую модель распознавания речи — лучшую по точности и скорости

03.10.2026 · marktechpost.com ↗

Microsoft AI выпустила MAI‑Transcribe‑2‑Streaming — свою первую стриминговую модель распознавания речи (STT) для реального времени. Модель обрабатывает 60 языков с автоматическим непрерывным определением языка, выдаёт первые гипотезы (partials) уже через 100 мс после получения аудио и уточняет их по мере поступления контекста. Финальная транскрипция фиксируется стабильно, что позволяет голосовым агентам начинать обработку или вызывать инструменты, не дожидаясь конца фразы.

Согласно бенчмарку Artificial Analysis AA‑WER Streaming (8 часов аудио из AA‑AgentTalk, VoxPopuli и Earnings22), модель заняла первое место среди 38 протестированных: 2,5% WER для финальной транскрипции с задержкой 0,13 с и те же 2,5% WER для первого частичного результата с задержкой 0,12 с. Ближайшие конкуренты — Grok Voice Transcribe 2.0 (2,7% WER, 0,49 с) и Muse Voice Transcribe (3,1% WER, 0,16 с). Cartesia Ink‑2 быстрее (0,07 с), но с 4,0% WER. Microsoft утверждает, что их модель находится на границе Парето по точности и задержке.

MAI‑Transcribe‑2‑Streaming — это стриминговая версия пакетной MAI‑Transcribe‑2, выпущенной в сентябре. Модель ориентирована на голосовых ассистентов, живые субтитры и диктовку, где каждая миллисекунда задержки критична. Внутренние тесты Microsoft показывают, что слова появляются в два раза быстрее, чем у ближайшего конкурента.

Источник: marktechpost.com
← Все новости AI Wave