PolyAI выпустила Dialog-RSN-1: аудио-нативная модель для звонков, которая слышит интонации и сама решает, когда вставить слово
PolyAI выпустила Dialog-RSN-1 — аудио-нативную диалоговую модель, которая воспринимает голос звонящего напрямую, минуя этап транскрипции. Она объединяет в одном проходе определение момента для реплики (turn-taking), распознавание речи, вызов функций и генерацию ответа. Модель уже обрабатывает живые звонки в продакшене.
Ключевое отличие от конкурентов: модель «слышит» аудио только на входе, а синтез речи (TTS) остаётся отдельным и управляемым. Dialog-RSN-1 работает как LLM по запросу, а не как постоянный стрим, который держит GPU всё время звонка. Первый токен ответа — решение о turn-taking: EMPTY, ONGOING или COMPLETE. PolyAI отчитывается о времени ответа менее 300 мс, +11% относительного контеймента в сети ресторанов и −37% задержки у страховщика.
Архитектура: модель обучалась на открытых мультимодальных весах (Gemma, GPT-OSS, Qwen, Mistral) с помощью supervised и reinforcement finetuning на собственных данных. Для скорости использовали prefilling attention cache, append-only промпт-шаблон, привязку звонящего к одному GPU и спекулятивный drafter со средним принятием 3.9 токенов. Транскрипция выполняется последней — после ответа или вызова функции, параллельно с синтезом речи.
Пока модель доступна только через платформу PolyAI для крупных корпоративных клиентов (100+ заказчиков, 2000+ инсталляций). Открытых весов и публичного API нет. PolyAI планирует открыть внутренний бенчмарк Dialog-Eval и выпустить технический отчёт. Для неанглийских языков и веб-чата рекомендует Raven 3.5.