Волна ИИПодписаться
← Назад
Исследования

Синтезированная речь обогнала человеческую по метрике — разбор Qwen-Audio-3.0-TTS от Alibaba

15.09.2026 · habr.com ↗

Инженер из Яндекс Практикума проанализировал результаты модели синтеза речи Qwen-Audio-3.0-TTS от Alibaba. На бенчмарке SEED-TTS-Eval модель получила ошибку 0.84, тогда как контрольная запись живой речи человека показала ошибку 1.26. Формально синтезированная речь оказалась «разборчивее» реальной — но это вызывает вопросы к самим метрикам.

Автор отмечает, что метрики вроде WER (Word Error Rate) не всегда корректно оценивают качество речи: они могут занижать ошибки для чистого синтеза и завышать для естественной речи с шумами, паузами или нестандартным произношением. Возможно, бенчмарк не учитывает важные аспекты естественности и контекста.

История лишний раз напоминает: слепое доверие цифрам может ввести в заблуждение. Модель может «обгонять» человека по формальным показателям, но на практике пользователи всё равно предпочтут живую речь. При выборе TTS-системы стоит смотреть не только на метрики, но и на субъективные тесты и реальные сценарии использования.

Источник: habr.com
← Все новости AI Wave