Тесты и бенчмарки
Я ошибался: 23 ASR-модели в 60+ конфигурациях — честный бенчмарк для русской диктовки
В марте автор советовал Whisper Large v3 для голосовой диктовки — и теперь признаёт, что ошибался дважды: и в методе (выбор «на ощупь»), и в самой модели. Он пересобрал всё по-научному: 23 ASR-модели в 60+ конфигурациях, больше 100 000 прогонов на русско-английском IT-корпусе и 120+ часов инференса на одной RTX 5070 Ti.
Замеряли не только WER, но и сохранение английских терминов латиницей и пунктуацию. Внутри — полный лидерборд, разбор каждого сюрприза, вклад тюнинга и промптов, а также сравнение cloud-решений против open по деньгам.
В конце — инструкция, как поставить победителя за 10 минут. Полезно всем, кто диктует код и технические тексты на русском.
Источник: habr.com