В 10 раз быстрее и в 5 раз легче: «Криптонит» ускорил определение языка без потери качества
При работе с большими массивами аудио нужно сначала понять, на каком языке говорит человек, и только потом отправлять запись в подходящий распознаватель речи. Для этого используют LID-классификаторы. В «Криптоните» решили сделать такой классификатор значительно быстрее и компактнее, не потеряв в качестве.
Отправной точкой стала общедоступная модель, различающая 126 языков и содержащая около 1 млрд параметров. Просто уменьшить её или снизить точность представления весов не получалось, поэтому исследователь компании Александр Самойлов вместе с Александром Тарариным и Артёмом Рыженковым применили дистилляцию знаний — большая модель выступила «учителем» для компактной.
Итоговая модель примерно в 10 раз быстрее и в 5 раз легче исходной, при этом качество распознавания сохранено, а сама модель устойчива к искажениям. Это позволяет обрабатывать аудиоданные с меньшими вычислительными затратами и эффективнее масштабироваться на существующей инфраструктуре.