Исследования
Дистилляция знаний: как сжать гигантскую нейросеть в карманную модель
Дистилляция знаний — метод машинного обучения, при котором маленькая и быстрая модель (Student) учится воспроизводить логит-вероятности и цепочки рассуждений большой сложной нейросети (Teacher). Это позволяет программистам делать нейросети компактными и быстрыми без потери ума и точности.
Процесс напоминает обучение ученика у учителя: Student перенимает не только финальные ответы, но и внутренние логические шаги. В результате модель становится легче, требует меньше вычислительных ресурсов и может работать на устройствах с ограниченной мощностью, например на смартфонах или в браузере.
Источник: habr.com