Исследования
Grokking воспроизвели на трёх seed: нейросеть сначала запоминает, а обобщать учится намного позже
Исследователи воспроизвели явление grokking — ситуацию, когда нейросеть сначала заучивает обучающие примеры наизусть, а способность обобщать на новые данные появляется лишь спустя значительное число шагов обучения. Эксперимент провели на трёх случайных начальных состояниях (seed), и эффект подтвердился во всех случаях.
В работе детально описан сценарий, при котором модель быстро достигает нулевой ошибки на тренировочной выборке, но на валидации долго остаётся случайной. Переход к обобщению происходит резко, после десятков тысяч шагов. Авторы выложили артефакты эксперимента и чётко обозначили границы применимости наблюдений: grokking может проявляться не для всех архитектур и задач.
Источник: habr.com