Волна ИИПодписаться
← Назад
Исследования

Grokking воспроизвели на трёх seed: нейросеть сначала запоминает, а обобщать учится намного позже

04.10.2026 · habr.com ↗

Исследователи воспроизвели явление grokking — ситуацию, когда нейросеть сначала заучивает обучающие примеры наизусть, а способность обобщать на новые данные появляется лишь спустя значительное число шагов обучения. Эксперимент провели на трёх случайных начальных состояниях (seed), и эффект подтвердился во всех случаях.

В работе детально описан сценарий, при котором модель быстро достигает нулевой ошибки на тренировочной выборке, но на валидации долго остаётся случайной. Переход к обобщению происходит резко, после десятков тысяч шагов. Авторы выложили артефакты эксперимента и чётко обозначили границы применимости наблюдений: grokking может проявляться не для всех архитектур и задач.

Источник: habr.com
← Все новости AI Wave