Исследования
Крошечная языковая модель на 2160 параметров: где проходит граница памяти и обобщения — эксперимент
Автор продолжает эксперименты с Крошечной Языковой Моделью (TLM) на Node.js — теперь версия v1.1.0 с 2 160 параметрами. Цель — чётко замерить, где кончается запоминание и начинается обобщение.
Результаты наглядно показывают: модель выдаёт 99,93% точности на знакомом шаблоне, 81,69% — при перестановке тех же токенов, и фактически проваливается на полностью неизвестной структуре (точность не указана в анонсе, но подразумевается низкая).
Эксперимент воспроизводим и даёт конкретные цифры для понимания границ возможностей сверхмалых нейросетей. Полезно для тех, кто изучает, как размер модели влияет на способность к генерализации, а не просто к заучиванию.
Источник: habr.com