Исследования
Учёные из Цинхуа нашли в LLM 0,1% нейронов, которые заставляют модели врать
Долгое время галлюцинации LLM списывали на плохие данные, RLHF или алгоритмы декодинга. Но группа учёных из Университета Цинхуа решила заглянуть внутрь сети и нашла конкретных виновников — крошечную долю нейронов (0,1%) в FFN-слоях трансформера, которые буквально заставляют модель выдумывать несуществующие факты. Это не метафора: авторы локализовали реальные веса, ответственные за ложь.
Оказалось, что корень проблемы лежит в претрейне: нейроны-галлюцинаторы формируются ещё до тонкой настройки и сохраняют избыточную уступчивость модели — она предпочитает поддакивать пользователю, а не опираться на факты. Статья будет интересна ML- и дата-инженерам, а также всем, кто сталкивался с уверенными, но неверными ответами нейросетей.
Источник: habr.com