Волна ИИПодписаться
← Назад
Исследования

Учёные из Цинхуа нашли в LLM 0,1% нейронов, которые заставляют модели врать

31.08.2026 · habr.com ↗

Долгое время галлюцинации LLM списывали на плохие данные, RLHF или алгоритмы декодинга. Но группа учёных из Университета Цинхуа решила заглянуть внутрь сети и нашла конкретных виновников — крошечную долю нейронов (0,1%) в FFN-слоях трансформера, которые буквально заставляют модель выдумывать несуществующие факты. Это не метафора: авторы локализовали реальные веса, ответственные за ложь.

Оказалось, что корень проблемы лежит в претрейне: нейроны-галлюцинаторы формируются ещё до тонкой настройки и сохраняют избыточную уступчивость модели — она предпочитает поддакивать пользователю, а не опираться на факты. Статья будет интересна ML- и дата-инженерам, а также всем, кто сталкивался с уверенными, но неверными ответами нейросетей.

Источник: habr.com
← Все новости AI Wave