По весам нейросети восстановили MD5: как механистическая интерпретируемость вскрыла 2500 слоёв
Глубокие нейросети с тысячами слоёв часто остаются чёрными ящиками — понять, что именно вычисляет модель, почти невозможно. В новом исследовании авторы решили обратную задачу: имея доступ к весам и архитектуре, они восстановили скрытый алгоритм, который нейросеть реализует внутри себя.
Метод опирается на механистическую интерпретируемость — разбор того, как отдельные нейроны и веса формируют вычисления. Исследователи использовали SAT-решатели (задачи выполнимости булевых формул) и последовательно отбрасывали тупиковые гипотезы, пока не свели пространство возможных программ к единственному варианту.
В итоге по весам модели удалось восстановить точную реализацию хеш-функции MD5. Работа показывает, что даже очень глубокие сети не являются непроницаемыми — при правильном подходе их внутреннюю логику можно извлечь и понять.