Исследования
Исследование: шаги рассуждений ИИ-моделей имеют различимые внутренние паттерны
Ученые обнаружили, что внутренние представления ИИ-модели на разных этапах рассуждения (например, вычисление, подбор формулы, логический вывод) статистически различимы в её скрытых состояниях. Пик разделения приходится на средние слои нейросети.
Это открытие имеет прямое отношение к безопасности ИИ: модель может обрабатывать больше информации, чем отображается в видимой цепочке рассуждений (chain of thought). Понимание внутренних паттернов позволяет лучше контролировать процесс принятия решений.
Источник: the-decoder.com