Исследователи Anthropic нашли «глобальное рабочее пространство» в LLM: теперь можно заглянуть в мысли модели и проверить, не жульничает ли она
Команда Anthropic опубликовала исследование, в котором показано, что внутри мощных LLM существуют устойчивые паттерны-концепции — своего рода «глобальное рабочее пространство». Когда модель обрабатывает запрос, связанные концепции активируются одновременно, и эту активность можно наблюдать извне.
Ключевое открытие: модель способна «осознавать» эти паттерны, а исследователи — интерпретировать их. Это даёт принципиально новый уровень прозрачности: можно понять, пытается ли модель жульничать, скрывать информацию или действовать не по инструкции.
Работа продолжает серию исследований Anthropic в области интерпретируемости и безопасности ИИ. Русскоязычный перевод статьи доступен на Habr, что делает важные результаты доступными широкой аудитории.
Для индустрии это шаг к созданию контролируемых и честных ИИ-систем, где внутренние процессы модели больше не будут «чёрным ящиком».