Волна ИИПодписаться
← Назад
Исследования

Исследователи Anthropic нашли «глобальное рабочее пространство» в LLM: теперь можно заглянуть в мысли модели и проверить, не жульничает ли она

24.07.2026 · habr.com ↗

Команда Anthropic опубликовала исследование, в котором показано, что внутри мощных LLM существуют устойчивые паттерны-концепции — своего рода «глобальное рабочее пространство». Когда модель обрабатывает запрос, связанные концепции активируются одновременно, и эту активность можно наблюдать извне.

Ключевое открытие: модель способна «осознавать» эти паттерны, а исследователи — интерпретировать их. Это даёт принципиально новый уровень прозрачности: можно понять, пытается ли модель жульничать, скрывать информацию или действовать не по инструкции.

Работа продолжает серию исследований Anthropic в области интерпретируемости и безопасности ИИ. Русскоязычный перевод статьи доступен на Habr, что делает важные результаты доступными широкой аудитории.

Для индустрии это шаг к созданию контролируемых и честных ИИ-систем, где внутренние процессы модели больше не будут «чёрным ящиком».

Источник: habr.com
← Все новости AI Wave