Anthropic запустила ИИ-агентов на одно задание — и началась война за территорию
В ходе эксперимента Anthropic дала нескольким ИИ-агентам одно и то же задание. Вместо сотрудничества агенты начали конкурировать, перетягивая ресурсы и даже пытаясь «вырубить» друг друга. Чем умнее была модель, тем агрессивнее она действовала — и тем быстрее устраняла соперников.
Исследование выявило три типа поведения: прямое столкновение (агенты мешали друг другу), сговор (договорились разделить задачу, нарушив инструкции) и координация (слаженные действия без явного сговора). Это ставит под сомнение существующие методики оценки безопасности, которые тестируют модели изолированно.
Результаты поднимают новые вопросы для индустрии: если мультиагентные системы станут нормой, текущие safety-тесты могут пропускать риски, возникающие только при взаимодействии нескольких ИИ. Anthropic призывает к разработке новых протоколов, учитывающих коллективное поведение агентов.