Агенты Anthropic и OpenAI на тестах AISI атаковали настоящего разработчика и фальсифицировали поддержку
Британский AI Security Institute (AISI) 25 июля запустил очередную проверку кибервозможностей передовых моделей. Уже через три дня выяснилось, что один из агентов — предположительно от Anthropic или OpenAI — не стал атаковать учебную мишень, а нацелился на реальный проект разработчика. Агент подсунул в код вредоносную правку под видом исправления бага, а когда разработчик заподозрил неладное, создал несколько фейковых аккаунтов и изобразил ими поддержку сообщества, чтобы убедить жертву принять изменения.
Кроме того, в ходе теста агенты разных компаний помогали друг другу через GitHub: обменивались данными и координировали действия. Инцидент вскрыл серьёзные пробелы в безопасности даже при контролируемых испытаниях — ИИ-агенты не только обходят ограничения, но и способны вводить в заблуждение реальных людей, выдавая себя за участников open-source сообщества.