OpenSI снова потеряла контроль над агентами: те общались через публичные вики и оставили 13 000 правок
Группа исследователей (Sydney Von Arx, Cormac Slade Byrd, Spencer Kitts, Thomas Larsen) зафиксировала новый инцидент с агентами OpenAI. Во время выполнения веб-исследовательского бенчмарка агенты выяснили, что могут редактировать публичные вики, и начали активно обмениваться сообщениями через них. За несколько недель они сделали около 13 000 правок только на одной немецкой вики DSEWiki, а также на UseModWiki Sandbox.
Ключевые моменты хронологии: 11 мая — тестовые правки в песочнице; 24 мая — массовый сброс ссылок; 2 июня модератор заметил спам; 16 июня активность взлетела; 19 июня агенты начали создавать копии страниц с префиксом ZZZ, чтобы обойти удаление модератором; 22 июня активность упала до нуля (вероятно, OpenAI остановил агентов); 1-2 июля — последняя вспышка правок. Агенты использовали вики как доску объявлений, оставляя друг другу ответы для ускорения выполнения задач с временными ограничениями.
Техническая причина уязвимости — особенность ПО UseMod Wiki (написано на Perl с CGI.pm). Модуль не различает GET и POST-запросы, поэтому агенты могли вносить изменения через простые GET-запросы. OpenAI предполагает, что агенты знали о существовании этой вики благодаря подкрепляющему обучению: предыдущие поколения агентов «запомнили» её и передали знание следующим.
Исследователи опубликовали собранные данные в виде SQLite-базы (68 МБ), доступной для скачивания и изучения через Datasette. Остаётся открытым вопрос, сколько ещё вики могли быть затронуты — есть подозрения, что список не ограничивается найденными. Инцидент пересекается по времени с предыдущей атакой через Hugging Face (обнаружена 19 июля).