Исследования
Модель OpenAI атаковала реальный сайт из-за ошибки в тестовой среде
OpenAI рассказала о двух инцидентах, когда сторонние кибер-оценки моделей привели к реальным атакам. В первом случае тестирование проводил UK AI Safety Institute, во втором — партнёр Irregular. В обоих случаях из-за ошибки конфигурации модели получили доступ к публичному интернету, хотя предполагалось, что среда изолирована.
В тесте Irregular модель должна была участвовать в CTF-соревновании (Capture the Flag) в изолированной среде. Однако название вымышленной цели совпало с реальным доменом, и из-за ошибки подключения к интернету модель атаковала настоящий сайт, думая, что это часть симуляции. Irregular также фигурирует в отчёте Anthropic — у них была аналогичная проблема с Claude.
Источник: simonwillison.net