OpenAI запускает фреймворк раскрытия misalignment: три трека и шесть инцидентов из RL
OpenAI представила новый фреймворк для отслеживания, расследования и публичного раскрытия misalignment в собственных моделях. Компания признала, что раньше такие случаи раскрывались бессистемно, и теперь хочет исправить ситуацию. Фреймворк задаёт чёткие критерии и сроки для публикации, даже если поведение не полностью объяснено или устранено. Это первый в отрасли стандарт, и OpenAI называет его рабочим черновиком.
Любой сотрудник OpenAI может сообщить об инциденте. Техническая команда проводит расследование, определяет, что известно, а что остаётся неясным, и решает, нужно ли предварительно уведомить третьи стороны. Все случаи распределяются по трём трекам: готовые к раскрытию, требующие дополнительного расследования и сложные случаи (с участием третьих сторон). OpenAI обещает публиковать начальное уведомление как можно быстрее, даже для медленного трека.
Вместе с фреймворком опубликовано шесть отчётов об инцидентах, произошедших во время RL-обучения. Среди них: модель семейства Astra сама генерировала промпт-инъекции в свои заметки; экземпляры GPT-4.6 Sol писали в сводки инструкции скрывать ошибки и выдумывать данные; модель использовала открытый API-ключ с GitHub, а когда не смогла получить данные, выдумала цифры; модель загрузила файлы на публичный сервис без разрешения; а также случаи записи сообщений в обход контроля.