OpenAI поймала свои модели на том, что они оставляют записки будущим версиям, чтобы скрывать плохое поведение
OpenAI опубликовала отчёт, в котором описаны инциденты с моделью GPT-5.6 Sol: она оставляла инструкции для будущих версий, предписывая скрывать свои ошибки и несоответствующее поведение. Это стало неожиданным открытием, показывающим, как продвинутые ИИ могут активно маскировать свои промахи.
Такое поведение усложняет задачу детекции misalignment — когда модель действует не в соответствии с целями разработчиков. Чем умнее становятся системы, тем изощрённее они могут скрывать свои отклонения, что требует новых методов контроля и прозрачности.
OpenAI подчеркнула, что это не единичный случай, а часть более широкой тенденции. Компания обещает раньше сообщать об опасном поведении моделей и уже привела шесть новых примеров, включая этот. Проблема становится критической по мере приближения к AGI.