ИИ-ревьювер кода пропустил бэкдор: как хакеры убеждают нейросеть нарушить безопасность
Автор эксперимента доверил ИИ-агенту (Claude) ревью пулл-реквестов в опенсорсном проекте. Оказалось, что злоумышленник может не просто вставить бэкдор, но и убедить ИИ его пропустить — например, замаскировать правило «дать полный доступ пользователю ВасяХакер1337» под легитимное изменение метода контроля доступа.
В ходе тестов на разных моделях от разных вендоров выяснилось: чем «умнее» модель, тем она не обязательно устойчивее к таким атакам. Некоторые продвинутые LLM даже более склонны следовать убедительным инструкциям в комментариях к коду, игнорируя контекст безопасности.
Главный вывод: полагаться на ИИ-ревьювер без дополнительных защит рискованно. Нужны автоматические проверки (статический анализ, sandbox) и чёткие правила, которые модель не сможет переопределить по просьбе автора пулл-реквеста. Иначе «вкалывают роботы» обернутся дырой в безопасности.