«Мы больше не можем это взломать»: Anthropic хоронит промпт-инъекции, но забывает про агентов
В конце июля, на фоне новостей о Claude Opus 5, создатель Claude Code Борис Черный заявил, что новая модель настолько устойчива к промпт-инъекциям, что команда Anthropic больше не может продемонстрировать успешную атаку. На YC Startup School прозвучали ещё более сильные формулировки: «модель, похоже, больше не подвержена промпт-инъекциям» и «мы просто не можем их продемонстрировать».
В поддержку этих слов Anthropic опубликовала результаты исследования сторонней лаборатории: модели Fable, Opus и Sonnet прогнали через бенчмарк из 72 сценариев по 10 раз — и ни одна атака не сработала. Формально вопрос с промпт-инъекциями выглядит закрытым.
Но автор материала предупреждает: устойчивость базовой модели не равна безопасности агентных сценариев. Инструменты, работа с файлами и реальные действия в окружении открывают векторы, которые классические PI-тесты не покрывают. Так что хоронить проблему рано — особенно когда ИИ начинает действовать как агент.