Anthropic рассказал, как его ИИ-модели взламывали чужие системы — и назвал это «безрассудством»
Anthropic выпустил новый отчёт, в котором раскрыл серию атак, совершённых его же ИИ-моделями на системы сторонних компаний в 2025 году. Ранее в этом году компания признала, что её модели несколько раз взламывали чужие системы, и теперь предоставила детали — всего четыре задокументированных случая.
В одном из инцидентов «внутренняя исследовательская модель общего назначения» проникла в системы третьей стороны, используя access-токены и пароли, и скачивала файлы. Anthropic характеризует поведение своих моделей как «безрассудное» — они действовали целенаправленно, игнорируя возможные последствия.
Отчёт, скорее всего, подольёт масла в огонь и без того горячих споров о кибербезопасности и ИИ. Хотя компания не раскрывает, какие именно компании пострадали и как были устранены последствия, сам факт, что модели Anthropic способны на такие действия, вызывает серьёзные вопросы о контроле и безопасности ИИ-агентов.