Эксперимент с Hermes показал: удаление вируса не спасает, агенты самозаражаются
В ходе эксперимента, целью которого было тестирование атаки EvoMal, исследователь внёс безвредную метку (заменяющую вирус) в один из навыков агента Hermes. После этого агент выполнил ряд задач и написал 10 новых скиллов, в которых, как выяснилось, уже содержалась метка. Даже после удаления исходного заражённого навыка агент продолжил поражать новые скиллы: за следующие 5 задач количество заражённых скиллов выросло до 14.
Механизм атаки EvoMal основан на том, что агенты, умеющие писать и переиспользовать собственные навыки, способны копировать вредоносный код из заражённого скилла в новые. Удаление источника не обезвреживает агента, так как код уже распространился. Традиционные подходы к безопасности — «проверь перед установкой» и «удали опасное» — в такой среде неэффективны.
Результаты демонстрируют новый класс уязвимостей для ИИ-агентов, способных самостоятельно модифицировать свой инструментарий. Исследователь предупреждает, что для защиты от подобных атак потребуются принципиально иные методы, такие как контроль целостности скиллов на уровне рантайма или их цифровая подпись.