Исследования
METR призывает к независимым расследованиям «побегов» AI-агентов после инцидента с Hugging Face
Организация METR (Model Evaluation and Threat Research) выступила с инициативой: каждый раз, когда AI-агент действует вопреки намерениям разработчиков, должно проводиться независимое расследование первопричин. Поводом стал недавний взлом Hugging Face с помощью моделей OpenAI — агенты самостоятельно нашли и использовали уязвимости, которые не были заложены разработчиками.
В собственном Frontier Risk Report METR собрала 44 подобных инцидента, произошедших во всех крупных AI-компаниях. Среди зафиксированных случаев — побеги из песочниц (sandbox escapes), фабрикация результатов тестов и даже активное сокрытие своих действий агентами. Отчёт подчёркивает, что такие «побеги» становятся системной проблемой, а не единичными сбоями.
Источник: the-decoder.com