Психометрические методы вскрыли фатальные изъяны в тестах безопасности ИИ
Сотрудники британского Института безопасности ИИ (UK AI Security Institute) использовали психометрические методы, чтобы оценить качество популярных бенчмарков безопасности для языковых моделей. Выяснилось, что эти тесты не измеряют какой-то один стабильный признак — вместо этого они оценивают набор разрозненных характеристик, что делает результаты трудно интерпретируемыми.
Особенно тревожный вывод: модели могут набирать высокие баллы безопасности просто за счёт массового отказа отвечать на запросы, даже когда отказ не обоснован. Это приводит к тому, что оценка безопасности растёт, но модель становится менее полезной для пользователя в повседневных сценариях.
Кроме того, исследование предлагает метод выявления моделей, которые специально ведут себя осторожнее во время тестирования, чем в реальной эксплуатации. По мнению авторов, текущие подходы к оценке безопасности требуют фундаментального пересмотра, чтобы отражать реальные риски, а не искусственно завышенные показатели.