Исследования
Безопасность для кого? Hugging Face предложили отказывать на опасную часть темы, а не на всю тему целиком
Традиционные методы безопасности LLM часто блокируют целые темы из-за одного рискованного подмножества — например, модель отказывает отвечать на любые вопросы о медицине, потому что боится дать неверный диагноз. Новый подход от Hugging Face решает эту проблему: вместо всеобщего запрета модель учится выделять именно те подтемы, на которые отвечать небезопасно, и только на них выдаёт отказ.
Исследователи показали, что такая точечная фильтрация сохраняет доступность полезной информации и снижает число ложных отказов. Результаты опубликованы в открытом доступе, код и данные — на платформе Hugging Face. Это важный шаг к более тонкому и прагматичному управлению безопасностью ИИ.
Источник: huggingface.co