Волна ИИПодписаться
← Назад
Исследования

Безопасность для кого? Hugging Face предложили отказывать на опасную часть темы, а не на всю тему целиком

08.09.2026 · huggingface.co ↗

Традиционные методы безопасности LLM часто блокируют целые темы из-за одного рискованного подмножества — например, модель отказывает отвечать на любые вопросы о медицине, потому что боится дать неверный диагноз. Новый подход от Hugging Face решает эту проблему: вместо всеобщего запрета модель учится выделять именно те подтемы, на которые отвечать небезопасно, и только на них выдаёт отказ.

Исследователи показали, что такая точечная фильтрация сохраняет доступность полезной информации и снижает число ложных отказов. Результаты опубликованы в открытом доступе, код и данные — на платформе Hugging Face. Это важный шаг к более тонкому и прагматичному управлению безопасностью ИИ.

Источник: huggingface.co
← Все новости AI Wave