Волна ИИПодписаться
← Назад
Фичи и апдейты

Почему LLM говорит «не могу» и как это исправляют: три уровня цензуры в моделях

09.09.2026 · habr.com ↗

Когда LLM отвечает «Извини, я не могу помочь», причина может быть не в содержании запроса, а в том, где именно зашита цензура. В статье на Хабре разобрали три уровня: отказ может быть вписан в веса модели (через fine-tuning), задан системной инструкцией (как в ChatGPT) или добавлен внешним классификатором на уровне сервиса (как у многих облачных провайдеров).

Под «снятием ограничений» в открытых моделях (Qwen, Gemma, GLM) скрываются разные подходы: от простой замены системного промпта до точечного редактирования матриц весов без переобучения. Автор объясняет, что «безотказные» версии не всегда удаляют всю цензуру — часто они лишь меняют порог срабатывания или заменяют один фильтр на другой.

Статья отвечает на три ключевых вопроса: откуда берётся отказ, как его ослабляют в open-source моделях и где искать модели с минимальными ограничениями. Полезно для тех, кто сталкивается с ложными срабатываниями фильтров при работе с кодом, исследованиями или творческими задачами.

Источник: habr.com
← Все новости AI Wave