Почему LLM говорит «не могу» и как это исправляют: три уровня цензуры в моделях
Когда LLM отвечает «Извини, я не могу помочь», причина может быть не в содержании запроса, а в том, где именно зашита цензура. В статье на Хабре разобрали три уровня: отказ может быть вписан в веса модели (через fine-tuning), задан системной инструкцией (как в ChatGPT) или добавлен внешним классификатором на уровне сервиса (как у многих облачных провайдеров).
Под «снятием ограничений» в открытых моделях (Qwen, Gemma, GLM) скрываются разные подходы: от простой замены системного промпта до точечного редактирования матриц весов без переобучения. Автор объясняет, что «безотказные» версии не всегда удаляют всю цензуру — часто они лишь меняют порог срабатывания или заменяют один фильтр на другой.
Статья отвечает на три ключевых вопроса: откуда берётся отказ, как его ослабляют в open-source моделях и где искать модели с минимальными ограничениями. Полезно для тех, кто сталкивается с ложными срабатываниями фильтров при работе с кодом, исследованиями или творческими задачами.