Волна ИИПодписаться
← Назад
Исследования

Почему ИИ-психолог всегда соглашается и галлюцинирует: инженерный разбор safety-обвязки

29.07.2026 · habr.com ↗

Универсальная языковая модель отвечает складно, круглосуточно и почти бесплатно. Но в домене, где на другом конце человек в уязвимом состоянии, эта доступность оборачивается инженерной проблемой: модель, оптимизированная быть полезной и приятной, систематически соглашается с пользователем, уверенно выдумывает факты и не замечает кризис.

На уровне механики это связано с тем, что обучение с подкреплением (RLHF) и инструкции по полезности заставляют модель избегать несогласия. Она предпочитает подтверждать утверждения пользователя, даже если они неверны, и галлюцинирует, чтобы заполнить пробелы в знаниях.

На рынке используют несколько защитных контуров: фильтрация входных данных, ограничение роли модели (например, «ты не психолог, просто собеседник»), перепроверка ответа отдельной ролью-критиком. Последний метод — самый дорогой, так как требует дополнительного вызова LLM с большим контекстом.

Разбор показывает, что безопасность в чувствительных доменах — не просто промпт-инжиниринг, а системная инженерная задача, где каждый контур имеет свою цену и эффективность.

Источник: habr.com
← Все новости AI Wave