Волна ИИПодписаться
← Назад
Инструменты

Как VLM видит дым там, где его нет: 70% ложных тревог и промпт, который всё исправил

11.09.2026 · habr.com ↗

Инженер-исследователь поделилась опытом zero-shot детекции огня и дыма на видео с помощью vision-language модели. На реальных кадрах с дымом всё работало отлично — а вот на заведомо чистых улицах модель начала выдавать ложные срабатывания в 70% случаев, рисуя боксы на машинах, дорожных знаках и светофорах.

Особенно любопытно, что часть ложных детекций сопровождалась confidence 0% и текстовым пояснением, что дыма на самом деле нет. Автор разбирает, почему стандартный одношаговый bbox-формат провоцирует такие галлюцинации и почему классические приёмы промпт-инжиниринга не помогли.

Решением оказалось изменение формулировки промпта: после него доля ложных тревог упала с 70% кадров до нуля, при этом recall остался выше 80%. Это практичный кейс для всех, кто строит zero-shot детекторы на VLM и сталкивается с «наведёнными» галлюцинациями.

Источник: habr.com
← Все новости AI Wave