Три негативных ответа ИИ оказались о другой компании: разбор ошибки в метрике тональности
Разработчик решил измерить, как часто языковые модели отзываются плохо о конкретной компании. Прогнал 358 запросов через несколько моделей, разметил тональность и получил три негативных ответа — 0,8%. Результат выглядел спокойным, но при проверке выяснилось: все три негатива относились к компании-однофамильцу с похожим названием, а не к той, что измеряли.
Автор выделил три системные проблемы метрики доли негатива. Первая — неправильный знаменатель: не все ответы модели релевантны. Вторая — отсутствие проверки, что модель говорит именно о вашей компании, а не о тёзке. Третья — отказы моделей, которые не попадают ни в позитив, ни в негатив, но искажают статистику.
История — наглядный пример того, как автоматическая разметка тональности может молча врать без ручной верификации. Для точной оценки репутации в ИИ-ответах нужна не только статистика, но и контекстная проверка каждого случая.