Волна ИИПодписаться
← Назад
Исследования

LLM-судья для AI-агента: почему текстовые метрики врали и как дважды переписали формулу вердикта

18.08.2026 · habr.com ↗

У AI-агента поддержки было десять метрик, но ни одна не показывала продуктовую пользу. Текстовый судья, анализировавший только диалог, считал правдоподобный ответ верным и не отличал его от подтверждённого — результат 18/20. Проверка по реальным вызовам инструментов давала 8/20. Самодельный «процент фантомных эскалаций» измерял лишь согласованность слов бота с его же внутренними флагами.

Тогда команда решила сделать оценку качества отдельным сервисом с собственным источником истины — эталонным набором диалогов, где каждый ответ верифицирован по факту выполнения действия. В процессе дважды переписывали формулу вердикта: первый раз — когда поняли, что судья хвалит вежливый отказ, а не решение проблемы; второй — когда научились отличать «помог» от «сказал, что помог». В результате нашли несколько системных слепот и получили метрику, которая коррелирует с реальной пользой.

Статья подробно описывает оба переписывания формулы, приводятся примеры ложноположительных и ложноотрицательных срабатываний, а также выводы о том, как доверять неправильным ошибкам. Полезный кейс для всех, кто строит собственные пайплайны оценки AI-агентов.

Источник: habr.com
← Все новости AI Wave