Completion gate для локальных моделей: 10 из 10 сценариев — ещё не повод выбирать модель
При оценке локальных моделей легко поддаться соблазну посмотреть на процент успешных сценариев. Но если модель формально «справилась» со всеми десятью задачами, это ещё не значит, что её ответы можно принимать. Автор предлагает разделить два разных вопроса: завершила ли модель целый артефакт, который вообще подлежит оценке, и насколько хорош этот артефакт по качеству.
Для этого вводится completion gate — промежуточный фильтр, который отсекает незавершённые ответы до того, как они попадут на проверку качества и человеческую приёмку. В тесте три маршрута показали 10 из 10 по сценариям, но выбирать модель по этой таблице рано: без гейта вы рискуете сравнить «пустышки» с полноценными решениями и получить нечестную картину.
Подход полезен всем, кто строит пайплайны оценки для локальных моделей: он делает метрики честнее и экономит время на ручной разбор мусорных ответов.