Как LLM заменила ручную оценку ботов поддержки: с 3000 сессий в месяц до 100 в секунду
Ручная оценка качества ботов поддержки — это медленно и дорого. Команда Customer Support NLP (продукт MWS AI Клиентский сервис) сталкивалась с этим напрямую: 3000 сессий в месяц требовали постоянного участия людей. Чтобы масштабировать процесс, разработчики создали метрику на основе LLM, которая оценивает ответы ботов автоматически.
Решение позволило поднять производительность до 100 сессий в секунду — рост в тысячи раз. В основе лежит кастомная метрика, заточенная под бизнес-контекст поддержки. Технические детали: модель сравнивает ответ бота с ожидаемым действием и выставляет оценку без участия человека.
Авторы поделились и архитектурой, и бизнес-обоснованием. Метрика уже встроена в пайплайн разработки: помогает быстрее находить слабые места ботов и улучшать их без увеличения штата оценщиков.
Кейс полезен всем, кто строит поддержку на ИИ и упирается в лимиты ручного QA. В статье — и как считать метрику, и какие подводные камни всплыли при внедрении.