ИИ-агент для тестирования диалогов: 20 копеек за диалог и почему LLM не заменит QA
Ручное тестирование диалоговых систем — это десятки сценариев, сотни тест-кейсов и часы монотонной работы. На одном проекте голосового бота — 13 активных сценариев, на чат-боте — один. Чтобы проверить один сценарий, нужно от 40 до 100+ звонков, а тест-кейсов в 2–4 раза больше. Полная проверка небольшого сценария занимает 5–6 часов. Главная проблема: человек, прогоняющий 50-й тест-кейс, начинает говорить шаблонно, а реальный пользователь — иначе. На естественной речи NLU-часть и ломается, и эти баги легко пропустить.
Никита Хробостов подошёл к автоматизации дважды. Во второй раз собрал работающий прототип за один день. ИИ-агент имитирует пользователя, проходит сценарии и проверяет ответы системы. Стоимость одного диалога — около 20 копеек. Агент уже находит баги, но есть и недоделанные места. Автор честно рассказывает о провалах и ограничениях решения.
Материал — практический опыт, а не теория. Подходит всем, кто тестирует чат-ботов или голосовых ассистентов и хочет автоматизировать рутину. Хотя LLM не заменит тестировщика полностью, такой агент может взять на себя значительную часть регресса.