Инструменты
Как тестировать AI-фичи, когда нет одного правильного ответа: гайд по оракулам для суммаризации
Когда у AI-фичи нет единственного верного ответа, привычные тесты по принципу «ожидание = факт» не работают. Тестировщику нужно определить, какие свойства ответа критичны, как отличить допустимую вариативность от ошибки и сформулировать чёткий критерий pass/fail.
В статье на примере функции суммаризации обращений разбирается, как сформировать контракт поведения — набор инвариантов (например, длина, полнота, отсутствие галлюцинаций), которые проверяются тестовым оракулом. Такой подход позволяет автоматизировать регрессионное тестирование AI-фич и ловить регрессии без эталонных ответов.
Источник: habr.com