Тест проходит даже с багом: эксперимент Дэна Лу показал, что TDD и фаззинг не спасают ИИ-агентов
Дэн Лу провёл эксперимент, в котором ИИ-агент реализовывал проверку разворота строки на палиндром и проверку порядка выполнения четырёх потоков на четырёх одинаковых входах. Выяснилось, что тесты успешно проходили даже при наличии бага в коде.
Исследователь сравнил три подхода к тестированию: TDD (разработка через тестирование), фаззинг (случайные входные данные) и формальные методы (строгая верификация). Ни один из них не показал значимого общего превосходства над контрольной группой без специальных техник.
В статье автор разбирает три механизма, которые приводят к бесполезным проверкам, и приводит исполнимый пример, как намеренно внести баг и убедиться, что тест его не ловит. Это указывает на ограничения автоматических подходов в генерации тестов для ИИ-агентов.