Тесты и бенчмарки
60 багов против четырёх ИИ-ревьюеров: эксперимент с цифрами и шумом
Большинство текстов про ИИ и код — это субъективные впечатления без цифр. Автор решил исправить ситуацию: взял 60 дефектов, размеченных вручную задолго до эксперимента (51 дыра в тестах, 8 эквивалентов, 1 спорный), и прогнал через четыре ИИ-ревьюера.
Каждую модель тестировали в двух режимах — с подсказкой и без. Учитывали не только количество найденных багов, но и шум: ложные срабатывания на нетронутых файлах. Результаты — чистые цифры без лишних слов.
Источник: habr.com