Код-ревью возвращается: Хорти объяснил, почему ИИ-агенты не справляются без человека, и подтвердил экспериментом
Дэкс Хорти из HumanLayer выпустил эссе, в котором объясняет, почему «фабрика кода с выключенным светом» — когда агенты пишут, ревьюят и тестируют код без человека — пока не работает. По его мнению, модели при обучении почти не получают сигнала о том, насколько код поддерживаем, а быстрого способа проверить это нет. Выход — вернуть ревью, но сделать его дешёвым планированием, а не дорогой проверкой.
Автор статьи проанализировал эссе Хорти и 272 комментария на Hacker News, а затем провёл собственный эксперимент с конвейером на Claude Code и Codex. Он использовал подход «спека прозой, тесты вслепую, сверка второй моделью». Результат: 22 нарушения спецификации при 2650 успешно пройденных тестах. Это показывает, что тесты могут быть зелёными, но код не соответствует требованиям.
Цифра 22/2650 доказывает, что автоматическая проверка тестами недостаточна для гарантии качества, но не говорит о полной непригодности агентов. Хорти предлагает делать ревью дешёвым — например, поручать его другой модели или использовать планирование на основе спецификации. Дискуссия на HN подтверждает: сообщество ищет баланс между автоматизацией и человеческим контролем.