Волна ИИПодписаться
← Назад
Тесты и бенчмарки

Осторожность ИИ-агента обернулась минус 13% исправленных багов: эксперимент на SWE-bench

17.09.2026 · habr.com ↗

Разработчик провёл эксперимент: добавил в промпт ИИ-агента для написания кода «правила дисциплины», основанные на рекомендациях Андрея Карпати. Три прогона на 100 реальных багах из бенчмарка SWE-bench показали, что осторожность не помогла — наоборот, число успешных исправлений упало примерно на 13%.

Почему так? Ограничения, которые должны были заставить агента действовать аккуратнее, на деле затормозили его: он стал реже рисковать, дольше думать и в итоге пропускать баги, которые мог бы исправить. Эксперимент наглядно демонстрирует, где грань между разумными ограничениями и излишней скованностью для ИИ-агента.

Источник: habr.com
← Все новости AI Wave