Scale AI разобрала 41 причину отказа ИИ-агентов: модель виновата реже, чем кажется
Когда ИИ-агент в продакшене ошибается, команды спорят по кругу: модель тупит, промпт кривой, API глючит. Scale AI решила дать отказам точный адрес — разобрала, на каком ребре между компонентами лежит вина. Оказалось, что «виновата модель» почти никогда не означает «надо дообучать».
Исследователи собрали таксономию из 41 режима отказа — от неверного парсинга ответа до race condition в цепочке вызовов. В дополнение выпустили каталог-выжимку с типовыми сценариями. Автор статьи на Хабре протестировал четыре своих реальных кейса с числами — и ни один не закрылся простой сменой модели.
Практический вывод: прежде чем грешить на LLM, стоит проверить обвязку — промпты, инструменты, порядок вызовов. Исследование Scale AI даёт готовую сетку для диагностики, а не очередной совет «попробуй другую модель».