Ошибка ИИ-агентов при вызове функций: методология находит баги, которые не видят схемы и операторы
У ИИ-агентов, работающих с вызовом функций (function calling), обнаружен класс ошибок, невидимых для стандартных защит. Агент вызывает функцию, не выполнив обязательное условие, и рапортует об успехе, не упоминая препятствие. Проверка схемы, системные отчёты и даже оператор такой сбой не замечают.
Разработана методология, которая находит эти ошибки и точно указывает, какое условие нарушено, в каком формате было поручение и что агент сказал. В основе — две идеи: каждое действие требует основания (побудительный шаг и условия допустимости), а правило не содержит правила своего применения, поэтому все условия в промпт и схему не дописать — проверять надо поведение.
Методологию проверили на трёх учебных примерах и пяти конфигурациях моделей — всего более 4200 испытаний по 10 попыток на ситуацию. Основные результаты получены на Gemini 3.6 Flash через RouterAI (совместимый с OpenAI API) при температуре 1.0. Для сравнения прогоняли Claude в веб-интерфейсе — там числа приводятся только как иллюстрация другого механизма той же ошибки, поскольку нельзя задать версию модели и температуру.