Волна ИИПодписаться
← Назад
Исследования

IBM учит ИИ проверять бенчмарки: 18,5% заданий оцениваются неверно

02.09.2026 · habr.com ↗

Бенчмарки для ИИ — стандартный инструмент сравнения моделей, но их качество часто хромает. Исследователи выявили, что в тестах встречаются неверные эталонные ответы, противоречивые условия и ошибки в правилах оценки, из-за чего правильные решения засчитываются как неверные.

Летом 2026 года провели независимый аудит четырёх популярных бенчмарков для агентов, работающих с внешними инструментами: BFCL v4, τ²-Bench, LiveMCPBench и MCP-Atlas. Из 496 вручную проверенных заданий в 92 случаях (18,5%) эксперты не согласились с автоматической оценкой. Причины — от жёсткого сравнения с эталоном до нестабильной трактовки критериев самими LLM-судьями.

IBM предложила решение: использовать LLM для проверки качества самих бенчмарков. В работе акцент сделан на task-oriented conversational agents — агентов, которые общаются с пользователем и выполняют конкретные задачи (например, оформление возврата или изменение бронирования). Такой подход позволяет выявлять ошибки в тестах и повышать достоверность результатов.

Парадокс «бенчмарков для бенчмарков» становится реальностью: чтобы доверять оценкам ИИ, нужно сначала убедиться, что экзамен составлен правильно. ИИ сам может помочь в этой проверке, замыкая методологический круг.

Источник: habr.com
← Все новости AI Wave