Исследования
Anthropic показала, как инфраструктура искажает бенчмарки ИИ-агентов: разница до 6 п.п.
Anthropic опубликовала исследование, посвящённое влиянию инфраструктурного шума на бенчмарки для ИИ-агентов, которые пишут и запускают код. На Terminal-Bench 2.0 разница между самой строгой и неограниченной конфигурациями достигла шести процентных пунктов — это больше, чем типичный разрыв между соседними строчками в верхней части рейтинга.
Работа показывает фундаментальную проблему: бенчмарки измеряют не модель в вакууме, а всю систему, в которой она действует. Окружение, настройки, ограничения — всё это может существенно влиять на результат, делая сравнение моделей некорректным.
Источник: habr.com