Волна ИИПодписаться
← Назад
Исследования

Anthropic показала, как инфраструктура искажает бенчмарки ИИ-агентов: разница до 6 п.п.

07.10.2026 · habr.com ↗

Anthropic опубликовала исследование, посвящённое влиянию инфраструктурного шума на бенчмарки для ИИ-агентов, которые пишут и запускают код. На Terminal-Bench 2.0 разница между самой строгой и неограниченной конфигурациями достигла шести процентных пунктов — это больше, чем типичный разрыв между соседними строчками в верхней части рейтинга.

Работа показывает фундаментальную проблему: бенчмарки измеряют не модель в вакууме, а всю систему, в которой она действует. Окружение, настройки, ограничения — всё это может существенно влиять на результат, делая сравнение моделей некорректным.

Источник: habr.com
← Все новости AI Wave