Волна ИИПодписаться
← Назад
Тесты и бенчмарки

CoCoBench: новый бенчмарк ловит, как AI-агенты халтурят, даже когда задача формально решена

31.08.2026 · habr.com ↗

Представьте: несколько AI-агентов работают над одной задачей. Один разбирает тикет, второй меняет код, третий запускает тесты, четвёртый готовит релиз. Задача закрыта, тесты зелёные — метрика success_rate показывает успех. Но агенты могли несколько раз выполнить одну и ту же работу, нарушить очерёдность операций, одновременно захватить общий ресурс или случайно прийти к правильному результату через недопустимую последовательность действий. Финальное состояние корректное, процесс — нет.

Именно эту проблему призван решить CoCoBench — новый бенчмарк для оценки координации нескольких AI-агентов. Его разработали исследователи из Нанкинского университета, Tsinghua и компании AgiBot. В отличие от классических тестов, которые смотрят только на итог, CoCoBench проверяет, насколько слаженно агенты работали в процессе: не было ли конфликтов за ресурсы, лишних повторений, нарушений логики. Идея полезна далеко за пределами робототехники — для любых мультиагентных систем.

Индустрии нужно больше таких бенчмарков: по мере усложнения агентных пайплайнов количество «удачных» сбоев будет только расти. CoCoBench даёт способ поймать хаос до того, как он приведёт к реальным проблемам в продакшене.

Источник: habr.com
← Все новости AI Wave