Волна ИИПодписаться
← Назад
Тесты и бенчмарки

WebPageBench: новый открытый бенчмарк для веб-агентов на российских сервисах

29.09.2026 · habr.com ↗

Веб-агенты любят рапортовать «готово», но на живых сайтах проверить это сложно: контент меняется, а полагаться на слова самого агента или LLM-судью ненадёжно. Чтобы решить проблему, авторы выпустили WebPageBench — открытый бенчмарк для оценки веб-агентов.

Внутри 152 задачи на шести симуляциях популярных российских сервисов — от покупок на маркетплейсах до бронирования билетов на поезд. В комплекте идёт локальная среда: агент запускается одной командой. На публичном лидерборде уже представлены 24 комбинации «модель + обвязка».

Главный вывод первых замеров: агенты часто заметно завышают свои результаты. Код и задачи выложены в репозитории, рейтинг — на Hugging Face, препринт — на arXiv.

Источник: habr.com
← Все новости AI Wave