Волна ИИПодписаться
← Назад
Тесты и бенчмарки

Старые бенчмарки врут: новый PRACT-120 тестирует ИИ-чат целиком, а не только модель

31.08.2026 · habr.com ↗

Когда выбираешь ИИ-чат для работы, обычно смотрят на MMLU, GPQA, HumanEval или LMSYS Arena. Но все эти тесты меряют только силу базовой модели, а не реальный опыт пользователя. Чат — это не просто модель, а целая экосистема: обвязка, веб-поиск, память, контекст, загрузка PDF, редактирование Word и Excel, работа с файлами. Именно эти возможности люди и оценивают на практике, но ни один популярный бенчмарк их не проверяет.

Новый бенчмарк PRACT-120 (Practical AI Chat Test 120) закрывает этот пробел. Он включает 120 сценариев, имитирующих реальные задачи: от запроса к поиску по свежим источникам и анализа загруженного PDF до редактирования нативного Word-файла (чтобы открылся у юриста) и работы с Excel с живыми формулами (готовыми для финансиста). Результат показывает, что именно получит человек в браузере, а не абстрактную силу модели.

Авторы подчёркивают: даже мощная LLM может оказаться бесполезной в продукте, если у чата нет нормального поиска, плохая интеграция с документами или слабая работа с контекстом. PRACT-120 призван дать объективную оценку именно продуктового качества ИИ-чата — того, за что пользователи платят деньги и тратят время.

Источник: habr.com
← Все новости AI Wave