MERA Text 2.0: старые тесты больше не работают — как теперь меряют текстовые модели
MERA Text 2.0 — это не просто набор новых датасетов, а полное переосмысление того, что имеет смысл измерять у фундаментальных текстовых моделей. Авторы объясняют: за три года с момента создания первой версии бенчмарка картину изменило то, что современные LLM стали настолько сильны, что на прежних задачах (знания, логика, понимание текста, профессиональные предметные области) они уже достигают и даже превышают человеческий уровень. Разрыв между сильными моделями сжался, и тесты перестали давать полезную информацию.
Вместо того чтобы просто добавить ещё несколько датасетов в старую структуру, разработчики пересобрали оценку вокруг групп навыков, которые остаются сложными и содержательными для современных моделей. Как именно сгруппированы навыки и какие задачи вошли в новую версию — в статье на Хабре.
Обновление MERA Text 2.0 — это сигнал, что даже для продвинутых моделей есть куда расти, и индустрии нужны новые метрики, отделяющие действительно сильные системы от просто «достаточно хороших».