BenchMIRT: что на самом деле измеряют бенчмарки LLM?
Hugging Face опубликовала новый аналитический инструмент под названием BenchMIRT, предназначенный для декомпозиции тестовых наборов данных LLM-бенчмарков. BenchMIRT позволяет разобрать задачу, понять, какие навыки или фактические знания она измеряет, и обнаружить систематические ошибки, например чрезмерное доминирование определённых тем или языков.
Разработчики утверждают, что поверхностные метрики (Accuracy, F1) часто вводят в заблуждение: модель может «заучить» типовые паттерны и достигать высоких баллов без реального понимания. BenchMIRT строит карту зависимостей между вопросами и их подразумеваемыми знаниями, выявляя пробелы в покрытии.
Пока инструмент находится в стадии экспериментальной разработки и доступен на Hugging Face. Команда приглашает сообщество к тестированию и доработке методологии. Это может стать важным шагом к более честной оценке возможностей ИИ-моделей.