Волна ИИПодписаться
← Назад
Тесты и бенчмарки

Reasoning-модели нуждаются в новых метриках: представлен публичный лидерборд MERA Reason

24.07.2026 · habr.com ↗

За последний год в мире больших языковых моделей произошел заметный сдвиг: основное соревнование перешло от знаний модели (ответы на вопросы, факты, написание кода) к способности рассуждать. Практически каждый крупный релиз последних месяцев позиционируется как reasoning-модель, где упор делается на длинные цепочки рассуждений, решение сложных задач и принятие решений в условиях неопределенности.

Однако вместе с этим возникает закономерный вопрос: как объективно измерять reasoning? Традиционные бенчмарки, оценивающие фактологическую точность, не подходят для оценки способности к рассуждению. В ответ на это представлен публичный лидерборд MERA Reason, который призван заполнить этот пробел и предоставить сообществу инструмент для честного сравнения reasoning-моделей.

Источник: habr.com
← Все новости AI Wave