За последний год в мире больших языковых моделей произошел заметный сдвиг. Основным предметом соревнования стала способность рассуждать, а не только знания модели. Производители позиционируют новые релизы как reasoning-модели, подчеркивая умение строить цепочки рассуждений, решать сложные задачи и принимать решения в условиях неопределенности. Возникает вопрос об объективной измерении этих способностей.
Для решения этой проблемы представлен публичный лидерборд MERA Reason. Его цель — предложить новые подходы к оценке reasoning-моделей.