FARS benchmark papers значительно превосходят все конкурирующие фреймворки, достигая средних баллов 2.14--2.47 против 1.00--1.87 у других систем. Наблюдается сильное согласие между Gemini и Claude (ρ = 0.907, p < 0.001), подтверждающее надежность автоматической оценки.
FARS papers лидируют в бенчмарке AI Scientist
Исследование показало превосходство FARS benchmark papers над другими системами AI Scientist и высокую согласованность оценок Gemini и Claude.
Источник: arxiv.org
Открыть в ArenaPulse