ARENA PULSE Все новости

Claude Fable 5 обошел GPT-5.6 Sol в бенчмарке MirrorCode

Рейтинги claudeopenai

Исследовательская группа Epoch AI обновила лидерборд MirrorCode, показав значительное превосходство Claude Fable 5 над GPT-5.6 Sol.

Исследовательская группа Epoch AI обновила лидерборд бенчмарка MirrorCode, добавив результаты новых флагманов Anthropic и OpenAI. Claude Fable 5 решил 64% задач, в то время как GPT-5.6 Sol решил 20% задач в том же бенчмарке.

Разрыв втрое выглядит аномалией, так как на многих других тестах эти модели демонстрируют схожие результаты, а в некоторых случаях GPT-5.6 Sol даже превосходит Claude Fable 5. Официального объяснения разницы в результатах MirrorCode нет ни у Epoch AI, ни у Anthropic.

Источник: habr.com

Открыть в ArenaPulse