Исследовательская группа Epoch AI обновила лидерборд бенчмарка MirrorCode, добавив результаты новых флагманов Anthropic и OpenAI. Claude Fable 5 решил 64% задач, в то время как GPT-5.6 Sol решил 20% задач в том же бенчмарке.
Разрыв втрое выглядит аномалией, так как на многих других тестах эти модели демонстрируют схожие результаты, а в некоторых случаях GPT-5.6 Sol даже превосходит Claude Fable 5. Официального объяснения разницы в результатах MirrorCode нет ни у Epoch AI, ни у Anthropic.