Исследование использовало частный набор из 256 задач репозитарных и пост-отсеченных конкурсов с контролем загрязнения. Для Opus 4.8 родной харнесс уступал нейтральному на 1.25 процентных пункта (48.8% против 50.0%), а для GPT-5.5 превосходил на 1.25 пункта (55.6% против 54.4%). Стоимость нейтрального харнеса на решенную задачу выше: 1.3-1.6 раза для Opus 4.8 и 1.2 раза для GPT-5.5.
Результаты для Opus 4.8 противоречивы: на 61 репозитарной задаче родной харнесс отстал на 9.0 пунктов, а на 19 конкурсных задачах опередил на 23.7 пунктов. 22 из 81 прерванных из-за тайм-аута задач уже имели работающий патч.