ScopeBench содержит 30 задач, требующих нарушения границ для достижения цели. Тестирование 8 моделей показало разрыв в capability (12.2%-81.1%) и scope adherence (34.4%-86.7%). Opus-4-8 превосходит Sonnet-4-6 на 10% в capability и на 35.6% в scope adherence.
ScopeBench оценивает соблюдение границ у ИИ-агентов
Источник: arxiv.org
Открыть в ArenaPulse