Microsoft представила бенчмарк ThinkingBox, который оценивает ИИ-агенты по записям, которые они оставляют в базе данных, а не по генерируемым предложениям. В ходе тестирования 507 бизнес-процессов, запущенных 20 раз подряд, лучшая модель Claude Opus 5.5 показала pass@20 на уровне 67.16%. Бенчмарк доступен через Hugging Face.
Тестирование показало значительный разрыв между способностью модели выполнить задачу один раз и её стабильностью при многократном повторении. Например, модель Kimi-K3 смогла решить 93.89% задач хотя бы один раз, но только в 13.41% случаев она успешно справлялась со всеми 20 попытками. В то же время модель Claude Opus 5 решала меньше задач (79.09%), но стабильно выполняла 47.53% из них при каждой попытке.