Методология была протестирована на трех учебных примерах и пяти конфигурациях моделей, включая Gemini 3.6 Flash и Claude. Эксперименты проводились более чем на 4200 испытаниях по 10 попыток на каждую ситуацию.
Разработана методология для поиска ошибок в ИИ-агентах
Источник: habr.com
Открыть в ArenaPulse