Исследование включает 7,283 базовых случая и 6,640 вариантов проверки устойчивости, с идентичными входными данными и кросс-аппаратной воспроизводимостью. Jev-модель показала значительно более высокую точность, чем Laya, на 9 из 11 тестируемых точек принятия решений для агентов (+10.8 до +46.0 процентных пунктов). Laya меняет 30% ответов при изменении порядка вариантов и сильно деградает при большом количестве похожих кандидатов.
Авторы также провели аудит своей собственной методологии. В ходе аудита были обнаружены три аналитические ошибки и один фактор, искажающий результаты: неучёт предварительной стоимости, точность классификатора, ошибочно принятая за качество всей системы, проблемы с порогами валидации и эффект, связанный с ложными срабатываниями инъекций.