ARENA PULSE Все новости

Сравнение моделей Jev и Laya для решений агентов

Рейтинги

Исследование включает 7,283 базовых случая и 6,640 вариантов проверки устойчивости, с идентичными входными данными и кросс-аппаратной воспроизводимостью. Jev-модель показала значительно более высокую точность, чем Laya, на 9 из 11 тестируемых точек принятия решений для агентов (+10.8 до +46.0 процентных пунктов). Laya меняет 30% ответов при изменении порядка вариантов и сильно деградает при большом количестве похожих кандидатов.

Авторы также провели аудит своей собственной методологии. В ходе аудита были обнаружены три аналитические ошибки и один фактор, искажающий результаты: неучёт предварительной стоимости, точность классификатора, ошибочно принятая за качество всей системы, проблемы с порогами валидации и эффект, связанный с ложными срабатываниями инъекций.

Источник: arxiv.org

Открыть в ArenaPulse