Анализ 157 предприятий выявил разрыв в оценке ИИ-агентов: компании предоставляют им большую автономию, но меньше доверяют тестам, призванным контролировать эту автономию. Половина организаций уже сталкивались с тем, что агенты, прошедшие внутреннюю оценку, терпели неудачи при взаимодействии с клиентами в продакшене. Только 5% полностью доверяют автоматизированной оценке сегодня, а главная слабость — несоответствие оценок реальным результатам.
При этом две трети компаний уже разрешают или активно внедряют полностью автоматизированное развертывание агентов в продакшен без участия человека для агентов с низким риском. Исследование VentureBeat Pulse Research изучает, как технические лидеры измеряют производительность агентов, какие платформы используют, что ломается в продакшене и насколько далеко они готовы позволять агентам работать без человека.