Тестирование было направлено на поиск границ практического применения модели, а не на проверку заявленных скорости и цены. Автор исследовал точность модели по сравнению с небольшими GPT-моделями, возможность доверять её confidence и поведение при расширении списка классов, появлении длинного контекста или грязного входа.
Стоимость тестов, запущенных через API раннего доступа, составила примерно $18. Целью было выявить особенности модели Jev, такие как lost in the middle и склонность уверенно ошибаться.