Модель Qwen2.5-14B (4-bit) показала 67% точности на всем датасете Jeopardy! (529,939 вопросов за 41 сезон). На вопросах, заданных после даты обучения модели, точность составила 65%, в то время как Watson не смог ответить ни на один такой вопрос.
Тестирование проводилось по строгому протоколу с обязательным ответом, используя точное и нечеткое сопоставление. Модель превзошла Watson в способности отвечать на вопросы, выходящие за рамки ее обучающих данных.