Авторы создали собственный бенчмарк из 24 вопросов для оценки LLM в специфической лабораторной задаче. На этом бенчмарке протестированы 19 комбинаций моделей (DeepSeek, ChatGPT, Claude) и уровней усилий при рассуждении.
Результаты тестов показали значительный разброс от 75% до 100% при различии в стоимости примерно в 40 раз, от 12 центов до почти 5 долларов за одни и те же 24 вопроса.