ARENA PULSE Все новости

Создание собственного бенчмарка для оценки LLM

Рейтинги claudeopenaideepseek

Авторы создали собственный бенчмарк из 24 вопросов для оценки LLM в специфической лабораторной задаче. На этом бенчмарке протестированы 19 комбинаций моделей (DeepSeek, ChatGPT, Claude) и уровней усилий при рассуждении.

Результаты тестов показали значительный разброс от 75% до 100% при различии в стоимости примерно в 40 раз, от 12 центов до почти 5 долларов за одни и те же 24 вопроса.

Источник: habr.com

Открыть в ArenaPulse