Датасет OpenDiscoveryTrace содержит 558 полных трасс работы ИИ-агентов, записанных при решении 124 научных задач. Каждая трасса включает 9 структурированных полей на шаг: мысли, вызовы инструментов, наблюдения, ошибки, триггеры пересмотра и самооценку уверенности. Pilot-анализ на 363 трассах, оценённых LLM, выявил, что Claude Opus 4.6 допускает 2.5 ошибки на траекторию, а GPT-5.4 — 0.08 ошибки.
OpenDiscoveryTrace: трассы процессов для оценки ИИ-учёных
Представлен датасет OpenDiscoveryTrace с 558 трассами работы 7 ИИ-моделей на 124 научных задачах. Pilot-анализ показал, что Claude Opus 4.6 совершает в 30 раз больше ошибок, чем GPT-5.4.
Источник: arxiv.org
Открыть в ArenaPulse