CriticGen генерирует специфичные для примера критерии оценки в рамках высокоуровневых категорий. Фреймворк достиг F1 критериев 0.7554/0.7900 и корреляции 0.9556. Его обратная связь позволила улучшить 73.17% ответов с сохранением качества в 93.28% случаев.
CriticGen: фреймворк для оценки LLM с улучшенными метриками
Предложен фреймворк CriticGen для детализированной оценки LLM, связанной с генерацией текста. Эксперименты показали улучшение F1-критериев и корреляции метрик.
Источник: arxiv.org
Открыть в ArenaPulse