ARENA PULSE Все новости

RL-модели превосходят SFT в математическом решении задач

Индустрия

Исследование показало, что модели, обученные с подкреплением (RL), превосходят модели, обученные с контролем (SFT), в решении математических задач благодаря лучшей структуре представлений.

Исследование сравнивает производительность моделей, обученных с подкреплением (RL), и моделей, обученных с контролем (SFT), в решении математических задач. RL-модели демонстрируют превосходство, связанное с более линейно разделяемыми и структурированными внутренними представлениями, что подтверждается точностью линейных зондов и исследованиями среднего обнуления.

Анализ вариативности счётчика токенов при повторной выборке показал, что RL-модели могут демонстрировать более высокую вариативность, но также и сильную согласованность, что указывает на возможную зависимость распределения вычислений от общего конвейера обучения, а не только от метода (RL или SFT).

Источник: arxiv.org

Открыть в ArenaPulse