Исследование сравнивает производительность моделей, обученных с подкреплением (RL), и моделей, обученных с контролем (SFT), в решении математических задач. RL-модели демонстрируют превосходство, связанное с более линейно разделяемыми и структурированными внутренними представлениями, что подтверждается точностью линейных зондов и исследованиями среднего обнуления.
Анализ вариативности счётчика токенов при повторной выборке показал, что RL-модели могут демонстрировать более высокую вариативность, но также и сильную согласованность, что указывает на возможную зависимость распределения вычислений от общего конвейера обучения, а не только от метода (RL или SFT).