GAD-RL достигает 59.92% Micro Recall на бенчмарке CHAOS-Bench, превосходя GRPO на 8.45 процентных пункта. Метод также показывает результат 91.18 Overall на OmniDocBench v1.6.
GAD-RL отключает дистилляцию для ответов с высокой наградой и ослабляет её силу по мере роста средней награды группы. Метод также взвешивает KL-дивергенцию на основе вероятности студента токена учителя.