Модели используют supervised fine-tuning (SFT) и reinforcement learning (RL). Точность на spoken GSM8K выросла с 27.3% у базовой модели до 77.1% после применения RL.
Веса моделей открыты и наследуют лицензию GLM-4-Voice. Для запуска требуется репозиторий GLM-4-Voice и один H100 GPU.