В бенчмарке на 8 GPU система показала пропускную способность 52 000 токенов в секунду, что в 2.7 раза больше, чем у предыдущей версии. Фреймворк позволяет увеличить пул экспертов с 8 до 128, сохраняя вычислительную эффективность, и поддерживает триллион параметров.
Для достижения этого используются техники параллелизма: экспертный, конвейерный и распределенный оптимизатор, а также оптимизации маршрутизации данных и поддержка низкоточного формата MXFP8, что повышает производительность на 21%.