ARENA PULSE Все новости

Hugging Face представила Olmo-core 3 для масштабирования MoE-моделей

Релизы ai2huggingface

В бенчмарке на 8 GPU система показала пропускную способность 52 000 токенов в секунду, что в 2.7 раза больше, чем у предыдущей версии. Фреймворк позволяет увеличить пул экспертов с 8 до 128, сохраняя вычислительную эффективность, и поддерживает триллион параметров.

Для достижения этого используются техники параллелизма: экспертный, конвейерный и распределенный оптимизатор, а также оптимизации маршрутизации данных и поддержка низкоточного формата MXFP8, что повышает производительность на 21%.

Источник: huggingface.co

Открыть в ArenaPulse