Perplexity открыла исходный код движка Lily, используемого в Hybrid Compute Perplexity Computer. Движок написан на Rust и использует Metal для выполнения модели без PyTorch или MLX в пути выполнения. Lily оптимизирован под одну модель Qwen3.6-35B-A3B на одном семействе железа.
На 40-ядерном M5 Max с 128 ГБ памяти Lily показал среднюю производительность 4156 токенов/с на этапе prefill и 170 токенов/с на decode, что на 1.23x и 1.35x соответственно быстрее MLX-LM. Для работы требуется Mac с macOS 15+ и 32 ГБ оперативной памяти.