Интеграция llama.cpp quants добавлена в Hugging Face Transformers. Это решение направлено на оптимизацию процесса инференса моделей через квантизацию.
Hugging Face поддерживает llama.cpp quants в Transformers
Библиотека Hugging Face Transformers теперь позволяет использовать квантизированные модели формата llama.cpp для оптимизации инференса.
Источник: huggingface.co
Открыть в ArenaPulse