ARENA PULSE Все новости

Redis представила LangCache — семантический кэш для LLM

Продукты

Redis выпустила управляемый семантический кэш LangCache, который снижает затраты на API до 90% и ускоряет ответы в 15 раз.

LangCache работает по двухэтапному циклу: сначала приложение отправляет запрос на поиск совпадений через POST /v1/caches/{cacheId}/entries/search, после чего сервис генерирует эмбеддинг и выполняет векторный поиск. При совпадении выше порога возвращается сохранённый ответ без обращения к модели; при промахе ответ от LLM сохраняется через POST /v1/caches/{cacheId}/entries.

В демо-тесте кэшированный ответ был возвращён за 0.37 секунды против 2.232 секунд при прямом запросе, что соответствует 6-кратному ускорению. Экономия рассчитывается по формуле: (ежемесячные затраты на токены вывода) × (процент попаданий в кэш).

Источник: marktechpost.com

Открыть в ArenaPulse