LangCache работает по двухэтапному циклу: сначала приложение отправляет запрос на поиск совпадений через POST /v1/caches/{cacheId}/entries/search, после чего сервис генерирует эмбеддинг и выполняет векторный поиск. При совпадении выше порога возвращается сохранённый ответ без обращения к модели; при промахе ответ от LLM сохраняется через POST /v1/caches/{cacheId}/entries.
В демо-тесте кэшированный ответ был возвращён за 0.37 секунды против 2.232 секунд при прямом запросе, что соответствует 6-кратному ускорению. Экономия рассчитывается по формуле: (ежемесячные затраты на токены вывода) × (процент попаданий в кэш).