5 / 20
Semantic cache для LLM: когда помогает, когда вредит и как измерять false hits?
Semantic cache отдаёт готовый ответ, когда новый вопрос близок по смыслу к ранее заданному — в отличие от exact-match кэша. Выигрыш большой (миллисекунды и бесплатно), риск особый: false hit — «похожий» вопрос оказался другим, и пользователь получает уверенный неверный ответ. Применим не везде и требует отдельной метрики precision, а не только hit rate.