Skip to content
5 / 20

Semantic cache для LLM: когда помогает, когда вредит и как измерять false hits?

Semantic cache отдаёт готовый ответ, когда новый вопрос близок по смыслу к ранее заданному — в отличие от exact-match кэша. Выигрыш большой (миллисекунды и бесплатно), риск особый: false hit — «похожий» вопрос оказался другим, и пользователь получает уверенный неверный ответ. Применим не везде и требует отдельной метрики precision, а не только hit rate.

Semantic cache для LLM: когда помогает, когда вредит и как измерять false hits? | JScriptiser