Кэш ответов модели: точное совпадение, семантический кэш и их риски
Кэш ответов — самый дешёвый способ снизить стоимость и задержку AI-функции, но он опаснее обычного кэша, потому что «похожий вопрос» не означает «тот же ответ». Уровней три. Точное совпадение по нормализованному запросу вместе с версией модели и параметрами генерации — безопасно и покрывает удивительно много: типовые вопросы, повторные нажатия, автоматические вызовы. Семантический кэш ищет близкий по смыслу запрос через эмбеддинги и отдаёт готовый ответ при высоком сходстве — экономит больше, но легко ошибается: «как отменить подписку» и «как отменить заказ» близки в векторном пространстве и требуют разных ответов, поэтому порог ставят высоким и добавляют проверки. Кэш префикса на стороне инференса переиспользует вычисления по общему началу промпта. Ключевые правила: ключ обязан включать всё, что влияет на ответ, персональный контекст не кэшируется между пользователями, а любой кэш должен иметь срок жизни и метрику доли попаданий.