15 / 20
Длинный контекст в проде: почему KV-кэш становится узким местом и какие приёмы его укрощают?
Кэш ключей и значений растёт линейно с длиной контекста и держится всё время генерации: при контексте в 100 тысяч токенов он может занимать десятки гигабайт на одну последовательность, и карта обслуживает не сто запросов, а два. Приёмы: квантизация кэша, внимание с окном и удержанием первых токенов, разделяемые ключи между головами (GQA/MQA), выгрузка редко используемых блоков и, главное, сокращение контекста через поиск нужных фрагментов вместо подачи всего.