18 / 21
Что такое prompt compression (LLMLingua, AutoCompressor) и как сократить контекст в 5-20× без потери качества?
Prompt compression — удаление токенов из контекста (RAG chunks, documents, system prompt) с сохранением semantic content. Подходы: extractive (LLMLingua-2 через small LM scoring), abstractive (small LM перепарсивает), soft prompts (AutoCompressor — обучаемый embeddings layer), semantic dedup. Цель — снизить cost + latency в 5-20× и помочь модели «found the needle in haystack» в long context. Не путать с conversation summarization.