Skip to content
18 / 21

Что такое prompt compression (LLMLingua, AutoCompressor) и как сократить контекст в 5-20× без потери качества?

Prompt compression — удаление токенов из контекста (RAG chunks, documents, system prompt) с сохранением semantic content. Подходы: extractive (LLMLingua-2 через small LM scoring), abstractive (small LM перепарсивает), soft prompts (AutoCompressor — обучаемый embeddings layer), semantic dedup. Цель — снизить cost + latency в 5-20× и помочь модели «found the needle in haystack» в long context. Не путать с conversation summarization.

Что такое prompt compression (LLMLingua, AutoCompressor) и как сократить контекст в 5-20× без потери качества? | JScriptiser