19 / 21
Как делать rolling summarization и hierarchical summarization для long conversations, чтобы не упереться в context window?
Rolling summarization = keep N последних turns + один summary всех предыдущих; hierarchical = recursive levels (raw → summary-10 → summary-of-summaries). Trigger по token threshold (~75% context), компактим дешёвой моделью (Haiku / gpt-4o-mini), сохраняем specific facts (числа, имена, решения), при необходимости hybrid с vector store.