25 / 28
Что такое Contextual Retrieval (Anthropic, Sep 2024) и как добавить контекст к chunks для снижения retrieval failure rate?
Contextual Retrieval — приём Anthropic (Sep 2024): к каждому chunk LLM (Haiku / gpt-4o-mini) генерирует 50-100 токенов контекста («этот фрагмент обсуждает X в документе про Y, раздел Z»), затем embeddings + BM25 индексируются по context + chunk, а не raw chunk. По paper: -35% retrieval failure только contextual embeddings, -49% с BM25 и rerank. Prompt caching обязателен — иначе cost генерации контекста несовместим с production.