3 / 28
Как нарезать документы на фрагменты для RAG: размер фрагмента, нахлёст, по символам или по токенам, по предложениям или по структуре markdown?
Чанкинг — это разбиение длинных документов на куски, которые влезают в context window LLM и при этом дают точный retrieval. Типичный размер — 256–1024 токенов с overlap 10–20%: слишком маленькие чанки теряют контекст, слишком большие — размывают relevance. Базовые стратегии: fixed-size по символам (быстро, грубо), fixed-size по токенам через tiktoken (точнее под лимит модели), by-sentence (NLTK / spaCy), by-paragraph и by-markdown headers (структурный). Выбор зависит от типа документа: для техдоки лучше markdown-сплит, для юр-текстов — by-sentence, для чат-логов — by-turn.