Skip to content
7 / 20

Как выглядит production RAG на уровне архитектуры и где он обычно ломается?

Production RAG — два независимых pipeline, не один: ingestion (документы → парсинг → chunking → embeddings → index) по расписанию или событию, и query pipeline (вопрос → retrieval → rerank → сборка промпта → генерация) синхронно. Ломается почти всегда на retrieval, не на генерации: нет нужного фрагмента в найденном — никакая модель не спасёт. Отсюда правило: сначала мерить recall поиска, потом качество ответа.

Как выглядит production RAG на уровне архитектуры и где он обычно ломается? | JScriptiser