7 / 20
Как выглядит production RAG на уровне архитектуры и где он обычно ломается?
Production RAG — два независимых pipeline, не один: ingestion (документы → парсинг → chunking → embeddings → index) по расписанию или событию, и query pipeline (вопрос → retrieval → rerank → сборка промпта → генерация) синхронно. Ломается почти всегда на retrieval, не на генерации: нет нужного фрагмента в найденном — никакая модель не спасёт. Отсюда правило: сначала мерить recall поиска, потом качество ответа.