7 / 20
Как выглядит RAG в проде на уровне архитектуры и где он обычно ломается?
Продовый RAG — это два независимых конвейера, а не один: конвейер загрузки (документы → разбор → нарезка → эмбеддинги → индекс) работает по расписанию или по событию, конвейер запроса (вопрос → поиск → переупорядочивание → сборка промпта → генерация) работает синхронно. Ломается почти всегда на этапе поиска, а не генерации: если нужного фрагмента нет в найденном, никакая модель ответа не спасёт. Отсюда правило — сначала мерить полноту поиска, потом качество ответа.