Перейти к содержимому
26 / 28

Как поддерживать индекс RAG свежим: догрузка изменившихся документов, переиндексация, удаление и «право на забвение» по GDPR?

Догрузка изменений (incremental indexing): у каждого фрагмента есть content_hash — совпал, значит пропускаем; изменился — перезаписываем (upsert). Переиндексация: точечное обновление на месте — для частичных правок; сине-зелёная подмена индекса (алиас в Pinecone / переименование коллекции в Qdrant / подмена таблицы в pgvector) — когда меняется модель эмбеддингов или схема. Мягкое удаление через deleted_at — чтобы сохранить аналитику; жёсткое удаление — для «права на забвение» по GDPR (ст. 17), там данные должны исчезнуть физически. TTL — для контента, который протухает по времени; chunk_version в метаданных — чтобы откатиться. Запуском задач управляют Celery / RQ / Airflow, а изменения из источника лучше получать вебхуками, а не опросом по расписанию.

Как поддерживать индекс RAG свежим: догрузка изменившихся документов, переиндексация, удаление и «право на забвение» по GDPR? | JScriptiser