Перейти к содержимому
27 / 28

Как измерить качество поиска в RAG: метрики recall@k, MRR, nDCG — и как собрать эталонный набор запросов из реальных логов?

recall@k = | нужные ∩ top_k | / | нужные | — «нашли ли мы нужный документ вообще». MRR = 1/позиция первого нужного документа, усреднённая по всем запросам, — «насколько высоко он оказался». nDCG@k учитывает, что релевантность бывает разной степени (шкала 0..3), и штрафует за низкую позицию: DCG / IDCG. Эталонный набор (golden dataset) собирают из реальной работы: косвенные сигналы (клики, принятые ответы) + разметка силами LLM + ручная проверка сотни самых частых запросов. Перемерять нужно после любого изменения индекса, модели эмбеддингов или нарезки. Публичные бенчмарки (MTEB, BEIR) — только отправная точка: на своих данных корреляция с ними разваливается.

Как измерить качество поиска в RAG: метрики recall@k, MRR, nDCG — и как собрать эталонный набор запросов из реальных логов? | JScriptiser