Skip to content
27 / 28

Как оценивать retrieval в RAG через recall@k, MRR, nDCG и строить golden datasets из production traces?

recall@k = | relevant ∩ top_k | / | relevant | — нашли ли документ. MRR = 1/rank первого relevant, усреднено по queries — насколько высоко он стоит. nDCG@k учитывает graded relevance (0..3) и discount по позиции: DCG / IDCG. Golden dataset из production: implicit signals (clicks, accepts) + LLM-as-judge labels + manual review top-100 queries. Re-eval после любого изменения index / embedding / chunking. Public benchmarks (MTEB, BEIR) — лишь baseline, domain shift убивает correlation.

Как оценивать retrieval в RAG через recall@k, MRR, nDCG и строить golden datasets из production traces? | JScriptiser