Skip to content
28 / 28

Как оценивать generation в RAG (faithfulness, groundedness, citation accuracy) и какую failure taxonomy использовать для диагностики?

Faithfulness (Ragas) / groundedness (TruLens) — каждый ли claim в ответе вытекает из контекста, проверяется NLI или LLM-judge. Citation accuracy — указаны ли correct source IDs. Failure taxonomy для RAG: (a) Missing doc — нет в corpus; (b) Wrong chunk — нашли неправильный; (c) Bad rerank — relevant в top-100 но понижен; (d) Hallucinated synthesis — relevant в контексте, но generation выдумывает. Diagnostic playbook: split eval по этапам retrieval → rerank → generation, чтобы локализовать узкое место.

Как оценивать generation в RAG (faithfulness, groundedness, citation accuracy) и какую failure taxonomy использовать для диагностики? | JScriptiser