Skip to content
23 / 28

Как делать reranking в RAG на production уровне: cross-encoder vs Cohere/Voyage Rerank vs LLM-as-reranker?

Production reranking = three tiers: (1) local cross-encoder (BAAI bge-reranker-v2-m3, mxbai-rerank-large) — joint query+doc inference, 20-50ms на batch=100, self-hosted, multi-lingual; (2) managed API (Cohere Rerank-3, Voyage rerank-2) — 100-200ms latency, 100+ languages, zero ops; (3) LLM-as-reranker (Claude/GPT-4o с rubric, RankGPT listwise) — 1-5s, дорого, но превосходное качество для критичных запросов. Production pattern: dense retrieve top-100 → cross-encoder top-10 → опциональный LLM top-3. RAG-Fusion (multi-query + RRF + rerank) — стандарт.

Как делать reranking в RAG на production уровне: cross-encoder vs Cohere/Voyage Rerank vs LLM-as-reranker? | JScriptiser