Перейти к содержимому
23 / 28

Как переупорядочить найденные фрагменты по релевантности: cross-encoder, готовый сервис (Cohere / Voyage Rerank) или сама LLM — что выбрать и чем платим?

Переранжирование (reranking) — это пересортировка уже найденных фрагментов по релевантности. Три уровня: (1) свой cross-encoder (BAAI bge-reranker-v2-m3, mxbai-rerank-large) — модель смотрит на запрос и документ вместе, 20-50 мс на пачку из 100, работает на своих серверах, знает много языков; (2) готовый сервис (Cohere Rerank 4.0 — варианты rerank-v4.0-pro и rerank-v4.0-fast; Voyage rerank-2.5 / rerank-2.5-lite) — задержка 100-200 мс, 100+ языков, ничего не надо администрировать; (3) сама LLM в роли ранжировщика (Claude Opus 4.8 / GPT-5.6 с чёткими критериями оценки, RankGPT) — 1-5 с, дорого, но качество лучшее и оправдано для критичных запросов. Рабочая схема: находим top-100 векторным поиском → cross-encoder оставляет top-10 → при необходимости LLM выбирает top-3. RAG-Fusion (несколько переформулировок запроса + RRF + переранжирование) — стандарт.

Как переупорядочить найденные фрагменты по релевантности: cross-encoder, готовый сервис (Cohere / Voyage Rerank) или сама LLM — что выбрать и чем платим? | JScriptiser