Что такое self-consistency + best-of-N + verifier/reranker loops для generation: как улучшить quality через многократный sampling?
Self-consistency (Wang et al. 2022) и best-of-N — production-паттерны для quality boost без обучения: сэмплируем N ответов с temperature>0, потом либо берём majority vote (self-consistency для math/reasoning, обычно N=5..40), либо отдельный verifier / reranker выбирает лучший (best-of-N). Verifier бывает трёх типов: scalar reward model (Cobbe 2021), generative reward model (LLM-as-judge, выдаёт critique), PRM (оценивает каждый шаг). Это inference-time техника, отличная от RAG-reranker'а (тот ранжирует документы, а не ответы). Cost: N× inference, выигрыш 10–25% на сложных reasoning / code задачах. Применять для math, code agents (sample 5 patches → run tests → pick winner), high-stakes ответов; не использовать для simple lookup и streaming UX.