Перейти к содержимому
22 / 26

Как поднять качество многократной генерацией: согласованность нескольких попыток (self-consistency), выбор лучшего из N и проверяющая модель?

Self-consistency (Wang et al. 2022) и best-of-N — production-паттерны для quality boost без обучения: сэмплируем N ответов с temperature>0, потом либо берём majority vote (self-consistency для math/reasoning, обычно N=5..40), либо отдельный verifier / reranker выбирает лучший (best-of-N). Verifier бывает трёх типов: scalar reward model (Cobbe 2021), generative reward model (LLM-as-judge, выдаёт critique), PRM (оценивает каждый шаг). Это inference-time техника, отличная от RAG-reranker'а (тот ранжирует документы, а не ответы). Cost: N× inference, выигрыш 10–25% на сложных reasoning / code задачах. Применять для math, code agents (sample 5 patches → run tests → pick winner), high-stakes ответов; не использовать для simple lookup и streaming UX.

Как поднять качество многократной генерацией: согласованность нескольких попыток (self-consistency), выбор лучшего из N и проверяющая модель? | JScriptiser