Перейти к содержимому
21 / 26

Что такое масштабирование вычислений на инференсе: как рассуждающие модели тратят больше токенов ради качества и зачем им оценка каждого шага (PRM) и поиск по дереву?

Масштабирование вычислений на инференсе — модель тратит больше токенов не при обучении, а в момент ответа: она рассуждает «про себя», и качество растёт логарифмически от числа таких токенов размышления. OpenAI o1 (сентябрь 2024) первой показала такую зависимость, DeepSeek-R1 (январь 2025) — открытый аналог, обученный чистым обучением с подкреплением (R1-zero) и его связкой с дообучением на примерах (R1). С тех пор режим размышления стал штатной возможностью флагманских моделей. Как это работает: скрытый черновик — модель думает невидимо для пользователя; модель оценки процесса (PRM) ставит оценку каждому шагу рассуждения, а не только итоговому ответу; поиск по дереву в духе MCTS разворачивает несколько веток рассуждения и выбирает лучшие. Цена: токенов на размышление уходит в 10–100 раз больше обычного, и ответ приходит заметно позже. Уместно для математики, кода и планирования действий агента; не нужно для вопросов о фактах (там работает RAG) и там, где важна мгновенная реакция интерфейса.

Что такое масштабирование вычислений на инференсе: как рассуждающие модели тратят больше токенов ради качества и зачем им оценка каждого шага (PRM) и поиск по дереву? | JScriptiser