21 / 26
Что такое test-time compute scaling: как o1/o3/R1 используют inference compute для reasoning и зачем PRM / MCTS-style search?
Test-time compute scaling — новая парадигма: модель тратит больше токенов на инференсе (скрытая chain-of-thought), а качество растёт логарифмически по числу reasoning-токенов. OpenAI o1 (Sep 2024) первой показала эти scaling laws, DeepSeek-R1 (Jan 2025) — open-source аналог, обученный pure RL (R1-zero) и RL+SFT (R1). Ключевые механики: скрытый scratch pad (модель думает невидимо), Process Reward Model (PRM) оценивает каждый шаг (а не только финальный ответ), MCTS-style search разворачивает дерево reasoning путей и выбирает лучшие ветки. Cost: reasoning токены — 10–100× обычных, плюс выше latency. Применять для math, code, agentic planning; не использовать для factual Q&A (нужен RAG) и latency-critical UX.