Skip to content
20 / 22

Какие бывают learning rate schedulers (warmup, CosineAnnealing, OneCycle, ReduceLROnPlateau) и когда какой выбирать?

Constant LR — почти всегда subobtimal. Schedule меняет LR во времени: Warmup (linear ramp от 0 до target за 1–5% шагов) обязателен для больших Transformer'ов. CosineAnnealing — плавное снижение по косинусу до 0, стандарт для LLM/ViT. OneCycleLR (Smith 2018) даёт «super-convergence» и любим для CV. ReduceLROnPlateau делит LR при stall validation loss — полезен для long-running training без чёткого endpoint. StepLR/MultiStepLR — жёсткие decay milestones, старая школа.

Какие бывают learning rate schedulers (warmup, CosineAnnealing, OneCycle, ReduceLROnPlateau) и когда какой выбирать? | JScriptiser