Skip to content
20 / 20

В чём разница между pre-norm и post-norm в Transformer, и почему современные LLM почти все используют pre-norm?

Post-norm (оригинал «Attention Is All You Need»): x = LayerNorm(x + Sublayer(x)) — норма после residual add, требует careful warmup, нестабильно на большой глубине. Pre-norm (GPT-2, Llama, Mistral, Claude): x = x + Sublayer(LayerNorm(x)) — норма ДО подслоя, residual идёт мимо нормы, gradient flow стабильный → легче обучать глубокие модели. Современные LLM почти все pre-norm + RMSNorm для скорости. В pre-norm обязателен финальный LayerNorm перед output.

В чём разница между pre-norm и post-norm в Transformer, и почему современные LLM почти все используют pre-norm? | JScriptiser