Перейти к содержимому
20 / 20

Чем нормализация перед блоком отличается от нормализации после него (pre-norm и post-norm) в трансформере и почему современные LLM почти все выбирают pre-norm?

Нормализация после блока (post-norm) (оригинал «Attention Is All You Need»): x = LayerNorm(x + Sublayer(x)) — норма после сложения с обходным путём, требует аккуратного прогрева и нестабильна на большой глубине. Нормализация перед блоком (pre-norm) (GPT-2, Llama, Mistral, Claude): x = x + Sublayer(LayerNorm(x)) — норма ДО подслоя, а обходной путь идёт мимо неё, поэтому градиент течёт стабильно → глубокие модели учить легче. Современные LLM почти все на pre-norm + RMSNorm (ради скорости). При pre-norm обязательна финальная нормализация перед выходом.