13 / 22
Зачем нужна правильная инициализация весов (Xavier/Glorot, He) и почему нельзя инициализировать нулями?
Нулевая инициализация убивает сеть: все нейроны слоя считают одно и то же, градиенты идентичны, обучение не идёт. Xavier (Glorot) масштабирует веса по 1/sqrt(fan_in) — для tanh/sigmoid. He (Kaiming) использует 2/sqrt(fan_in) — для ReLU. Цель — сохранить дисперсию активаций и градиентов одинаковой по слоям, иначе vanishing/exploding с самого старта.