Перейти к содержимому
13 / 22

Зачем нужна правильная инициализация весов (Xavier/Glorot, He) и почему нельзя инициализировать нулями?

Нулевая инициализация убивает сеть: все нейроны слоя считают одно и то же, градиенты идентичны, обучение не идёт. Xavier (Glorot) масштабирует веса по 1/sqrt(fan_in) — для tanh/sigmoid. He (Kaiming) использует 2/sqrt(fan_in) — для ReLU. Цель — сохранить дисперсию активаций и градиентов одинаковой по слоям, иначе vanishing/exploding с самого старта.

Зачем нужна правильная инициализация весов (Xavier/Glorot, He) и почему нельзя инициализировать нулями? | JScriptiser