6 / 20
Что считает vanilla RNN и почему страдает от vanishing/exploding gradients?
Vanilla RNN на каждом шаге считает h_t = tanh(W_x x_t + W_h h_{t-1} + b) и передаёт скрытое состояние дальше. Через BPTT (backprop through time) градиент умножается на одну и ту же матрицу W_h много раз. Если её спектральный радиус < 1 — градиент зануляется, если > 1 — взрывается. Длинные зависимости не выучиваются.