11 / 20
Как устроен Transformer (encoder-decoder) и что такое self-attention?
Transformer состоит из стека encoder-блоков (self-attention + FFN) и decoder-блоков (masked self-attention + cross-attention + FFN). Self-attention для каждого токена считает взвешенную сумму всех токенов: запросы Q, ключи K, значения V проекциями входа; веса = softmax(Q K^T / √d_k). Это даёт глобальные зависимости за один слой, без рекуррентности.