Перейти к содержимому
11 / 20

Как устроен Transformer (encoder-decoder) и что такое self-attention?

Transformer состоит из стека encoder-блоков (self-attention + FFN) и decoder-блоков (masked self-attention + cross-attention + FFN). Self-attention для каждого токена считает взвешенную сумму всех токенов: запросы Q, ключи K, значения V проекциями входа; веса = softmax(Q K^T / √d_k). Это даёт глобальные зависимости за один слой, без рекуррентности.

Как устроен Transformer (encoder-decoder) и что такое self-attention? | JScriptiser