Перейти к содержимому
12 / 20

Как именно считается scaled dot-product self-attention и какая у него сложность?

Из входа X (B,T,d) делают три проекции: Q=XW_Q, K=XW_K, V=XW_V. Считают scores = Q K^T / √d_k, применяют опциональную маску, softmax по строкам и умножают на V. Сложность — O(T² · d) по времени и O(T²) по памяти из-за матрицы внимания. Multi-head делит d на h голов, считает параллельно и склеивает.

Как именно считается scaled dot-product self-attention и какая у него сложность? | JScriptiser