5 / 26
Как устроена архитектура Transformer для LLM на упрощённом уровне?
Transformer — стек одинаковых блоков, каждый из которых содержит multi-head self-attention и feed-forward слой. Вход — последовательность токенов, превращённых в эмбеддинги + positional encoding. Каждый блок обновляет векторное представление каждого токена с учётом всех остальных. На выходе — финальный hidden state, который через линейный слой превращается в логиты по словарю.