Skip to content
5 / 26

Как устроена архитектура Transformer для LLM на упрощённом уровне?

Transformer — стек одинаковых блоков, каждый из которых содержит multi-head self-attention и feed-forward слой. Вход — последовательность токенов, превращённых в эмбеддинги + positional encoding. Каждый блок обновляет векторное представление каждого токена с учётом всех остальных. На выходе — финальный hidden state, который через линейный слой превращается в логиты по словарю.

Как устроена архитектура Transformer для LLM на упрощённом уровне? | JScriptiser