Skip to content
19 / 26

Как современные LLM достигают long context (100K+ токенов): RoPE, ALiBi, YaRN, sliding window — какие trade-offs?

Long-context LLM достигаются через position encoding (RoPE, ALiBi) + extrapolation tricks (YaRN) + efficient attention (sliding window в Mistral, sparse в Longformer). Vanilla attention O(N²) и absolute embeddings не работают за обучаемым диапазоном. RoPE+YaRN — current SOTA: Llama-3.1 405B на 128K, Claude 200K, Gemini 1M. Главный подводный камень — lost in the middle: модель плохо находит факт в середине окна.

Как современные LLM достигают long context (100K+ токенов): RoPE, ALiBi, YaRN, sliding window — какие trade-offs? | JScriptiser