19 / 26
Как современные LLM работают с длинным контекстом (100K+ токенов): RoPE, ALiBi, YaRN, скользящее окно — и чем приходится за это платить?
Длинный контекст достигается через кодирование позиций (RoPE, ALiBi) + приёмы растягивания на длину сверх обучающей (YaRN) + экономное внимание (скользящее окно в Mistral, разреженное в Longformer). Обычное внимание стоит O(N²), а абсолютные позиционные эмбеддинги не работают за пределами обучающего диапазона. RoPE + YaRN — сейчас основной подход: Llama-3.1 405B на 128K, Claude на 200K, Gemini на 1M токенов. Главный подводный камень — потеря середины: факт в середине окна модель находит хуже, чем в начале или конце.