Перейти к содержимому
12 / 26

Что такое context window и почему длинный контекст работает плохо?

Context window — максимальное число токенов, которое модель может обработать за один запрос (input + output). У GPT-4o — 128K, у Claude Sonnet 4.5 — 200K, у Gemini 1.5 Pro — до 2M. Но реальное качество падает с ростом длины: модель хуже находит информацию в середине (lost in the middle) и забывает инструкции из начала. При длинном контексте растёт latency и стоимость квадратично по attention.

Что такое context window и почему длинный контекст работает плохо? | JScriptiser