Перейти к содержимому
9 / 20

Как устроен современный движок инференса LLM: непрерывный батчинг, KV-кэш, PagedAttention?

Три механизма, которые вместе дают порядковую разницу в пропускной способности. KV-кэш хранит промежуточные состояния уже обработанных токенов, чтобы не пересчитывать их на каждом шаге — без него генерация была бы квадратичной по длине. Непрерывный батчинг подставляет новый запрос на место завершившегося прямо внутри выполняющейся пачки, а не ждёт, пока досчитается вся пачка целиком. PagedAttention хранит KV-кэш страницами, как виртуальная память, устраняя фрагментацию и позволяя уплотнить пачку.

Как устроен современный движок инференса LLM: непрерывный батчинг, KV-кэш, PagedAttention? | JScriptiser