9 / 20
Как устроен современный движок инференса LLM: непрерывный батчинг, KV-кэш, PagedAttention?
Три механизма, которые вместе дают порядковую разницу в пропускной способности. KV-кэш хранит промежуточные состояния уже обработанных токенов, чтобы не пересчитывать их на каждом шаге — без него генерация была бы квадратичной по длине. Непрерывный батчинг подставляет новый запрос на место завершившегося прямо внутри выполняющейся пачки, а не ждёт, пока досчитается вся пачка целиком. PagedAttention хранит KV-кэш страницами, как виртуальная память, устраняя фрагментацию и позволяя уплотнить пачку.