Skip to content
9 / 20

Как устроен современный inference engine для LLM: continuous batching, KV-cache, PagedAttention?

Три механизма, дающие порядковую разницу в throughput. KV-cache хранит промежуточные состояния обработанных токенов, чтобы не пересчитывать на каждом шаге — без него generation была бы квадратичной по длине. Continuous batching подставляет новый запрос на место завершившегося прямо внутри выполняющегося batch, не дожидаясь всей пачки. PagedAttention хранит KV-cache страницами, как virtual memory, убирая фрагментацию и уплотняя batch.

Как устроен современный inference engine для LLM: continuous batching, KV-cache, PagedAttention? | JScriptiser