9 / 20
Как устроен современный inference engine для LLM: continuous batching, KV-cache, PagedAttention?
Три механизма, дающие порядковую разницу в throughput. KV-cache хранит промежуточные состояния обработанных токенов, чтобы не пересчитывать на каждом шаге — без него generation была бы квадратичной по длине. Continuous batching подставляет новый запрос на место завершившегося прямо внутри выполняющегося batch, не дожидаясь всей пачки. PagedAttention хранит KV-cache страницами, как virtual memory, убирая фрагментацию и уплотняя batch.