18 / 25
vLLM: PagedAttention и почему он гоняет LLM в 10 раз быстрее?
vLLM — это серверный движок для LLM, который даёт 10–24x throughput vs наивного model.generate() из Hugging Face. Главный трюк — PagedAttention: KV-cache хранится блоками как виртуальная память ОС, шарится между параллельными запросами и не теряет память на padding. Плюс continuous batching добивает в очередь новые запросы прямо во время генерации.