Перейти к содержимому
18 / 25

vLLM: PagedAttention и почему он гоняет LLM в 10 раз быстрее?

vLLM — это серверный движок для LLM, который даёт 10–24x throughput vs наивного model.generate() из Hugging Face. Главный трюк — PagedAttention: KV-cache хранится блоками как виртуальная память ОС, шарится между параллельными запросами и не теряет память на padding. Плюс continuous batching добивает в очередь новые запросы прямо во время генерации.

vLLM: PagedAttention и почему он гоняет LLM в 10 раз быстрее? | JScriptiser