25 / 26
Что такое FlashAttention-2/3, PagedAttention и MQA/GQA: почему vLLM в 24× быстрее наивной serving?
FlashAttention — IO-aware алгоритм, который считает attention в SRAM (on-chip), не сваливая O(N²) матрицу на HBM: FA-2 даёт ~230 TFLOPs/s на A100 (vs ~60 у vanilla), FA-3 на H100 — 740 TFLOPs/s в FP16 и 1.2 PFLOPs/s в FP8. PagedAttention (vLLM, SOSP 2023) управляет KV-cache как виртуальной памятью с страницами, устраняя фрагментацию — 24× throughput vs naive HuggingFace serving. MQA/GQA уменьшают KV-cache, шерая K/V между головами (Llama-3 8B: 8 KV heads vs 32 query heads = 4× меньше cache).