12 / 20
Как посчитать GPU memory под модель: веса, KV-cache, активации — и что даёт quantization?
Память — три части: weights (params × bytes per param), KV-cache (растёт с длиной контекста и concurrency) и activations + overhead движка. Weights — константа, KV-cache — переменная, и именно он определяет concurrency. Quantization уменьшает обе: weights в 4 бита вместо 16 освобождают место, KV в 8 бит вместо 16 удваивает число параллельных запросов.