12 / 20
Как посчитать, сколько GPU-памяти нужно под модель: веса, KV-кэш, активации — и что даёт квантизация?
Память складывается из трёх частей: веса (число параметров × байт на параметр), KV-кэш (растёт с длиной контекста и числом одновременных запросов) и активации с накладными расходами движка. Веса — величина постоянная, KV-кэш — переменная, и именно он определяет, сколько пользователей поместится. Квантизация уменьшает обе части: веса в 4 бита вместо 16 освобождают место, а кэш в 8 битах вместо 16 удваивает число параллельных запросов.