Перейти к содержимому
26 / 26

Какое сжатие весов (GPTQ, AWQ, GGUF, INT4/FP8) и какие приёмы ускорения инференса (спекулятивное декодирование, непрерывная пакетная обработка) применять в проде?

Квантизация (quantization) — сжатие модели в 2-4 раза за счёт огрубления чисел: GPTQ (INT4 на основе матрицы Гессе) — стандарт для серверного инференса, AWQ (INT4 с учётом активаций) часто лучше на маленьких моделях, GGUF (llama.cpp) — для CPU и Apple Silicon, FP8 — родной формат для NVIDIA Hopper (H100). Модель на 70 млрд параметров в FP16 весит 140 ГБ → в INT4 всего 35 ГБ. Спекулятивное декодирование (speculative decoding) (Leviathan 2023) — маленькая черновая модель предлагает K токенов, большая проверяет их за один параллельный проход: ускорение в 2-3 раза без потери качества. Непрерывная пакетная обработка (continuous batching) (vLLM/ORCA) планирует работу на каждой итерации, а не на весь запрос целиком, — пропускная способность выше в 5-23 раза по сравнению со статической пакетной обработкой.

Какое сжатие весов (GPTQ, AWQ, GGUF, INT4/FP8) и какие приёмы ускорения инференса (спекулятивное декодирование, непрерывная пакетная обработка) применять в проде? | JScriptiser