26 / 26
Какие техники quantization (GPTQ, AWQ, GGUF, INT4/FP8) и inference optimization (speculative decoding, continuous batching) использовать в production?
Quantization уменьшает модель в 2-4×: GPTQ (Hessian-based INT4) — стандарт для server inference, AWQ (activation-aware INT4) часто лучше на small models, GGUF (K-quants, llama.cpp) — для CPU/Apple Silicon, FP8 — native на NVIDIA Hopper (H100). 70B в FP16 = 140GB → INT4 = 35GB. Speculative decoding (Leviathan 2023) — маленькая draft-модель предлагает K токенов, большая verifier проверяет их параллельно: 2-3× speedup без потери качества. Continuous batching (vLLM/ORCA) даёт iteration-level scheduling — 5-23× higher throughput vs static batching.