10 / 20
Квантизация моделей в проде: чем отличаются форматы и как понять, что качество не просело?
Квантизация уменьшает разрядность весов: fp16 → int8 или 4 бита, память падает вдвое-вчетверо, модель влезает в меньшую карту и работает быстрее. Ключевое различие форматов — что именно квантуется: только веса (дёшево, помогает памяти) или веса и активации (быстрее, но чувствительнее к качеству). Проверять надо не общими бенчмарками, а своим оценочным набором: потери неравномерны и сильнее всего бьют по редким сценариям и длинным ответам.