Skip to content
12 / 15

Что такое quantization (int8, fp16) и как она уменьшает размер ML-модели для веба?

Quantization — конвертация весов модели из FP32 (4 байта на число) в более компактные форматы: FP16 (2 байта, ×2 меньше), int8 (1 байт, ×4 меньше), int4 (полбайта, ×8 меньше). Точность падает на 1–3% метрики, размер модели и скорость инференса выигрывают радикально. Для веба int8 — sweet spot: модель 100MB → 25MB, инференс на CPU/wasm в 2–3× быстрее.

Что такое quantization (int8, fp16) и как она уменьшает размер ML-модели для веба? | JScriptiser