Перейти к содержимому
22 / 22

Что такое обучение в смешанной точности, чем fp16 отличается от bf16 и зачем нужен GradScaler?

Смешанная точность — часть операций (прямой проход, матричное умножение) считается в fp16/bf16, а эталонные веса хранятся в fp32: ускорение в 1.5–3 раза и −30–50% памяти. У fp16 узкий диапазон значений (5 бит на порядок) → нужен GradScaler, чтобы мелкие градиенты не обнулялись. У bf16 диапазон как у fp32 (8 бит на порядок) ценой меньшей точности мантиссы → GradScaler не нужен. На A100/H100 предпочтителен bf16, на V100 — только fp16. Предобучение LLM с 2024 года — по умолчанию bf16.

Что такое обучение в смешанной точности, чем fp16 отличается от bf16 и зачем нужен GradScaler? | JScriptiser