22 / 22
Что такое mixed precision training, в чём разница между fp16 и bf16, и зачем нужен GradScaler?
Mixed precision — часть операций (forward, matmul) в fp16/bf16, master weights в fp32: 1.5–3× speedup и −30–50% памяти. fp16 имеет узкий range (5 exponent bits) → нужен GradScaler для предотвращения underflow в grad'ах. bf16 имеет тот же range что и fp32 (8 exponent bits) ценой меньшей precision → GradScaler не нужен. На A100/H100 предпочтительнее bf16, на V100 — только fp16. Pretraining LLM 2024+ — bf16 default.