Перейти к содержимому
17 / 25

accelerate: как обучать модель на нескольких видеокартах без мучений с распределённым обучением?

accelerate — это тонкая обёртка от Hugging Face, которая прячет boilerplate distributed-обучения: DDP, FSDP, DeepSpeed, mixed precision. Один и тот же код тренировочного цикла запускается на CPU, одной GPU, 8 GPU или нескольких узлах — отличается только команда accelerate launch. Никаких ручных torch.distributed.init_process_group.

accelerate: как обучать модель на нескольких видеокартах без мучений с распределённым обучением? | JScriptiser