21 / 25
PEFT и LoRA: как дообучить большую модель на одной RTX 4090?
LoRA замораживает базовую модель и обучает только маленькие low-rank матрицы, которые добавляются к её слоям — параметров в 100–1000 раз меньше, чем full fine-tune. Через библиотеку peft от Hugging Face это пара строк кода. Плюс QLoRA грузит базовую модель в 4-bit квантизации, и Llama-7B (или даже 13B) влезает на одну RTX 4090 (24 GB).