Skip to content
21 / 25

PEFT и LoRA: как fine-tune большой модели на одной RTX 4090?

LoRA замораживает базовую модель и обучает только маленькие low-rank матрицы, которые добавляются к её слоям — параметров в 100–1000 раз меньше, чем full fine-tune. Через библиотеку peft от Hugging Face это пара строк кода. Плюс QLoRA грузит базовую модель в 4-bit квантизации, и Llama-7B (или даже 13B) влезает на одну RTX 4090 (24 GB).

PEFT и LoRA: как fine-tune большой модели на одной RTX 4090? | JScriptiser