Перейти к содержимому
23 / 26

Что такое дистилляция знаний для LLM — по ответам, по признакам и по связям — и как маленькая модель обходит свой весовой класс?

Дистилляция знаний (knowledge distillation) — обучение маленькой модели-ученика повторять большую модель-учителя. Три семейства: по ответам (ученик учится на «мягких» вероятностях учителя, Hinton 2015), по признакам (совпадение внутренних активаций, TinyBERT/FitNets), по связям (геометрия отношений между примерами, RKD). DistilBERT — на 40% меньше при 97% качества. Например, дистиллированная модель на 7 млрд параметров учится на цепочках рассуждений от большой рассуждающей модели и догоняет учителя — но потолок ученика упирается в учителя: на той же проверке он его не превзойдёт.

Что такое дистилляция знаний для LLM — по ответам, по признакам и по связям — и как маленькая модель обходит свой весовой класс? | JScriptiser