Skip to content
23 / 26

Что такое knowledge distillation для LLM (response/feature/relation-based) и как Qwen2.5-distill превзошёл свой размер?

Knowledge distillation — обучение маленькой student-модели имитировать большую teacher. Три семейства: response-based (soft targets через softmax + temperature, Hinton 2015), feature-based (matching внутренних activations, TinyBERT/FitNets), relation-based (геометрия отношений между samples, RKD). DistilBERT — 40% меньше, 97% качества. Qwen2.5-distill-7B учится на chain-of-thought traces от DeepSeek-R1 и догоняет reasoning teacher'а — student плато упирается в teacher, но не превзойдёт его на same eval.

Что такое knowledge distillation для LLM (response/feature/relation-based) и как Qwen2.5-distill превзошёл свой размер? | JScriptiser