Skip to content
10 / 26

Какие этапы обучения LLM: pretraining, SFT, RLHF и DPO?

Современная LLM обучается в три-четыре стадии: pretraining (предсказание следующего токена на триллионах токенов из интернета), SFT — Supervised Fine-Tuning (обучение на парах «инструкция → правильный ответ»), и выравнивание через RLHF (Reinforcement Learning from Human Feedback) или его упрощённый вариант DPO (Direct Preference Optimization). Pretraining даёт знания, SFT — формат ответа, RLHF/DPO — соответствие предпочтениям.

Какие этапы обучения LLM: pretraining, SFT, RLHF и DPO? | JScriptiser