10 / 26
Какие этапы обучения LLM: pretraining, SFT, RLHF и DPO?
Современная LLM обучается в три-четыре стадии: pretraining (предсказание следующего токена на триллионах токенов из интернета), SFT — Supervised Fine-Tuning (обучение на парах «инструкция → правильный ответ»), и выравнивание через RLHF (Reinforcement Learning from Human Feedback) или его упрощённый вариант DPO (Direct Preference Optimization). Pretraining даёт знания, SFT — формат ответа, RLHF/DPO — соответствие предпочтениям.