Перейти к содержимому
10 / 26

Какие этапы обучения LLM: предобучение, дообучение на инструкциях (SFT), обучение на обратной связи (RLHF) и DPO?

Современная LLM обучается в три-четыре стадии: pretraining (предсказание следующего токена на триллионах токенов из интернета), SFT — Supervised Fine-Tuning (обучение на парах «инструкция → правильный ответ»), и выравнивание через RLHF (Reinforcement Learning from Human Feedback) или его упрощённый вариант DPO (Direct Preference Optimization). Pretraining даёт знания, SFT — формат ответа, RLHF/DPO — соответствие предпочтениям.

Какие этапы обучения LLM: предобучение, дообучение на инструкциях (SFT), обучение на обратной связи (RLHF) и DPO? | JScriptiser