Перейти к содержимому
17 / 39

Как устроено обучение с подкреплением (reinforcement learning) и какие у него ключевые компоненты и алгоритмы?

Reinforcement learning — обучение агента взаимодействием со средой: в каждом такте агент видит состояние s, выбирает действие a по политике π(a|s), получает награду r и новое состояние s'. Задача — найти π, максимизирующую ожидаемую сумму дисконтированных наград E[Σ γᵗ rₜ]. Формализуется как Markov Decision Process (S, A, P, R, γ). Три семейства алгоритмов: value-based (Q-learning, DQN), policy-based (REINFORCE, PPO), actor-critic (A2C, SAC). Применяется в играх, робототехнике, рекомендациях, RLHF для LLM.

Как устроено обучение с подкреплением (reinforcement learning) и какие у него ключевые компоненты и алгоритмы? | JScriptiser