Skip to content
17 / 39

Как устроСно ΠΎΠ±ΡƒΡ‡Π΅Π½ΠΈΠ΅ с ΠΏΠΎΠ΄ΠΊΡ€Π΅ΠΏΠ»Π΅Π½ΠΈΠ΅ΠΌ (reinforcement learning) ΠΈ ΠΊΠ°ΠΊΠΈΠ΅ Ρƒ Π½Π΅Π³ΠΎ ΠΊΠ»ΡŽΡ‡Π΅Π²Ρ‹Π΅ ΠΊΠΎΠΌΠΏΠΎΠ½Π΅Π½Ρ‚Ρ‹ ΠΈ Π°Π»Π³ΠΎΡ€ΠΈΡ‚ΠΌΡ‹?

Reinforcement learning β€” ΠΎΠ±ΡƒΡ‡Π΅Π½ΠΈΠ΅ Π°Π³Π΅Π½Ρ‚Π° взаимодСйствиСм со срСдой: Π² ΠΊΠ°ΠΆΠ΄ΠΎΠΌ Ρ‚Π°ΠΊΡ‚Π΅ Π°Π³Π΅Π½Ρ‚ Π²ΠΈΠ΄ΠΈΡ‚ состояниС s, Π²Ρ‹Π±ΠΈΡ€Π°Π΅Ρ‚ дСйствиС a ΠΏΠΎ ΠΏΠΎΠ»ΠΈΡ‚ΠΈΠΊΠ΅ Ο€(a|s), ΠΏΠΎΠ»ΡƒΡ‡Π°Π΅Ρ‚ Π½Π°Π³Ρ€Π°Π΄Ρƒ r ΠΈ Π½ΠΎΠ²ΠΎΠ΅ состояниС s'. Π—Π°Π΄Π°Ρ‡Π° β€” Π½Π°ΠΉΡ‚ΠΈ Ο€, ΠΌΠ°ΠΊΡΠΈΠΌΠΈΠ·ΠΈΡ€ΡƒΡŽΡ‰ΡƒΡŽ ΠΎΠΆΠΈΠ΄Π°Π΅ΠΌΡƒΡŽ сумму дисконтированных Π½Π°Π³Ρ€Π°Π΄ E[Ξ£ Ξ³α΅— rβ‚œ]. ЀормализуСтся ΠΊΠ°ΠΊ Markov Decision Process (S, A, P, R, Ξ³). Π’Ρ€ΠΈ сСмСйства Π°Π»Π³ΠΎΡ€ΠΈΡ‚ΠΌΠΎΠ²: value-based (Q-learning, DQN), policy-based (REINFORCE, PPO), actor-critic (A2C, SAC). ΠŸΡ€ΠΈΠΌΠ΅Π½ΡΠ΅Ρ‚ΡΡ Π² ΠΈΠ³Ρ€Π°Ρ…, Ρ€ΠΎΠ±ΠΎΡ‚ΠΎΡ‚Π΅Ρ…Π½ΠΈΠΊΠ΅, рСкомСндациях, RLHF для LLM.

Как устроСно ΠΎΠ±ΡƒΡ‡Π΅Π½ΠΈΠ΅ с ΠΏΠΎΠ΄ΠΊΡ€Π΅ΠΏΠ»Π΅Π½ΠΈΠ΅ΠΌ (reinforcement learning) ΠΈ ΠΊΠ°ΠΊΠΈΠ΅ Ρƒ Π½Π΅Π³ΠΎ ΠΊΠ»ΡŽΡ‡Π΅Π²Ρ‹Π΅ ΠΊΠΎΠΌΠΏΠΎΠ½Π΅Π½Ρ‚Ρ‹ ΠΈ Π°Π»Π³ΠΎΡ€ΠΈΡ‚ΠΌΡ‹? | JScriptiser