18 / 39
Π ΡΡΠΌ ΡΠ°Π·Π½ΠΈΡΠ° ΠΌΠ΅ΠΆΠ΄Ρ supervised, unsupervised ΠΈ reinforcement learning?
Supervised β ΡΡΠΈΠΌΡΡ ΠΏΠΎ ΠΏΠ°ΡΠ°ΠΌ (Π²Ρ
ΠΎΠ΄, ΠΏΡΠ°Π²ΠΈΠ»ΡΠ½ΡΠΉ ΠΎΡΠ²Π΅Ρ): ΠΊΠ»Π°ΡΡΠΈΡΠΈΠΊΠ°ΡΠΈΡ, ΡΠ΅Π³ΡΠ΅ΡΡΠΈΡ. Unsupervised β Π΅ΡΡΡ ΡΠΎΠ»ΡΠΊΠΎ Π²Ρ
ΠΎΠ΄Ρ Π±Π΅Π· ΠΌΠ΅ΡΠΎΠΊ, ΠΈΡΠ΅ΠΌ ΡΡΡΡΠΊΡΡΡΡ: ΠΊΠ»Π°ΡΡΠ΅ΡΠΈΠ·Π°ΡΠΈΡ, PCA. Reinforcement β Π°Π³Π΅Π½Ρ Π΄Π΅ΠΉΡΡΠ²ΡΠ΅Ρ Π² ΡΡΠ΅Π΄Π΅ ΠΈ ΠΏΠΎΠ»ΡΡΠ°Π΅Ρ Π½Π°Π³ΡΠ°Π΄Ρ/ΡΡΡΠ°ΡΡ, ΠΎΠΏΡΠΈΠΌΠΈΠ·ΠΈΡΡΠ΅Ρ Π½Π°ΠΊΠΎΠΏΠ»Π΅Π½Π½ΡΠΉ reward: ΡΠΎΠ±ΠΎΡΠΎΡΠ΅Ρ
Π½ΠΈΠΊΠ°, AlphaGo. Semi-supervised β Π³ΠΈΠ±ΡΠΈΠ΄: Π½Π΅ΠΌΠ½ΠΎΠ³ΠΎ ΠΌΠ΅ΡΠΎΠΊ + ΠΌΠ½ΠΎΠ³ΠΎ Π±Π΅Π· ΠΌΠ΅ΡΠΎΠΊ.