Перейти к содержимому
3 / 10

Supervised, semi-supervised и unsupervised детекция: что выбрать, когда меток почти нет?

Выбор диктуют метки, а не мода. Есть достаточный объём подтверждённых аномалий (антифрод с чарджбэками, брак с актами контроля) — задача превращается в классификацию редкого класса, и градиентный бустинг обычно бьёт любые «настоящие» anomaly-методы. Меток нет вовсе, но есть данные преимущественно нормального периода — это semi-supervised, или one-class: модель учится на норме и меряет отклонение от неё (One-Class SVM, автоэнкодер, оценка плотности). Данные грязные, доля аномалий неизвестна, разметки нет — unsupervised: Isolation Forest, LOF, robust-статистика, где аномалиями объявляют хвост скоров. Практика почти всегда гибридная: unsupervised-детектор запускают первым, чтобы наполнить очередь на разбор, разметку копят из вердиктов дежурных и через несколько месяцев переходят к supervised на самых частых классах, оставляя unsupervised как страховку от неизвестного.

Supervised, semi-supervised и unsupervised детекция: что выбрать, когда меток почти нет? | JScriptiser