Почему accuracy бесполезна при доле аномалий 0,1% и что мерить вместо неё?
При доле аномалий 0,1% модель, которая всегда отвечает «норма», получает accuracy 99,9% и нулевую пользу. По той же причине обманчив ROC-AUC: доля ложных срабатываний считается от гигантского числа нормальных объектов, и рост FPR с 0,1% до 1% почти не двигает метрику, хотя нагрузка на команду разбора выросла в десять раз. Работают метрики, где знаменатель — предсказанные положительные: PR-AUC (average precision), precision@k при k, равном дневному бюджету разбора, и recall при фиксированном FPR. Точка отсчёта для PR-AUC — не 0,5, а доля аномалий: при 0,1% случайный детектор даёт 0,001, поэтому PR-AUC 0,05 — это в пятьдесят раз лучше случая, хотя число выглядит провальным. Для временных рядов добавляется время: время до обнаружения и доля инцидентов, пойманных за окно реакции, часто важнее любой поточечной метрики.