Почему опубликованные результаты детекции аномалий во временных рядах систематически завышены?
Основная причина — протокол оценки point-adjustment: если модель пометила хотя бы одну точку внутри размеченного интервала, весь интервал считается пойманным. Kim et al. (AAAI 2022) показали, что при таком протоколе случайный скор обходит опубликованные state-of-the-art результаты: чем длиннее интервалы разметки, тем легче случайно попасть хотя бы в одну точку. Вторая причина — сами бенчмарки: в популярных наборах (Yahoo S5, NAB, SMD и родственные) значительная часть аномалий тривиальна и ловится порогом по одной переменной, а разметка местами противоречива. Третья — утечки при разбиении и подбор порога на тесте. Практический вывод: при чтении статьи смотрите, каким протоколом посчитан F1, и требуйте либо непреобразованный F1, либо PR-ориентированные метрики (AUC-PR, Range-AUC-PR, VUS-PR), либо смягчённый PA%K. Для своей системы это означает: не верьте лидербордам, стройте оценку на собственных инцидентах.