Матричный профиль и поиск дискордов: как найти самый непохожий фрагмент ряда?
Матричный профиль отвечает на вопрос: для каждого окна длины m — насколько похож на него самый похожий другой фрагмент того же ряда. Массив таких расстояний и есть профиль. Минимумы профиля — мотивы, повторяющиеся узоры; максимумы — дискорды, фрагменты, у которых нет близнеца во всей истории, то есть коллективные аномалии. Ценность подхода в том, что он не требует ни разметки, ни предположений о распределении, ни модели нормы: достаточно выбрать длину окна m, соизмеримую с длительностью искомого события. Алгоритмы вроде STOMP и SCRIMP считают профиль за время, приемлемое для рядов в сотни тысяч точек, а версии STUMPY поддерживают потоковое обновление. Ограничения тоже важны: результат чувствителен к m, метод по определению ищет уникальное, поэтому повторяющаяся аномалия (каждую ночь один и тот же сбой) станет мотивом и не будет найдена.