Вариационный автоэнкодер и правдоподобие как скор: почему «низкая вероятность» не равна «аномалия»?
Вероятностный подход выглядит идеально: обучим генеративную модель на норме и объявим аномалией всё, у чего низкое правдоподобие. На практике здесь два подвоха. Первый — правдоподобие зависит от сложности объекта, а не от его типичности: глубокие генеративные модели, обученные на сложных данных, регулярно присваивают более высокое правдоподобие простым «чужим» объектам — эффект, известный по работам о том, что модель, обученная на CIFAR-10, даёт большее правдоподобие изображениям SVHN. Для табличных данных аналог — константные строки и вырожденные записи. Второй — у VAE считается не само правдоподобие, а нижняя оценка ELBO, и её вклад делится между ошибкой восстановления и KL-членом, которые ведут себя по-разному. Рабочие приёмы: скор по вероятностному отношению (likelihood ratio к фоновой модели), учёт сложности объекта, скор по расстоянию в латентном пространстве вместо самого правдоподобия и, как обычно, проверка на известных инцидентах.