Skip to content
1 / 10

Из чего состоит прод-сервис детекции аномалий: слои, хранение скоров, переобучение

Работающий сервис — это пять слоёв, и модель среди них наименее проблемный. Приём и подготовка: события приводятся к регулярной сетке, UTC, с явным разделением пропуска и нуля, проверками схемы и качества. Хранилище рядов: колоночная или специализированная time-series база, где живут и сырые ряды, и посчитанные скоры — скоры хранить обязательно, иначе нечем будет объяснять прошлые решения. Слой детекции: набор детекторов по типам метрик, обучение по расписанию на чистых окнах, версионирование моделей и порогов. Слой алертинга: дедупликация, группировка по инциденту, подавление на время работ, маршрутизация по важности. Обратная связь: вердикт и причина при закрытии, которые возвращаются в обучение. Ключевые решения проектирования — где считать (батч по расписанию против потока), как переживать переобучение без разрыва истории скоров и как хранить конфигурацию порогов, чтобы её меняли без деплоя.

Из чего состоит прод-сервис детекции аномалий: слои, хранение скоров, переобучение | JScriptiser