Детекция аномалий для мониторинга ML-моделей: что именно отслеживать?
Модель в проде ломается тише, чем сервис: код работает, запросы отвечают, а качество падает. Детектор аномалий здесь применяют к четырём слоям. Вход: распределения признаков, доля пропусков, доля незнакомых категорий, скорость появления новых значений — обычно первым ломается именно конвейер признаков. Предсказания: распределение скоров и доля каждого класса; резкий сдвиг доли положительных при неизменном входе означает проблему модели или её версии. Отклик системы: задержка, доля ошибок, доля деградированных ответов — здесь чаще уместны SLO. Качество: доступно с задержкой, поэтому строится на созревших метках. Практическая ценность — раннее предупреждение: аномалия во входах видна сразу, а падение метрики качества станет заметно через недели. Правильная реакция на сигнал первого слоя — не переобучение, а проверка конвейера: чаще всего сломался источник данных, а не модель.