14 / 31
Как следить за ML-моделью в проде: задержка, пропускная способность, дрейф предсказаний?
Мониторинг ML-сервиса трёхслойный: эксплуатация (задержка P50/P95/P99, запросов в секунду, доля ошибок, загрузка GPU) — Prometheus + Grafana; качество предсказаний (распределение выхода, калибровка, точность/AUC при наличии эталона) — свои метрики + Evidently/Whylabs; качество входных данных (пропуски, значения вне диапазона, расползание схемы на входе). Без всех трёх слоёв о деградации модели вы узнаете от менеджера продукта, а не из оповещений.