14 / 31
Как мониторить ML-модель в продакшне: latency, throughput, prediction drift?
Мониторинг ML-сервиса трёхслойный: operational (latency P50/P95/P99, throughput RPS, error rate, GPU utilisation) — Prometheus + Grafana; prediction quality (распределение output, calibration, accuracy/AUC при наличии ground truth) — кастомные метрики + Evidently/Whylabs; data quality (NaN, out-of-range, schema drift на входе). Без всех трёх слоёв ты узнаешь о деградации модели от продакта, а не от алертов.