16 / 20
Как спроектировать наблюдаемость ML-системы: какие слои метрик заводить и на что вешать алерты?
Наблюдаемость ML-сервиса строится в четыре слоя: инфраструктура (задержка, ошибки, доступность), входные данные (доля пропусков, диапазоны признаков, свежесть), предсказания (распределение скоров, доля решений выше порога) и бизнес (конверсия, выручка, жалобы). Первый слой ломается громко, остальные три — тихо: сервис отвечает 200, а качество падает. Алерты вешают на то, что требует действия сегодня; на дрейф — не алерт, а еженедельный отчёт, иначе дежурный привыкает игнорировать.