Перейти к содержимому
10 / 10

Как измерять пользу детектора в проде, если A/B-тест невозможен?

Классический A/B здесь редко применим: инциденты редки, случайное разделение по пользователям не работает — детектор смотрит на общие метрики, а «выключить мониторинг половине системы» никто не согласится. Поэтому пользу измеряют иначе. Сравнение с прошлым по инцидентам: доля инцидентов, найденных детектором раньше, чем людьми, и разница во времени обнаружения относительно периода до внедрения. Переключаемые сравнения: параллельная работа старой и новой версий (одна алертит, обе считают) — корректный способ сравнивать версии между собой. Экономическая оценка: время до обнаружения × стоимость минуты инцидента минус стоимость разбора ложных тревог. Разделение по группам метрик: включить детектор для одной группы сервисов и не включать для другой, если группы сопоставимы — приближение к эксперименту. Дополнительно всегда полезны шкала «поймал/не поймал» на постмортемах и учёт времени, потраченного командой на разбор.

Как измерять пользу детектора в проде, если A/B-тест невозможен? | JScriptiser