11 / 20
Множественные сравнения и подглядывание: почему «мы проверили двадцать метрик и одна выстрелила» ничего не значит?
При уровне значимости 5% каждая двадцатая проверка даёт ложное срабатывание. Двадцать метрик — и одна «значимая» находка появится сама собой, даже если изменений нет вовсе: вероятность хотя бы одного ложного срабатывания достигает 64%. То же с подглядыванием: остановка эксперимента в момент, когда p-value впервые опустился ниже порога, поднимает долю ложных выводов в разы. Лечится заранее объявленной главной метрикой и поправками.