Перейти к содержимому
6 / 20

Как проектировать признаки, чтобы не получить утечку целевой переменной: корректность по времени, версионирование, происхождение данных?

Утечка целевой переменной (target leakage) — попадание в признаки информации, которой в момент предсказания ещё не существует. Она даёт отличные офлайн-метрики и полный провал в проде — самый дорогой класс ошибок в ML. Защита — три механизма: корректность по времени при сборке выборки (берём значение признака на момент события), версионирование признаков (изменение формулы = новая версия, а не правка на месте) и прослеживаемость происхождения (для каждого признака известно, из каких таблиц и какого кода он получен).

Как проектировать признаки, чтобы не получить утечку целевой переменной: корректность по времени, версионирование, происхождение данных? | JScriptiser