Перейти к содержимому
20 / 25

Какие есть способы кодирования категорий, нормализации и обработки пропусков, и когда какой выбирать?

Кодирование: OneHotEncoder для номинальных категорий до ~50 значений, OrdinalEncoder для упорядоченных, кодирование средним по цели (обязательно вне текущего фолда) для категорий с множеством значений, кодирование по частоте как дешёвая альтернатива. Масштабирование: StandardScaler по умолчанию для линейных моделей, SVM и нейросетей, MinMaxScaler для ограниченных признаков ([0,1]), RobustScaler при выбросах (медиана + межквартильный размах). Деревьям масштабирование не нужно. Missing: SimpleImputer (median надёжнее mean), KNNImputer если есть локальная структура, fillna(0) + флаг is_missing для XGBoost. При >50% пропусков чаще проще дропнуть колонку. Любую подгонку (кодировщика, шкалировщика, заполнителя пропусков) делаем только на обучающей части, через ColumnTransformer + Pipeline, иначе будет утечка данных.

Какие есть способы кодирования категорий, нормализации и обработки пропусков, и когда какой выбирать? | JScriptiser