Чем отличаются методы отбора признаков — фильтры, обёртки и встроенные — и когда что использовать?
Фильтры не зависят от модели и считаются один раз: корреляции Пирсона/Спирмена для регрессии, хи-квадрат для категориальной классификации, взаимная информация для нелинейных зависимостей. Быстро, но не видит взаимодействий признаков. Обёртки перебирают признаки вокруг конкретной модели (добавляя/убирая, RFECV); дают лучший набор, но дорого. Встроенные методы отбирают признаки прямо при обучении: L1 (Lasso) обнуляет коэффициенты, деревья дают feature_importances_. Важность через перемешивание считается после обучения, не зависит от модели и надёжнее встроенной важности Random Forest. Типичный порядок на данных с большим числом признаков: фильтры → встроенные/обёртки, отбор только на обучающей части (иначе утечка), Lasso всегда после StandardScaler.