特征选择能从源头削弱过拟合,需在训练集上严格拟合再变换测试集,避免信息泄露;Lasso、SelectKBest和树模型特征重要性是常用方法,但须结合领域知识验证。

特征选择能直接降低模型自由度,从而从源头上削弱过拟合发生的条件——不是所有变量都该进模型,尤其是当样本量远小于特征数时,不加筛选地全塞进去,LinearRegression 或 XGBoost 都会本能地“强行拟合噪声”。
特征冗余会让模型学出虚假相关性
比如在用户行为数据中,login_count_7d 和 active_days_7d 高度线性相关(相关系数 > 0.95),模型可能把其中某个当作关键信号,实则只是镜像。这种冗余特征越多,模型越容易在训练集上凑出高 R²,但换一组数据就崩。Lasso 的 L1 惩罚会强制其中一个系数归零,本质是让模型放弃“重复解释同一现象”的机会。
高维稀疏场景下,未筛选特征等于给噪声开后门
当原始特征达 200+ 维(如文本 TF-IDF、基因表达谱),而样本仅几百条时,普通线性模型的参数空间远超数据所能支撑的自由度。此时:
• sklearn.feature_selection.SelectKBest 基于卡方或互信息筛 top-k 特征,可快速砍掉低信噪比项;
• sklearn.linear_model.LassoCV 自动选 alpha 并输出非零系数特征索引,比手动调参更鲁棒;
• 用 feature_importances_ 排序后剔除 bottom 30% 的树模型特征,对 XGBoost 类模型效果明显,但要注意:单棵树的 importances 不稳定,建议用 cv=5 下的平均值。
特征选择本身不是银弹,错用反而加重过拟合
最容易踩的坑是:在整份数据上做相关性分析或用全部数据跑 SelectKBest,再切分训练/测试集——这等于把测试集信息泄露给了特征选择过程,导致后续评估虚高。正确做法必须严格遵循:
• 先 train_test_split;
• 所有特征选择逻辑只在 X_train 上拟合(如 selector.fit(X_train, y_train));
• 再用该 selector.transform() 分别处理 X_train 和 X_test。
漏掉任一环节,你在验证集上看到的“防过拟合效果”,很可能只是数据窥探的假象。
立即学习“Python免费学习笔记(深入)”;
真正难的不是选哪个函数,而是判断该在哪一层做选择:是在原始特征上硬筛,还是交给带正则的模型内部消化?前者可控性强,后者更省力但黑箱感重。实际项目里,我通常先用 VarianceThreshold 去掉方差为 0 的列,再用 LassoCV 跑一遍,最后把结果和领域知识交叉核对——机器说不重要的,人得想清楚它为什么不该重要。


















