讲师中心 微信公众号
AI工具推荐 视频效率加速

在Python中如何结合SMOTE与Scikit-learn流水线

风婷酱_1159

风婷酱_1159

发布时间:2026-09-25 06:52:29

|

218人浏览过

|

来源于php中文网

原创

SMOTE不能直接放入sklearn.pipeline.Pipeline,因其无transform方法;必须使用imblearn.pipeline.Pipeline,它专为采样器设计,确保仅在训练折内重采样、防止数据泄露,并严格遵循先标准化再SMOTE的顺序。

在python中如何结合smote与scikit-learn流水线

SMOTE不能直接放进scikit-learn的Pipeline里

因为 SMOTE 不是 scikit-learn 的原生转换器(它没有 fit_transform 方法且不遵循 transform 的接口契约),直接塞进 Pipeline 会报错:AttributeError: 'SMOTE' object has no attribute 'transform'。你得用 imblearn.pipeline.Pipeline 替代,它是专为处理采样器(如 SMOTE)和估计器协同设计的。

关键点:

  • imblearn.pipeline.Pipeline 支持在训练阶段对 训练集 进行重采样,且只在 fit 时触发重采样,predict 或 transform 时不重采样——这符合逻辑
  • 不能混用 sklearn.pipeline.Pipeline 和 imblearn.over_sampling.SMOTE,哪怕只是想“先标准化再SMOTE”,也必须全链路用 imblearn.pipeline
  • SMOTE 只作用于 fit() 的 X 和 y,不会修改原始数据;它内部自动区分训练/验证,无需手动切分后再喂给 pipeline

正确写法:用imblearn.pipeline构建完整流程

下面是一个最小可运行示例,包含标准化、SMOTE 和分类器三步:

from imblearn.pipeline import Pipeline
from imblearn.over_sampling import SMOTE
from sklearn.preprocessing import StandardScaler
from sklearn.ensemble import RandomForestClassifier
from sklearn.datasets import make_classification
<p>X, y = make_classification(n_samples=1000, n_features=20, n_informative=10,
n_redundant=10, weights=[0.9, 0.1], random_state=42)</p><p>pipe = Pipeline([
('scaler', StandardScaler()),
('smote', SMOTE(random_state=42)),
('clf', RandomForestClassifier(random_state=42))
])</p><p>pipe.fit(X, y)  # ✅ 此处自动完成:标准化 → 对标准化后数据做SMOTE → 训练分类器
y_pred = pipe.predict(X[:5])  # ✅ predict时跳过SMOTE,只走scaler → clf

注意:

立即学习“Python免费学习笔记(深入)”;

  • SMOTE 的参数(如 k_neighbors)可以像其他步骤一样用 pipe.set_params(smote__k_neighbors=3) 调整
  • 如果用 GridSearchCV,必须用 imblearn.pipeline.Pipeline,否则 CV 折内重采样会失效或泄漏验证标签
  • SMOTE 默认只对 y 中的少数类过采样;若需多类平衡,设 sampling_strategy='not majority' 或传字典

常见错误:在Pipeline里误用fit_resample或手动调用SMOTE

有人试图这样绕过限制:

Python Testing
Python Testing

Python 测试速查:运行 pytest、使用 mock/patch、参数化、fixtures、异步、覆盖率测试。

下载
# ❌ 错误:SMOTE().fit_resample() 返回新X/y,但Pipeline不接受这种函数式调用
Pipeline([('smote', SMOTE().fit_resample), ...])

或者更隐蔽的错误:

# ❌ 错误:在fit前单独调用SMOTE,再把重采样后的数据喂给普通Pipeline
X_res, y_res = SMOTE().fit_resample(X, y)
pipe = Pipeline([...]).fit(X_res, y_res)  # 导致交叉验证失效、数据泄露风险上升

问题在于:

  • fit_resample 是独立函数,不是 transformer 接口,Pipeline 无法识别其行为边界
  • 手动重采样后进 Pipeline,会让 CV 在每折中都用全部重采样数据训练,实际评估的是“见过重采样样本”的模型,结果过于乐观
  • 测试集永远不该被重采样——而 imblearn.pipeline 天然保证这点

进阶注意:SMOTE与特征工程顺序不能颠倒

SMOTE 基于欧氏距离生成新样本,因此对量纲敏感。如果你把 SMOTE 放在 StandardScaler 前面,生成的合成样本会受原始特征尺度干扰,导致噪声放大或方向偏移。

所以顺序必须是:

  • 先做无损预处理(如 OneHotEncoder、缺失值填充)→ 再标准化 → 最后 SMOTE
  • 绝对不要在 SMOTE 后做任何改变特征分布的操作(比如再归一化一次),那会破坏合成样本的语义一致性
  • 如果用了 PCA 等降维,务必确认它在 SMOTE 之前还是之后——通常应在 SMOTE 前,否则主成分方向会被少数类主导扭曲

真正容易被忽略的是:SMOTE 的 k_neighbors 参数在高维稀疏数据下极易失效,此时应考虑先降维或换用 SMOTENC(支持类别型特征)或 ADASYN。

热门AI工具

更多
WorkBuddy

一款AI办公效率工具,主要用于腾讯云推出的AI原生桌面智能体工作台,适合需要提升相关任务效率的用户。

DeepSeek

DeepSeek是一款面向对话、写作、编程和推理场景的AI大模型工具。

超级简历WonderCV

一款AI办公效率工具,主要用于免费求职简历模版下载制作,应届生职场人必备简历制作神器,适合需要提升相关任务效率的用户。

Loomy
Loomy Hot

一款AI工具,主要用于科大讯飞发布的桌面级 AI 助理,比 OpenClaw 更易用、更安全!,适合需要提升相关任务效率的用户。

Laper
Laper Hot

Laper是专为编剧、导演和制片人推出的 AI 原生剧本创作工具。

切问学术

切问学术是一款AI论文写作工具,复旦大学NLP团队推出的AI学术智能体。

豆包大模型

豆包大模型是一款由字节跳动推出的企业级大语言模型服务平台。

立刻MV
立刻MV Hot

立刻MV是一款AI文本写作工具,AI 音乐视频(MV)创作工具。

UP简历
UP简历 Hot

一款AI办公效率工具,主要用于基于AI技术的免费在线简历制作工具,适合需要提升相关任务效率的用户。

相关专题

更多
python打包成可执行文件
python打包成可执行文件

本专题为大家带来python打包成可执行文件相关的文章,大家可以免费的下载体验。

1591

2023.07.20

python能做什么
python能做什么

python能做的有:可用于开发基于控制台的应用程序、多媒体部分开发、用于开发基于Web的应用程序、使用python处理数据、系统编程等等。本专题为大家提供python相关的各种文章、以及下载和课程。

3804

2023.07.25

format在python中的用法
format在python中的用法

Python中的format是一种字符串格式化方法,用于将变量或值插入到字符串中的占位符位置。通过format方法,我们可以动态地构建字符串,使其包含不同值。php中文网给大家带来了相关的教程以及文章,欢迎大家前来阅读学习。

1589

2023.07.31

python教程
python教程

Python已成为一门网红语言,即使是在非编程开发者当中,也掀起了一股学习的热潮。本专题为大家带来python教程的相关文章,大家可以免费体验学习。

21957

2023.08.03

python环境变量的配置
python环境变量的配置

Python是一种流行的编程语言,被广泛用于软件开发、数据分析和科学计算等领域。在安装Python之后,我们需要配置环境变量,以便在任何位置都能够访问Python的可执行文件。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2707

2023.08.04

python eval
python eval

eval函数是Python中一个非常强大的函数,它可以将字符串作为Python代码进行执行,实现动态编程的效果。然而,由于其潜在的安全风险和性能问题,需要谨慎使用。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2747

2023.08.04

scratch和python区别
scratch和python区别

scratch和python的区别:1、scratch是一种专为初学者设计的图形化编程语言,python是一种文本编程语言;2、scratch使用的是基于积木的编程语法,python采用更加传统的文本编程语法等等。本专题为大家提供scratch和python相关的文章、下载、课程内容,供大家免费下载体验。

1103

2023.08.11

python合并两个列表
python合并两个列表

Python是一种强大的编程语言,具有许多方便的功能和工具。在Python中,有多种方法可以合并两个列表。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

596

2023.08.10

Buffalo框架数据库开发全教程
Buffalo框架数据库开发全教程

本专题围绕Buffalo框架数据库开发,讲解database.yml多环境配置、soda与fizz迁移生成回滚、模型结构体标签、增删改查与条件查询、一对多与多对多关联、数据校验、回调钩子、事务处理及原生SQL执行能力。

80

2026.09.23

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn