讲师中心 微信公众号
AI工具推荐 视频效率加速

如何在Python中处理具有不平衡类别分布的分类数据集?

轻静君_2215

轻静君_2215

发布时间:2026-06-21 11:54:03

|

397人浏览过

|

来源于php中文网

原创

直接用 train_test_split 会放大类别不平衡问题,因其默认随机切分不保证各类别比例一致,导致训练集和测试集中正负样本分布失真;解决方法是传入 stratify=y 参数实现分层抽样。

如何在python中处理具有不平衡类别分布的分类数据集?

为什么直接用 train_test_split 会放大类别不平衡问题?

默认的 train_test_split 按样本随机切分,不保证各类别在训练集/测试集中比例一致。比如原始数据中正样本只占 2%,切分后可能训练集正样本掉到 0.8%,测试集却跳到 3.5%——模型根本学不到稳定模式,评估结果也失真。

解决方法是强制按类别分层抽样:

  • 必须传入 stratify=y 参数(y 是标签数组),否则分层失效
  • stratify 仅支持一维标签;多标签或多输出场景需先转换为唯一组合编码
  • 若某类别样本数 train_test_split 会直接报错 ValueError: The least populated class in y has only 1 member

过采样时为什么不能对整个数据集用 SMOTE?

SMOTE 通过合成少数类邻近样本点来扩充数据,但若在划分前就对全量数据运行,会导致训练集和测试集“信息泄露”:测试样本的合成邻居可能来自训练集,模型实际在作弊。

正确做法是只在训练集上 fit + sample:

立即学习“Python免费学习笔记(深入)”;

Python Use Agent
Python Use Agent

智能执行Python任务,自动生成、执行代码并反馈结果,无需额外配置,兼容旧命令。

下载
  • 先用 train_test_split(..., stratify=y) 切分
  • 再对 X_train 和 y_train 调用 SMOTE().fit_resample(X_train, y_train)
  • 注意:fit_resample 返回新数组,原 X_train 和 y_train 不变
  • 如果使用 imblearn.pipeline.Pipeline,务必把 SMOTE 放在第一步,避免后续标准化等步骤污染合成逻辑

用 class_weight='balanced' 时权重怎么算?

不是简单按反比(如 98% vs 2% → 权重 1/0.98 vs 1/0.02),而是按 n_samples / (n_classes * n_samples_of_class) 计算。例如二分类中负样本占 90%,则负类权重为 1 / (2 * 0.9) ≈ 0.56,正类为 1 / (2 * 0.1) = 5.0。

这个策略只适用于支持该参数的模型(如 SVC、RandomForestClassifier、LogisticRegression):

  • 树模型(如 RandomForestClassifier)内部用权重影响分割标准计算,而非简单加权损失
  • class_weight='balanced_subsample' 仅对 bagging 类模型有效,每次 bootstrap 采样时动态重平衡
  • 若手动传字典(如 {0: 1, 1: 5}),注意键必须严格匹配标签值类型(int/str),否则静默失效

验证阶段为什么不能只看准确率?

当负样本占 95%,模型全预测负类也能拿到 95% 准确率,但毫无价值。必须监控 classification_report 中的 recall(查全率)和 f1-score,尤其关注少数类指标。

实操建议:

  • 用 sklearn.metrics.classification_report(y_true, y_pred, output_dict=True) 提取各列数值,方便自动化判断
  • 混淆矩阵中重点关注 tn(真负)、tp(真正)是否被严重低估,而不是总和
  • 若使用交叉验证,必须用 StratifiedKFold,否则某折可能完全缺失少数类,导致 f1-score 计算失败或为 nan

最常被忽略的是:重采样或加权后,测试集仍必须保持原始分布——它代表真实场景,任何在测试集上做平衡的操作都会让评估失去意义。

热门AI工具

更多
切问学术

切问学术是一款AI论文写作工具,复旦大学NLP团队推出的AI学术智能体。

豆包大模型

豆包大模型是一款由字节跳动推出的企业级大语言模型服务平台。

UP简历
UP简历 Hot

一款AI办公效率工具,主要用于基于AI技术的免费在线简历制作工具,适合需要提升相关任务效率的用户。

Laper
Laper Hot

Laper是专为编剧、导演和制片人推出的 AI 原生剧本创作工具。

DeepSeek

DeepSeek是一款面向对话、写作、编程和推理场景的AI大模型工具。

Seko
Seko Hot

一款AI视频创作工具,主要用于商汤科技推出的创编一体的AI短视频创作Agent,适合需要提升相关任务效率的用户。

Lovart
Lovart Hot

一款面向视觉设计创作的AI设计平台,可通过智能体和画布工作流辅助制作海报、Logo、网页、PPT及其他视觉内容。

WorkBuddy

一款AI办公效率工具,主要用于腾讯云推出的AI原生桌面智能体工作台,适合需要提升相关任务效率的用户。

VibeKnow
VibeKnow Hot

一款AI视频创作工具,主要用于全球首个AI知识视频创作平台,文档、文章、网页,一键生成视频,适合需要提升相关任务效率的用户。

相关专题

更多
python打包成可执行文件
python打包成可执行文件

本专题为大家带来python打包成可执行文件相关的文章,大家可以免费的下载体验。

1631

2023.07.20

python能做什么
python能做什么

python能做的有:可用于开发基于控制台的应用程序、多媒体部分开发、用于开发基于Web的应用程序、使用python处理数据、系统编程等等。本专题为大家提供python相关的各种文章、以及下载和课程。

4004

2023.07.25

format在python中的用法
format在python中的用法

Python中的format是一种字符串格式化方法,用于将变量或值插入到字符串中的占位符位置。通过format方法,我们可以动态地构建字符串,使其包含不同值。php中文网给大家带来了相关的教程以及文章,欢迎大家前来阅读学习。

1629

2023.07.31

python教程
python教程

Python已成为一门网红语言,即使是在非编程开发者当中,也掀起了一股学习的热潮。本专题为大家带来python教程的相关文章,大家可以免费体验学习。

23097

2023.08.03

python环境变量的配置
python环境变量的配置

Python是一种流行的编程语言,被广泛用于软件开发、数据分析和科学计算等领域。在安装Python之后,我们需要配置环境变量,以便在任何位置都能够访问Python的可执行文件。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2827

2023.08.04

python eval
python eval

eval函数是Python中一个非常强大的函数,它可以将字符串作为Python代码进行执行,实现动态编程的效果。然而,由于其潜在的安全风险和性能问题,需要谨慎使用。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2867

2023.08.04

scratch和python区别
scratch和python区别

scratch和python的区别:1、scratch是一种专为初学者设计的图形化编程语言,python是一种文本编程语言;2、scratch使用的是基于积木的编程语法,python采用更加传统的文本编程语法等等。本专题为大家提供scratch和python相关的文章、下载、课程内容,供大家免费下载体验。

1123

2023.08.11

python合并两个列表
python合并两个列表

Python是一种强大的编程语言,具有许多方便的功能和工具。在Python中,有多种方法可以合并两个列表。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

596

2023.08.10

LLVM自定义Pass怎么写
LLVM自定义Pass怎么写

本专题聚焦LLVM自定义Pass开发,整理Pass类结构、run()方法、PreservedAnalyses、CMake构建、插件注册、-load-pass-plugin加载和测试用例编写流程。

20

2026.09.30

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn