讲师中心 微信公众号
AI工具推荐 视频效率加速

如何在Python中利用FeatureUnion并行合并多个特征提取器?

阿墨小哥_4102

阿墨小哥_4102

发布时间:2026-06-10 09:07:35

|

872人浏览过

|

来源于php中文网

原创

FeatureUnion 自 scikit-learn 1.2 版起被弃用,1.4+ 版本中彻底移除;替代方案为 ColumnTransformer(推荐用于按列处理)或 make_union(仅支持全量输入并行变换,需配合 FunctionTransformer 适配列提取)。

如何在python中利用featureunion并行合并多个特征提取器?

FeatureUnion 在 scikit-learn 中早已被弃用

直接告诉你结论:FeatureUnion 从 scikit-learn 1.2 版本起正式标记为 Deprecated,1.4+ 版本中彻底移除。你现在 pip install 的新版 sklearn 已经没有这个类了——硬写会报 ImportError: cannot import name 'FeatureUnion' from 'sklearn.pipeline'。

替代方案是 ColumnTransformer(适合按列分发处理)或更通用的 make_column_transformer / make_union,但注意:make_union 并不等价于旧 FeatureUnion,它只支持「对同一组输入数据并行调用多个 transformer」,且要求所有 transformer 都能处理完整 X(即不能像 ColumnTransformer 那样选列)。

用 make_union 替代 FeatureUnion 的正确姿势

make_union 是当前唯一保留的“并行合并”工具,但它对 transformer 的输入兼容性要求严格:每个组件都必须接受二维数组 X(shape=(n_samples, n_features)),且返回二维输出。如果你原来用 FeatureUnion 拼接 TfidfVectorizer 和 StandardScaler,现在依然可以,但要注意:

  • TfidfVectorizer 默认只接受一维文本序列(fit(X) 中 X 是 list of str),不能直接塞进 make_union —— 必须先用 FunctionTransformer 包一层,把列抽出来
  • StandardScaler 要求输入是数值型二维数组,如果原始数据混有文本列,得先分离
  • 所有 transformer 的 fit_transform 输出必须是稀疏或密集二维数组,且行数一致,否则 numpy.hstack 拼接失败

示例(假设 X 是 DataFrame,含文本列 'text' 和数值列 'age', 'income'):

立即学习“Python免费学习笔记(深入)”;

from sklearn.compose import make_union
from sklearn.feature_extraction.text import TfidfVectorizer
from sklearn.preprocessing import StandardScaler
from sklearn.preprocessing import FunctionTransformer
import numpy as np
<h1>提取文本列的函数</h1><p>def get_text(X):
return X[:, 0]  # 假设 text 是第 0 列</p><h1>提取数值列的函数</h1><p>def get_numeric(X):
return X[:, 1:].astype(float)</p><p>text_pipe = make_pipeline(
FunctionTransformer(get_text, validate=False),
TfidfVectorizer(max_features=1000)
)</p><p>num_pipe = make_pipeline(
FunctionTransformer(get_numeric, validate=False),
StandardScaler()
)</p><h1>注意:这里传入的是原始 X(需保证列顺序稳定)</h1><p>preprocessor = make_union(text_pipe, num_pipe)
X_combined = preprocessor.fit_transform(X)  # X 是 numpy.ndarray 或 DataFrame

ColumnTransformer 才是多数场景的真正替代品

90% 原来用 FeatureUnion 的人,其实真正需要的是按列路由(column-wise routing)——比如对字符串列做 TfidfVectorizer,对数值列做归一化,对类别列做 OneHotEncoder。这时候 ColumnTransformer 更安全、更清晰、也更不易出错。

python-script-generator
python-script-generator

快速生成专业的 Python 脚本和应用代码。一键创建完整项目结构,支持CLI、API、爬虫、Bot、Django等多种项目类型,包含完整的项目结构、配置文件、依赖管理、测试、README和文档。

下载

关键点:

  • 必须显式指定每组列名或列索引,例如 ["text"]、["age", "income"] 或 slice(0, 1)
  • 默认 remainder="drop",漏写的列会被丢弃;设为 "passthrough" 可保留,但要注意类型是否下游模型能接收
  • 各分支输出自动拼接,无需关心稀疏/密集混合问题(内部已处理)
  • 支持命名(transformers=[("tfidf", vec, ["text"]), ...]),便于后续用 get_feature_names_out() 查看特征名

性能上,ColumnTransformer 是真正并行的(可通过 n_jobs 控制),而 make_union 默认串行,除非你手动给每个 transformer 设 n_jobs 且它们本身支持。

容易踩的三个坑

第一,别在 make_union 里直接放 TfidfVectorizer——它不认 DataFrame,也不接受二维数值数组,会报 AttributeError: 'numpy.ndarray' object has no attribute 'lower'。

第二,ColumnTransformer 的列选择器在 fit 和 transform 时行为一致,但如果传入的是不同结构的测试集(比如少了一列),会直接崩,错误信息是 ValueError: Found array with dim 3. Expected ,本质是列索引越界。

第三,混合使用稀疏(如 TF-IDF)和密集(如 scaler 输出)特征后,LogisticRegression 等模型能处理,但 RandomForestClassifier 会静默转成密集数组,内存暴涨——这时候得用 scipy.sparse.hstack 手动控制格式,或统一转稠密再降维。

真正麻烦的从来不是怎么拼,而是拼完的特征矩阵形状、数据类型、缺失值状态是否稳定可预期。多打几次 X_combined.shape 和 type(X_combined),比背 API 文档有用得多。

热门AI工具

更多
讯飞智作

讯飞智作是一款AI视频创作工具,AI文本配音工具,数字人课程、营销视频制作。

VibeKnow
VibeKnow Hot

一款AI视频创作工具,主要用于全球首个AI知识视频创作平台,文档、文章、网页,一键生成视频,适合需要提升相关任务效率的用户。

豆包大模型

豆包大模型是一款由字节跳动推出的企业级大语言模型服务平台。

LibLibAI
LibLibAI Hot

一款AI视频创作工具,主要用于国内领先的AI创意平台,以海量模型、低门槛操作与“创作-分享-商业化”生态,让小白与专业创作者都能高效实现图文乃至视频创意表达,适合需要提升相关任务效率的用户。

DeepSeek

DeepSeek是一款面向对话、写作、编程和推理场景的AI大模型工具。

WorkBuddy

一款AI办公效率工具,主要用于腾讯云推出的AI原生桌面智能体工作台,适合需要提升相关任务效率的用户。

Laper
Laper Hot

Laper是专为编剧、导演和制片人推出的 AI 原生剧本创作工具。

切问学术

切问学术是一款AI论文写作工具,复旦大学NLP团队推出的AI学术智能体。

UP简历
UP简历 Hot

一款AI办公效率工具,主要用于基于AI技术的免费在线简历制作工具,适合需要提升相关任务效率的用户。

相关专题

更多
python打包成可执行文件
python打包成可执行文件

本专题为大家带来python打包成可执行文件相关的文章,大家可以免费的下载体验。

1671

2023.07.20

python能做什么
python能做什么

python能做的有:可用于开发基于控制台的应用程序、多媒体部分开发、用于开发基于Web的应用程序、使用python处理数据、系统编程等等。本专题为大家提供python相关的各种文章、以及下载和课程。

4204

2023.07.25

format在python中的用法
format在python中的用法

Python中的format是一种字符串格式化方法,用于将变量或值插入到字符串中的占位符位置。通过format方法,我们可以动态地构建字符串,使其包含不同值。php中文网给大家带来了相关的教程以及文章,欢迎大家前来阅读学习。

1669

2023.07.31

python教程
python教程

Python已成为一门网红语言,即使是在非编程开发者当中,也掀起了一股学习的热潮。本专题为大家带来python教程的相关文章,大家可以免费体验学习。

24337

2023.08.03

python环境变量的配置
python环境变量的配置

Python是一种流行的编程语言,被广泛用于软件开发、数据分析和科学计算等领域。在安装Python之后,我们需要配置环境变量,以便在任何位置都能够访问Python的可执行文件。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2987

2023.08.04

python eval
python eval

eval函数是Python中一个非常强大的函数,它可以将字符串作为Python代码进行执行,实现动态编程的效果。然而,由于其潜在的安全风险和性能问题,需要谨慎使用。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

3007

2023.08.04

scratch和python区别
scratch和python区别

scratch和python的区别:1、scratch是一种专为初学者设计的图形化编程语言,python是一种文本编程语言;2、scratch使用的是基于积木的编程语法,python采用更加传统的文本编程语法等等。本专题为大家提供scratch和python相关的文章、下载、课程内容,供大家免费下载体验。

1163

2023.08.11

python合并两个列表
python合并两个列表

Python是一种强大的编程语言,具有许多方便的功能和工具。在Python中,有多种方法可以合并两个列表。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

596

2023.08.10

FrankenPHP集成Laravel详细教程
FrankenPHP集成Laravel详细教程

本专题提供FrankenPHP集成Laravel的详细配置指南,全面解析运行原理、开发环境搭建、Caddyfile配置、Octane工作模式、数据库连接、队列任务、定时任务和生产环境优化,解决部署过程中常见的报错与兼容性问题。

0

2026.10.08

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn