讲师中心 微信公众号
AI工具推荐 视频效率加速

使用回归模型跨量纲列进行缺失值插补(Score1→Score2)

轻宇大大_5945

轻宇大大_5945

发布时间:2026-07-22 18:57:03

|

646人浏览过

|

来源于php中文网

原创

使用回归模型跨量纲列进行缺失值插补(Score1→Score2)

本文介绍如何利用线性回归模型,基于已知的跨量纲数值列(如score1)预测并插补另一列(score2)中的缺失值,关键步骤包括均值填充、标准化、建模与逆变换,确保插补结果符合原始量纲。

本文介绍如何利用线性回归模型,基于已知的跨量纲数值列(如score1)预测并插补另一列(score2)中的缺失值,关键步骤包括均值填充、标准化、建模与逆变换,确保插补结果符合原始量纲。

在实际数据分析中,常遇到多源评分指标(如不同考试、量表或系统产出的分数)具有强相关性但量纲迥异的情况。此时直接使用Min-Max缩放易放大噪声,而简单均值/中位数填充则忽略变量间结构关系。更稳健的做法是构建回归模型,将一列作为特征、另一列作为目标,在统一尺度下学习映射关系,再将预测结果还原至原始量纲。

以下为完整实现流程(以 Score1 → Score2 插补为例):

✅ 正确步骤解析

  1. 预处理缺失值:对训练前的 NaN 使用列均值临时填充(仅用于标准化),避免 StandardScaler 报错;
  2. 标准化对齐量纲:对填充后的两列联合标准化(非分别拟合),保证回归在无偏尺度下学习线性关系;
  3. 构建训练集:仅保留 Score1 和 Score2 均非空的样本作为训练数据;
  4. 拟合与预测:用 Score1_scaled 预测 Score2_scaled,对 Score2 缺失行执行预测;
  5. 逆变换还原:将预测得到的标准化 Score2_scaled 值,通过同一 scaler 逆变换回原始量纲。

? 完整可运行代码

import pandas as pd
import numpy as np
from sklearn.preprocessing import StandardScaler
from sklearn.linear_model import LinearRegression

# 构造示例数据
data = {
    'Person': ['Alice', 'Bob', 'Charlie', 'Dave', 'John', 'Henry', 'Jane'],
    'Score1': [5.6, 9.3, 7.2, -4.0, np.nan, 11.0, 3.0],
    'Score2': [3.2, 8.7, np.nan, np.nan, 10.0, 13.0, 8.0]
}
df = pd.DataFrame(data)

# Step 1: 均值填充(仅用于标准化,不参与建模)
df['Score1_filled'] = df['Score1'].fillna(df['Score1'].mean())
df['Score2_filled'] = df['Score2'].fillna(df['Score2'].mean())

# Step 2: 联合标准化(关键!使用同一 scaler 拟合两列)
scaler = StandardScaler()
df[['Score1_scaled', 'Score2_scaled']] = scaler.fit_transform(
    df[['Score1_filled', 'Score2_filled']]
)

# Step 3: 提取完整观测样本用于训练
train_mask = df['Score1'].notna() & df['Score2'].notna()
train_data = df[train_mask].copy()

# Step 4: 训练线性回归模型
model = LinearRegression()
model.fit(train_data[['Score1_scaled']], train_data['Score2_scaled'])

# Step 5: 对 Score2 缺失行预测
missing_mask = df['Score2'].isna()
score1_scaled_missing = df.loc[missing_mask, 'Score1_scaled'].values.reshape(-1, 1)
predicted_score2_scaled = model.predict(score1_scaled_missing)

# Step 6: 写入预测值并逆变换还原
df.loc[missing_mask, 'Score2_scaled'] = predicted_score2_scaled
# 注意:仅对 Score2 列逆变换需构造临时数组(因 scaler.inverse_transform 要求二维输入)
temp_scaled = np.column_stack([
    df['Score1_scaled'], 
    df['Score2_scaled']
])
df[['Score1', 'Score2']] = scaler.inverse_transform(temp_scaled)[:, [0, 1]]

print(df[['Person', 'Score1', 'Score2']].round(6))

⚠️ 关键注意事项

  • 禁止分别标准化:若对 Score1 和 Score2 单独调用 fit_transform,会破坏两列间的相对关系,导致回归失效;
  • 训练集必须完整:模型只能在 Score1 和 Score2 同时非空的样本上训练,否则引入偏差;
  • 逆变换需谨慎:scaler.inverse_transform() 输入必须与 fit_transform() 形状一致;此处通过拼接两列再选取对应列还原,确保一致性;
  • 模型可扩展:如关系非线性,可替换为 RandomForestRegressor 或添加多项式特征;
  • 评估建议:在完整样本上交叉验证 R² 或 RMSE,验证插补可靠性。

该方法兼顾统计合理性与工程实用性,既尊重原始量纲差异,又充分利用变量间潜在关联,是跨尺度缺失值插补的推荐实践。

热门AI工具

更多
豆包大模型

豆包大模型是一款由字节跳动推出的企业级大语言模型服务平台。

PixTV
PixTV Hot

PixTV是一款面向AIGC内容创作的AI视频生成工具。

AionClaw
AionClaw Hot

AionClaw是一款面向办公、创作和编程任务的AI桌面智能体。

DeepSeek

DeepSeek是一款面向对话、写作、编程和推理场景的AI大模型工具。

UP简历
UP简历 Hot

一款AI办公效率工具,主要用于基于AI技术的免费在线简历制作工具,适合需要提升相关任务效率的用户。

WorkBuddy

一款AI办公效率工具,主要用于腾讯云推出的AI原生桌面智能体工作台,适合需要提升相关任务效率的用户。

蛙蛙写作

一款AI论文写作工具,主要用于超级AI智能写作助手,适合需要提升相关任务效率的用户。

Seko
Seko Hot

一款AI视频创作工具,主要用于商汤科技推出的创编一体的AI短视频创作Agent,适合需要提升相关任务效率的用户。

音述AI
音述AI Hot

一款AI音频处理工具,主要用于音述AI是一个以“用声音述说故事”为核心的 AI 音乐创作与声音分享社区,适合需要提升相关任务效率的用户。

相关专题

更多
Python 机器学习入门与 Scikit-Learn 实战
Python 机器学习入门与 Scikit-Learn 实战

面向机器学习初学者,以 Scikit-Learn 为核心工具,讲解机器学习基本概念(监督学习/无监督学习/模型评估)、数据预处理(标准化/归一化/缺失值填充/特征编码)、常用分类算法(逻辑回归/决策树/随机森林/SVM/KNN)、回归算法(线性回归/岭回归/Lasso)、无监督聚类(K-Means/DBSCAN)、交叉验证与超参数调优(GridSearch/RandomSearch)、混淆矩阵与 ROC/AUC 模型评估指标,帮助开发者

335

2026.04.24

Buffalo框架数据库开发全教程
Buffalo框架数据库开发全教程

本专题围绕Buffalo框架数据库开发,讲解database.yml多环境配置、soda与fizz迁移生成回滚、模型结构体标签、增删改查与条件查询、一对多与多对多关联、数据校验、回调钩子、事务处理及原生SQL执行能力。

200

2026.09.23

Buffalo框架路由与请求处理实操指南
Buffalo框架路由与请求处理实操指南

本专题讲解Buffalo框架路由与请求处理机制,涵盖路由注册与分组、资源路由、Handler编写规范、Context上下文方法、参数绑定、中间件编写挂载、Session与Cookie读写、Flash消息及错误页面定制方法。

100

2026.09.23

Buffalo框架零基础入门教程
Buffalo框架零基础入门教程

本专题整理Buffalo框架入门内容,涵盖Go环境准备、buffalo CLI安装、新项目生成、目录结构说明、dev热加载启动、数据库连接配置与常见报错排查,帮助新手按约定优于配置的思路跑通第一个Buffalo框架应用。

80

2026.09.23

Conan创建软件包配方指南
Conan创建软件包配方指南

本专题介绍通过conanfile.py创建软件包的方法,讲解包名、版本、依赖和构建设置等基础信息,以及source、build、package、package_info等常用方法的作用及编写思路。

60

2026.09.22

Conan二进制包配置指南
Conan二进制包配置指南

本专题介绍Conan根据操作系统、编译器、架构和构建类型生成二进制包的方法,讲解Profile、Settings、Options及Package ID的作用,帮助管理不同平台和编译环境下的包版本。

60

2026.09.22

Conan私有仓库搭建教程
Conan私有仓库搭建教程

本专题系统的讲解Conan私有仓库的搭建流程,涵盖仓库服务部署、存储目录配置、用户认证、权限划分和远程地址添加,并介绍内部C++依赖包的上传、下载及版本维护方法。

60

2026.09.22

loomy官网入口地址合集
loomy官网入口地址合集

本专题汇总了 Loomy 桌面 AI 助理的官方入口地址合集及使用指南。提供 macOS 与 Windows 客户端下载 。Loomy 是讯飞推出的桌面级 AI 工作搭子,支持文件整理、数据分析、网页操作及通过飞书/钉钉远程操控电脑,助你高效完成本地办公任务 。

60

2026.09.22

NumPy常见函数使用方法
NumPy常见函数使用方法

本专题整理 NumPy 常见函数使用方法相关教程,覆盖函数大全、参数用法、数组运算、统计聚合、排序处理、where 条件筛选、linspace 创建数列等常用场景,帮助读者快速掌握 NumPy 函数调用思路和实际数据处理技巧。

80

2026.09.22

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
PHP开发基础之数据库篇(PDO)
PHP开发基础之数据库篇(PDO)

共10课时 | 2.3万人学习

第三期培训_PHP开发
第三期培训_PHP开发

共116课时 | 32.3万人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn