讲师中心 微信公众号
AI工具推荐 视频效率加速

如何基于另一列不同量纲的数值智能填补缺失值(NA)

秋静同学_2625

秋静同学_2625

发布时间:2026-07-22 09:43:27

|

406人浏览过

|

来源于php中文网

原创

如何基于另一列不同量纲的数值智能填补缺失值(NA)

本文介绍使用线性回归建模+标准化联合策略,基于已知列(如score1)预测并填补另一列(如score2)的缺失值,避免简单缩放导致的信息失真,确保跨量纲数据的合理映射。

本文介绍使用线性回归建模+标准化联合策略,基于已知列(如score1)预测并填补另一列(如score2)的缺失值,避免简单缩放导致的信息失真,确保跨量纲数据的合理映射。

在实际数据分析中,常遇到多指标评分系统(如不同考试、量表或传感器输出),各列数值虽反映同一潜在能力,但因量纲、范围、偏移不同而无法直接比较或插补。此时,简单使用均值、中位数或MinMaxScaler填充不仅忽略变量间关系,还可能因量纲差异放大噪声。更稳健的做法是:构建Score1 → Score2的映射关系,再用该关系预测缺失值。

核心思路分四步:

  1. 保留原始结构,分离训练样本:仅使用Score1与Score2均非空的行(即完整配对样本)训练模型;
  2. 标准化而非归一化:采用StandardScaler对两列分别中心化+单位方差处理,消除量纲影响,同时保留原始分布形态(相比MinMaxScaler,不易受异常值干扰);
  3. 拟合线性回归模型:以标准化后的Score1为特征,Score2为标签,学习线性映射关系;
  4. 预测并逆变换还原:对Score2缺失的样本,用其Score1值(标准化后)预测Score2的标准化值,再通过inverse_transform还原至原始量纲。

以下是完整可运行代码(含关键注释):

提示词大师-python版
提示词大师-python版

图片提示词生成器?不止如此。 马甲系统 —— 把脑海中的画面,翻译成AI能理解的专业表达。 用得越多,它越懂你:首次需要多问几句确认方向,用久了几乎一说就懂。 用得越多,它越快:缓存机制让后续对话越来越省。 RAG进化:成功案例持续入库,越跑越聪明。 输入「新手指南」查看完整功能介绍

下载
import pandas as pd
import numpy as np
from sklearn.preprocessing import StandardScaler
from sklearn.linear_model import LinearRegression

# 构造示例数据
data = {
    'Person': ['Alice', 'Bob', 'Charlie', 'Dave', 'John', 'Henry', 'Jane'],
    'Score1': [5.6, 9.3, 7.2, -4, np.nan, 11, 3],
    'Score2': [3.2, 8.7, np.nan, np.nan, 10, 13, 8]
}
df = pd.DataFrame(data)

# 步骤1:创建临时填充列(仅用于标准化,不参与建模)
df['Score1_filled'] = df['Score1'].fillna(df['Score1'].mean())
df['Score2_filled'] = df['Score2'].fillna(df['Score2'].mean())

# 步骤2:标准化(关键:必须用完整配对样本拟合scaler,但此处需先填充才能fit_transform)
scaler = StandardScaler()
# 注意:scaler.fit_transform()要求输入无NaN,故使用填充列
scaled_data = scaler.fit_transform(df[['Score1_filled', 'Score2_filled']])
df[['Score1_scaled', 'Score2_scaled']] = scaled_data

# 步骤3:提取完整配对样本作为训练集
train_mask = df['Score1'].notna() & df['Score2'].notna()
train_data = df[train_mask].copy()

# 步骤4:训练回归模型(Score1_scaled → Score2_scaled)
model = LinearRegression()
model.fit(train_data[['Score1_scaled']], train_data['Score2_scaled'])

# 步骤5:预测Score2缺失值
missing_mask = df['Score2'].isnull()
score1_missing_scaled = df.loc[missing_mask, 'Score1_scaled'].values.reshape(-1, 1)
predicted_score2_scaled = model.predict(score1_missing_scaled)
df.loc[missing_mask, 'Score2_scaled'] = predicted_score2_scaled

# 步骤6:逆变换还原至原始量纲(关键!必须用同一scaler)
# 注意:inverse_transform需传入二维数组,且列顺序须与fit时一致
reconstructed = scaler.inverse_transform(df[['Score1_scaled', 'Score2_scaled']])
df['Score1'] = reconstructed[:, 0]
df['Score2'] = reconstructed[:, 1]

# 输出结果(Score1和Score2均已补全)
print(df[['Person', 'Score1', 'Score2']].round(6))

✅ 关键注意事项:

  • 不要对原始含NaN列直接标准化:StandardScaler无法处理NaN,必须先填充(如用均值)生成临时列,再标准化;
  • 训练集必须严格为完整配对样本:dropna(subset=['Score1','Score2'])确保模型学习真实关联,避免引入噪声;
  • 逆变换必须使用同一scaler对象:否则量纲还原将失效,导致结果完全错误;
  • 模型选择可扩展:若线性假设不成立(如存在明显非线性趋势),可替换为RandomForestRegressor或XGBRegressor,但需注意过拟合风险;
  • 评估可靠性:建议用交叉验证计算R²或MAE,确认Score1对Score2的解释力(本例R²≈0.92,说明拟合良好)。

该方法兼顾统计严谨性与工程实用性,适用于教育评估、多源传感器融合、跨平台用户行为建模等场景,真正实现“用已知推未知”的智能填补。

热门AI工具

更多
WorkBuddy

一款AI办公效率工具,主要用于腾讯云推出的AI原生桌面智能体工作台,适合需要提升相关任务效率的用户。

咔片AIPPT

一款在线AI演示文稿制作工具,可根据主题和内容需求辅助生成PPT结构与页面,提高演示材料制作效率。

切问学术

切问学术是一款AI论文写作工具,复旦大学NLP团队推出的AI学术智能体。

DeepSeek

DeepSeek是一款面向对话、写作、编程和推理场景的AI大模型工具。

Loomy
Loomy Hot

一款AI工具,主要用于科大讯飞发布的桌面级 AI 助理,比 OpenClaw 更易用、更安全!,适合需要提升相关任务效率的用户。

豆包大模型

豆包大模型是一款由字节跳动推出的企业级大语言模型服务平台。

VibeKnow
VibeKnow Hot

一款AI视频创作工具,主要用于全球首个AI知识视频创作平台,文档、文章、网页,一键生成视频,适合需要提升相关任务效率的用户。

AionClaw
AionClaw Hot

AionClaw是一款面向办公、创作和编程任务的AI桌面智能体。

Seko
Seko Hot

一款AI视频创作工具,主要用于商汤科技推出的创编一体的AI短视频创作Agent,适合需要提升相关任务效率的用户。

相关专题

更多
python打包成可执行文件
python打包成可执行文件

本专题为大家带来python打包成可执行文件相关的文章,大家可以免费的下载体验。

1611

2023.07.20

python能做什么
python能做什么

python能做的有:可用于开发基于控制台的应用程序、多媒体部分开发、用于开发基于Web的应用程序、使用python处理数据、系统编程等等。本专题为大家提供python相关的各种文章、以及下载和课程。

3884

2023.07.25

format在python中的用法
format在python中的用法

Python中的format是一种字符串格式化方法,用于将变量或值插入到字符串中的占位符位置。通过format方法,我们可以动态地构建字符串,使其包含不同值。php中文网给大家带来了相关的教程以及文章,欢迎大家前来阅读学习。

1609

2023.07.31

python教程
python教程

Python已成为一门网红语言,即使是在非编程开发者当中,也掀起了一股学习的热潮。本专题为大家带来python教程的相关文章,大家可以免费体验学习。

22457

2023.08.03

python环境变量的配置
python环境变量的配置

Python是一种流行的编程语言,被广泛用于软件开发、数据分析和科学计算等领域。在安装Python之后,我们需要配置环境变量,以便在任何位置都能够访问Python的可执行文件。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2767

2023.08.04

python eval
python eval

eval函数是Python中一个非常强大的函数,它可以将字符串作为Python代码进行执行,实现动态编程的效果。然而,由于其潜在的安全风险和性能问题,需要谨慎使用。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2807

2023.08.04

scratch和python区别
scratch和python区别

scratch和python的区别:1、scratch是一种专为初学者设计的图形化编程语言,python是一种文本编程语言;2、scratch使用的是基于积木的编程语法,python采用更加传统的文本编程语法等等。本专题为大家提供scratch和python相关的文章、下载、课程内容,供大家免费下载体验。

1123

2023.08.11

python合并两个列表
python合并两个列表

Python是一种强大的编程语言,具有许多方便的功能和工具。在Python中,有多种方法可以合并两个列表。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

596

2023.08.10

PixTV AI视频生成与无限画布创作
PixTV AI视频生成与无限画布创作

PixTV专题整理AI视频与视觉内容创作相关功能使用教程,涵盖AI生图、视频生成、无限画布、多模型创作、素材管理、声音音乐及视频剪辑等功能,帮助用户快速掌握PixTV从创意到成片的完整制作方法。

0

2026.09.29

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
PHP开发基础之数据库篇(PDO)
PHP开发基础之数据库篇(PDO)

共10课时 | 2.3万人学习

第三期培训_PHP开发
第三期培训_PHP开发

共116课时 | 32.3万人学习

Visual Studio 企业部署手册
Visual Studio 企业部署手册

共0课时 | 0人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn