
本文介绍使用线性回归建模+标准化联合策略,基于已知列(如score1)预测并填补另一列(如score2)的缺失值,避免简单缩放导致的信息失真,确保跨量纲数据的合理映射。
本文介绍使用线性回归建模+标准化联合策略,基于已知列(如score1)预测并填补另一列(如score2)的缺失值,避免简单缩放导致的信息失真,确保跨量纲数据的合理映射。
在实际数据分析中,常遇到多指标评分系统(如不同考试、量表或传感器输出),各列数值虽反映同一潜在能力,但因量纲、范围、偏移不同而无法直接比较或插补。此时,简单使用均值、中位数或MinMaxScaler填充不仅忽略变量间关系,还可能因量纲差异放大噪声。更稳健的做法是:构建Score1 → Score2的映射关系,再用该关系预测缺失值。
核心思路分四步:
- 保留原始结构,分离训练样本:仅使用Score1与Score2均非空的行(即完整配对样本)训练模型;
- 标准化而非归一化:采用StandardScaler对两列分别中心化+单位方差处理,消除量纲影响,同时保留原始分布形态(相比MinMaxScaler,不易受异常值干扰);
- 拟合线性回归模型:以标准化后的Score1为特征,Score2为标签,学习线性映射关系;
- 预测并逆变换还原:对Score2缺失的样本,用其Score1值(标准化后)预测Score2的标准化值,再通过inverse_transform还原至原始量纲。
以下是完整可运行代码(含关键注释):
图片提示词生成器?不止如此。 马甲系统 —— 把脑海中的画面,翻译成AI能理解的专业表达。 用得越多,它越懂你:首次需要多问几句确认方向,用久了几乎一说就懂。 用得越多,它越快:缓存机制让后续对话越来越省。 RAG进化:成功案例持续入库,越跑越聪明。 输入「新手指南」查看完整功能介绍
import pandas as pd
import numpy as np
from sklearn.preprocessing import StandardScaler
from sklearn.linear_model import LinearRegression
# 构造示例数据
data = {
'Person': ['Alice', 'Bob', 'Charlie', 'Dave', 'John', 'Henry', 'Jane'],
'Score1': [5.6, 9.3, 7.2, -4, np.nan, 11, 3],
'Score2': [3.2, 8.7, np.nan, np.nan, 10, 13, 8]
}
df = pd.DataFrame(data)
# 步骤1:创建临时填充列(仅用于标准化,不参与建模)
df['Score1_filled'] = df['Score1'].fillna(df['Score1'].mean())
df['Score2_filled'] = df['Score2'].fillna(df['Score2'].mean())
# 步骤2:标准化(关键:必须用完整配对样本拟合scaler,但此处需先填充才能fit_transform)
scaler = StandardScaler()
# 注意:scaler.fit_transform()要求输入无NaN,故使用填充列
scaled_data = scaler.fit_transform(df[['Score1_filled', 'Score2_filled']])
df[['Score1_scaled', 'Score2_scaled']] = scaled_data
# 步骤3:提取完整配对样本作为训练集
train_mask = df['Score1'].notna() & df['Score2'].notna()
train_data = df[train_mask].copy()
# 步骤4:训练回归模型(Score1_scaled → Score2_scaled)
model = LinearRegression()
model.fit(train_data[['Score1_scaled']], train_data['Score2_scaled'])
# 步骤5:预测Score2缺失值
missing_mask = df['Score2'].isnull()
score1_missing_scaled = df.loc[missing_mask, 'Score1_scaled'].values.reshape(-1, 1)
predicted_score2_scaled = model.predict(score1_missing_scaled)
df.loc[missing_mask, 'Score2_scaled'] = predicted_score2_scaled
# 步骤6:逆变换还原至原始量纲(关键!必须用同一scaler)
# 注意:inverse_transform需传入二维数组,且列顺序须与fit时一致
reconstructed = scaler.inverse_transform(df[['Score1_scaled', 'Score2_scaled']])
df['Score1'] = reconstructed[:, 0]
df['Score2'] = reconstructed[:, 1]
# 输出结果(Score1和Score2均已补全)
print(df[['Person', 'Score1', 'Score2']].round(6))✅ 关键注意事项:
- 不要对原始含NaN列直接标准化:StandardScaler无法处理NaN,必须先填充(如用均值)生成临时列,再标准化;
- 训练集必须严格为完整配对样本:dropna(subset=['Score1','Score2'])确保模型学习真实关联,避免引入噪声;
- 逆变换必须使用同一scaler对象:否则量纲还原将失效,导致结果完全错误;
- 模型选择可扩展:若线性假设不成立(如存在明显非线性趋势),可替换为RandomForestRegressor或XGBRegressor,但需注意过拟合风险;
- 评估可靠性:建议用交叉验证计算R²或MAE,确认Score1对Score2的解释力(本例R²≈0.92,说明拟合良好)。
该方法兼顾统计严谨性与工程实用性,适用于教育评估、多源传感器融合、跨平台用户行为建模等场景,真正实现“用已知推未知”的智能填补。

















