
本文介绍如何在使用 train_test_split 划分数据后,将 X_train、X_test、y_train、y_test 无损还原为原始 DataFrame 结构(含列名与顺序),并导出为 CSV 文件。
本文介绍如何在使用 `train_test_split` 划分数据后,将 `x_train`、`x_test`、`y_train`、`y_test` 无损还原为原始 dataframe 结构(含列名与顺序),并导出为 csv 文件。
在机器学习流程中,常需将原始数据集(如 df)按特征 X 和标签 y 拆分,并进一步划分为训练集与测试集。但有时出于数据审计、版本存档或下游协作需求,需将划分后的数据严格还原为原始格式——即保留原始列名、列顺序、数据类型及行序逻辑(注意:train_test_split 默认打乱顺序,若需完全复原原始行序,须提前保存索引;本文默认接受划分后的自然拼接顺序,但确保结构一致)。
✅ 正确还原与保存步骤
首先,确保你已保留原始 DataFrame 的列名(尤其是目标列位置):
Miller (mlr) 是一个命令行工具,用于查询、整形和重新格式化名称索引数据,如 CSV、TSV、JSON 和 JSON Lines。它将 awk、sed、cut、join 和 sort 的功能整合到一个专为结构化数据处理而构建的单一工具中。
# 假设原始 df 包含特征列 + 最后一列为 'label'
feature_cols = df.drop('label', axis=1).columns.tolist()
columns_order = feature_cols + ['label'] # 显式定义列顺序,避免歧义接着,将拆分后的数组合并为完整二维结构:
import numpy as np
import pandas as pd
from sklearn.model_selection import train_test_split
# 划分前保存原始列名(关键!)
original_columns = df.columns.tolist()
# 划分数据(注意:stratify=y 会打乱行序,原始索引已丢失)
X = df.drop('label', axis=1).values
y = df['label'].values # 更简洁,无需 reshape + ravel
X_train, X_test, y_train, y_test = train_test_split(
X, y, train_size=0.8, test_size=0.2,
random_state=0, stratify=y
)
# 合并训练集与测试集:先各自拼接特征+标签,再纵向堆叠
train_full = np.hstack([X_train, y_train.reshape(-1, 1)])
test_full = np.hstack([X_test, y_test.reshape(-1, 1)])
merged_array = np.vstack([train_full, test_full])
# 构建新 DataFrame,严格使用 original_columns 保证列名与顺序
df_merged = pd.DataFrame(merged_array, columns=original_columns)
# 可选:恢复数值类型(因 np.hstack 会转为 float64,需按需转换)
for col in df_merged.select_dtypes(include=['number']).columns:
if pd.api.types.is_integer_dtype(df[col]):
df_merged[col] = pd.to_numeric(df_merged[col], downcast='integer')
# 保存为 CSV,不保存索引,确保纯数据一致性
df_merged.to_csv('merged_dataset.csv', index=False)⚠️ 重要注意事项
- 列名必须显式传递:np.hstack/np.vstack 仅处理数值,丢失列信息,务必用 columns=original_columns 显式指定。
-
数据类型可能变化:NumPy 数组运算常将整型转为浮点型。若原始 label 为类别型(如 int 或 str),建议在 to_csv() 前用 astype() 显式转换,或改用 pd.concat 配合 pd.DataFrame 构造(更类型安全):
train_df = pd.DataFrame(X_train, columns=feature_cols) train_df['label'] = y_train test_df = pd.DataFrame(X_test, columns=feature_cols) test_df['label'] = y_test df_merged = pd.concat([train_df, test_df], ignore_index=True)[original_columns]
- 行序不可逆:train_test_split 的 shuffle=True(默认)会打乱原始顺序。如需严格保持原始行序,请设置 shuffle=False,或在划分前用 df.reset_index(drop=True) 并保存索引映射。
- 避免 .values 过度使用:直接操作 DataFrame 子集(如 df.iloc[train_idx])可天然保留列名与类型,是更健壮的替代方案。
最终生成的 merged_dataset.csv 将与原始 df 具有完全一致的列结构、命名和数据布局,可直接用于报告、归档或跨团队交付。

















