
本文介绍如何将pandas dataframe中包含等长列表的列,直接、高效地转换为多个命名列(如col_1、col_2),避免使用explode + groupby + pivot的冗余流程,显著提升可读性与执行效率。
本文介绍如何将pandas dataframe中包含等长列表的列,直接、高效地转换为多个命名列(如col_1、col_2),避免使用explode + groupby + pivot的冗余流程,显著提升可读性与执行效率。
在数据处理中,常遇到形如 {'id': [1, 1, 2, 2], 'val': [[10,11], [15,16], [20,24], [22,23]]} 的结构——其中 val 列存储等长列表,目标是将其“横向展开”为独立列(如 col_1, col_2),最终得到宽表格式。虽然 df.explode('val') 可纵向展开,但后续还需 groupby 构造序号、pivot 重塑,步骤繁琐且易出错。
最简捷方案:直接构造DataFrame
当列表长度统一时,无需explode,只需利用pd.DataFrame()的构造能力:
import pandas as pd data = [[1, [10, 11]], [1, [15, 16]], [2, [20, 24]], [2, [22, 23]]] df = pd.DataFrame(data, columns=['id', 'val']) # ✅ 直接展开为宽表(推荐) out = pd.DataFrame(df['val'].tolist(), index=df['id'], columns=['col_1', 'col_2']) print(out)
输出:
col_1 col_2 id 1 10 11 1 15 16 2 20 24 2 22 23
⚠️ 注意:此时id存在重复索引。若需按id聚合(如取每组首行或求均值),可进一步操作:
# 按id分组取第一行(保留原始顺序) out_agg = out.groupby(level=0).first() # 或取均值(适用于数值型) # out_agg = out.groupby(level=0).mean()
动态列名生成(适用于任意长度列表)
若列表长度不固定或数量较多,可用rename配合lambda自动命名:
# 自动命名为 col_1, col_2, col_3, ...
out_dynamic = (
pd.DataFrame(df['val'].tolist(), index=df['id'])
.rename(columns=lambda x: f'col_{x + 1}')
)为什么不推荐 explode + groupby + pivot?
该路径需额外生成序号列:
# ❌ 冗余写法(不推荐)
df_exploded = df.explode('val').reset_index(drop=True)
df_exploded['col_name'] = df_exploded.groupby('id').cumcount() + 1
df_exploded['col_name'] = 'col_' + df_exploded['col_name'].astype(str)
result = df_exploded.pivot(index='id', columns='col_name', values='val')不仅代码更长,还易因索引混乱导致pivot失败,且性能低于直接构造。
总结
- ✅ 首选方法:pd.DataFrame(df['col'].tolist(), index=df['id']) —— 简洁、高效、可控;
- ✅ 动态列名用 rename(columns=lambda x: f'col_{x+1}');
- ⚠️ 确保 val 列中所有列表长度一致,否则会报错(可预先校验:df['val'].str.len().nunique() == 1);
- ? 若原始DataFrame含其他字段需保留,建议先set_index(['id', ...])再展开,或使用join合并。


















