
本文介绍如何在pandas中对列名含相同日期前缀(如'20241201_')的dataframe进行智能列重排,使相同日期的列按后缀(如biscuit、candle、candy)自然排序,同时保留首列(如'branch')位置不变。
本文介绍如何在pandas中对列名含相同日期前缀(如'20241201_')的dataframe进行智能列重排,使相同日期的列按后缀(如biscuit、candle、candy)自然排序,同时保留首列(如'branch')位置不变。
在实际数据分析中,我们常遇到列名采用“日期_品类”格式的宽表(如 '20241201_Candy', '20241201_Biscuit'),但原始列序可能按字典序混乱排列(如 Candy 在 Biscuit 前),导致跨品类横向对比困难。理想排序应先按日期分组,再在每组内按后缀字母序排列——这恰好可通过 Python 默认字符串排序实现:因为 '20241201_Biscuit' ,且 <code>'20241201_...' ,所以对所有带日期前缀的列直接执行 <code>sorted() 即可满足需求。
以下为完整实现代码:
import pandas as pd
df = pd.DataFrame({
'Branch': ['Hanoi'],
'20241201_Candy': [3], '20241202_Candy': [4], '20241203_Candy': [5],
'20241201_Candle': [3], '20241202_Candle': [4], '20241203_Candle': [5],
'20241201_Biscuit': [3], '20241202_Biscuit': [4], '20241203_Biscuit': [5]
})
# 方法1:使用 reindex(推荐,语义清晰)
df_reordered = df.reindex(['Branch'] + sorted(df.columns[1:]), axis=1)
# 方法2:直接列选择(简洁高效,等价效果)
df_reordered = df[['Branch'] + sorted(df.columns[1:])]✅ 关键说明:
-
df.columns[1:]跳过首列'Branch',仅对后续列排序; -
sorted()对字符串列表默认按字典序升序排列,天然支持“日期优先、后缀次之”的双重排序逻辑; - 两种方法均不修改原 DataFrame,返回新视图,安全可靠。
⚠️ 注意事项:
- 此方法假设所有非首列均符合
YYYYMMDD_*格式;若存在其他命名模式(如无下划线、多下划线),需先清洗列名或改用更健壮的排序键(例如sorted(columns, key=lambda x: (x.split('_')[0], x.split('_')[1]))); - 若需按日期 降序(如最新日期在前),可改为
sorted(df.columns[1:], reverse=True),但注意这会同时反转后缀顺序,此时应显式构造排序键。
通过这一简洁技巧,你可在一行代码内完成多维度列重排,大幅提升宽表可读性与后续分析效率。

















