根本原因是Excel用浮点数存储日期(如44562.0表示2022-01-01),而pandas默认不自动识别数值型日期,且无法从“常规”或“文本”格式中推断日期语义,导致读取后为float64或object类型。

为什么 pd.read_excel() 读出来的日期变成数字或字符串?
根本原因是 Excel 内部用浮点数存储日期(从 1900-01-01 起的天数),Pandas 默认不强制解析所有疑似日期的列,尤其当单元格混合了空值、文本、数字时,dtype 会退化为 object,显示成 44205.0 或 '2021/1/1' 这类不可直接计算的形态。
常见错误现象包括:df['date'].dt.year 报 AttributeError: Can only use .dt accessor with datetimelike values;或者用 pd.to_datetime() 转换后出现 NaT 大量堆积。
- 优先在读取阶段指定
parse_dates参数,而不是事后转换 - 避免用
dtype={'date': 'datetime64[ns]'}—— 这个参数对 Excel 不生效,仅对 CSV 有效 - 如果列名含空格或特殊字符,
parse_dates必须传列表,如parse_dates=['Sale Date', 'Ship Date']
怎样让 pd.read_excel() 正确识别并解析日期列?
最稳的方式是显式告诉 Pandas 哪些列要当日期处理,并控制解析行为:
- 用
parse_dates列表指定列名,例如parse_dates=['order_date', 'ship_date'] - 配合
date_parser自定义解析逻辑(比如处理'2023-03-15 14:22'中的时分秒):date_parser=lambda x: pd.to_datetime(x, format='%Y-%m-%d %H:%M') - 加
keep_date_col=False(默认True)防止原始列和解析后列共存 - 若 Excel 里日期列有合并单元格或标题跨行,先用
skiprows或header对齐结构,否则parse_dates会按错行匹配
示例:
立即学习“Python免费学习笔记(深入)”;
df = pd.read_excel('sales.xlsx',
parse_dates=['Order Date', 'Delivery Date'],
date_parser=lambda x: pd.to_datetime(x, errors='coerce'))
pd.to_datetime() 转换失败时该怎么调试?
当读入后列类型已是 object,再调 pd.to_datetime() 却大量返回 NaT,大概率是数据混杂导致解析器放弃——不是函数没用,而是输入太“脏”。
- 先看前几行真实值:
df['date'].head().tolist(),确认是否有None、空字符串、中文“未填写”、Excel 错误值#N/A等 - 用
errors='coerce'是必须项,否则遇到第一个非法值就抛异常 - 不要依赖
infer_datetime_format=True:它只加速已知统一格式(如全为YYYY-MM-DD)的解析,格式一乱就失效 - 对多格式混合列,拆成规则分支处理,比如先尝试
%Y/%m/%d,失败再试%d-%b-%Y
简单兜底写法:
df['date'] = pd.to_datetime(df['date'], errors='coerce', format='mixed')
(注意:format='mixed' 从 Pandas 2.0+ 支持,旧版本需手动分步处理)
Excel 里“常规”格式的日期为何总被读成浮点数?
这是 Excel 的底层机制:即使单元格显示为 2023/5/20,只要单元格格式设为“常规”,Excel 就存成数字 45066.0(对应天数)。Pandas 无法仅凭数值反推它是日期,除非你明确告诉它“这列本该是日期”。
- 打开 Excel → 右键单元格 → “设置单元格格式” → 确认是否为“日期”类型。如果是“常规”或“数值”,Pandas 拿到的就是纯数字
- 修复方法不是改 Python 代码,而是改 Excel:选中列 → 右键 → 设置格式为“日期”,再保存。或者导出前另存为
.xlsx(比.xls元数据更完整) - 如果无法修改源文件,只能靠
parse_dates+origin='1899-12-30'手动转回:Excel 的日期系统起点是 1900 年但有闰年 bug,实际应从1899-12-30开始算
手动转换示例(针对纯数字列):
df['date_num'] = pd.to_datetime(df['date_num'], unit='D', origin='1899-12-30')日期解析真正麻烦的从来不是函数调用,而是得同时盯住 Excel 文件的实际存储格式、Pandas 的解析策略、以及数据里藏着的那些“看起来像日期”的陷阱。


















