
本文介绍如何利用 python 和 pandas 从文件名中提取日期信息,并筛选出日期晚于指定阈值的 csv 文件路径,适用于按日期命名的日志或快照文件批量处理场景。
本文介绍如何利用 python 和 pandas 从文件名中提取日期信息,并筛选出日期晚于指定阈值的 csv 文件路径,适用于按日期命名的日志或快照文件批量处理场景。
在实际数据处理工作中,经常遇到按日期命名的 CSV 文件(如 file_name_20240901.csv),需动态加载某日期之后的所有文件。原始代码中直接用字符串比较(如 "20240905" in loc)仅支持精确匹配,无法实现“大于某日期”的逻辑。正确做法是:从文件路径中提取日期字符串 → 转换为标准 datetime 类型 → 执行时间比较。
以下是一个健壮、可复用的解决方案:
import glob
import pandas as pd
import os
# 指定目标目录(注意:Windows 路径使用原始字符串或双反斜杠)
_path = r'C: emporary_location\'
# 获取所有 CSV 文件的完整路径
file_paths = glob.glob(os.path.join(_path, 'file_name_*.csv'))
# 构建 DataFrame 并提取日期部分(假设格式为 _YYYYMMDD.csv)
df = pd.DataFrame({"filepath": file_paths})
# 使用正则提取8位数字日期(更安全,避免路径干扰)
df["date_str"] = df["filepath"].str.extract(r'_(d{8}).csv$', expand=False)
df["date"] = pd.to_datetime(df["date_str"], format='%Y%m%d', errors='coerce')
# 设定阈值日期(支持字符串或 datetime 对象)
threshold_date = pd.to_datetime('2024-09-05') # 注意:此处为“大于”,故 09-05 不包含
# 筛选日期严格大于阈值的文件
filtered_files = df[df["date"] > threshold_date]["filepath"].tolist()
print("匹配的文件(日期 > 2024-09-05):")
for f in sorted(filtered_files): # 推荐排序以保证时序一致性
print(f)✅ 关键要点说明:
Miller (mlr) 是一个命令行工具,用于查询、整形和重新格式化名称索引数据,如 CSV、TSV、JSON 和 JSON Lines。它将 awk、sed、cut、join 和 sort 的功能整合到一个专为结构化数据处理而构建的单一工具中。
- 使用
str.extract(r'_(d{8}).csv$')精准捕获文件名中的 8 位日期,避免路径中其他数字干扰; -
errors='coerce'可将无法解析的日期转为NaT,防止程序中断; -
pd.to_datetime()支持直接与字符串(如'2024-09-05')比较,内部自动转换,无需手动格式对齐; - 最终结果为完整文件路径列表,可直接传入
pd.read_csv()进行批量读取。
⚠️ 注意事项:
- 若文件名中存在多个 8 位数字(如含版本号),需调整正则表达式,例如
r'file_name_(d{8}).csv$'; -
glob.glob()不保证顺序,建议对结果sorted()或按date列排序后再处理; - 大量文件时,可考虑用
duckdb或polars加速元数据处理,但本方案纯 Pandas 已足够轻量高效。
通过该方法,你不仅能精准筛选 20240906 至 20240913 的全部文件,还可轻松扩展为“最近 N 天”“某月内”等复杂条件,大幅提升自动化数据流水线的灵活性与可靠性。

















