正则表达式不能直接解析时间,但可高效提取、清洗和标准化非标准时间戳,为 datetime 等库解析铺路;关键步骤是先用正则精准捕获时间成分,再按需重组或转换。

正则表达式本身不能“解析”时间,但可以高效提取、清洗和标准化非标准时间戳字符串,为后续用 datetime 或其他库解析铺路。关键在于:先用正则精准捕获时间成分,再按需重组或转换。
识别并提取混杂格式中的时间片段
非标准时间戳常夹杂空格、中文、符号或错位分隔符(如 "2024年03月15日 下午 3:27:45" 或 "24/03/15-15:27:45.892")。正则可统一提取年、月、日、时、分、秒、毫秒等字段:
- 匹配中文格式:
r"(\d{4})年(\d{1,2})月(\d{1,2})日.*?(\d{1,2}):(\d{2}):(\d{2})\.?(\d{0,3})?",捕获组对应年、月、日、时、分、秒、毫秒 - 匹配斜杠/短横格式:
r"(\d{2,4})[/-](\d{1,2})[/-](\d{1,2}).*?(\d{1,2}):(\d{2}):(\d{2})\.?(\d{0,3})?",注意年份可能是两位或四位 - 用
re.search()而非re.match(),确保匹配出现在字符串任意位置
清洗干扰字符,统一分隔符与空格
很多时间串含多余空格、全角符号、中英文冒号混用(如 "14:30:22")或括号包裹("(2024-03-15 14:30:22)")。正则可批量清理:
- 替换全角标点:
re.sub(r"[:;,。!?]", ":", text) - 去除括号和空格:
re.sub(r"[()\s\u3000]+", "", text)(\u3000是中文全角空格) - 规范分隔符:
re.sub(r"[-./]", "-", text)或re.sub(r"[::]", ":", text)
补全缺失字段,适配标准解析器
有些时间串缺年份(如仅 "03-15 14:30")、缺上午/下午标识(如 "下午 3:27"),或毫秒位数不一致("14:30:22.1" vs "14:30:22.123")。正则提取后可编程补全:
- 检测12小时制并转24小时:
if "下午" in text and int(hour) - 毫秒补零至三位:
ms = ms.ljust(3, "0")[:3] if ms else "000" - 年份默认补当前年:
year = year or str(datetime.now().year)(需先提取判断)
组合成 ISO 格式供直接解析
将清洗、补全后的各字段拼成 YYYY-MM-DD HH:MM:SS.sss 格式,就能被 datetime.fromisoformat() 或 pd.to_datetime() 直接识别:
- 示例输出:
"2024-03-15 15:27:45.892"或"2024-03-15T15:27:45.892" - 注意:ISO 8601 中毫秒必须是三位,且
T分隔日期与时间是可选的 - 若原始串含时区(如
"2024-03-15 15:27:45 CST"),可用re.sub(r"\s+[A-Z]{3}$", "+08:00", text)粗略映射(CST→+08:00),再用datetime.fromisoformat(...).astimezone()精确处理
不复杂但容易忽略:正则只是“拆解+整理”的工具,真正的时间语义(比如“昨天”、“下周一”)需额外逻辑;对模糊格式(如 "01/02/03"),正则无法判断是年/月/日还是月/日/年,得靠上下文或业务规则兜底。

















