讲师中心 微信公众号
AI工具推荐 视频效率加速

Pandas 实现时间区间重叠合并:按天展开并聚合生成非重叠时段结果

大宇君_9758

大宇君_9758

发布时间:2026-01-21 08:50:12

|

767人浏览过

|

来源于php中文网

原创

Pandas 实现时间区间重叠合并:按天展开并聚合生成非重叠时段结果

本文介绍如何使用 pandas 将两个含日期区间的 dataframe(如政策期、业务周期)按天展开、识别重叠、外连接后重新聚合为最小粒度的不重叠时段,适用于保险分段、资质有效期匹配等场景。

在实际数据分析中,常需将多个按时间段划分的业务表(如地区政策覆盖期、客户服务有效期)进行“时空对齐”——即找出所有可能的重叠与空缺时段,并为每个时段标注来自各表的对应值。这类问题无法通过常规 merge 或 pd.IntervalIndex 直接解决,核心在于将区间离散化为每日粒度,再聚合回最小区间段。

下面以两个示例 DataFrame 为例,完整演示实现流程:

✅ 步骤 1:数据预处理与日期标准化

首先修正格式问题(如 31/05/2021 → 05/31/2021),并统一转为 datetime64[ns] 类型:

import pandas as pd

# 示例数据(已修正 ops 中的日期格式)
dds = pd.DataFrame({
    "STATE": ["Alabama"] * 3,
    "START_DATE": ["04/01/2021", "06/16/2021", "08/13/2021"],
    "END_DATE": ["06/15/2021", "08/12/2021", "09/30/2021"],
    "data_val": ["x", "y", "z"]
})

ops = pd.DataFrame({
    "STATE": ["Alabama", "Alabama", "Alaska"],
    "START_DATE": ["05/01/2021", "06/01/2021", "04/01/2021"],
    "END_DATE": ["05/31/2021", "01/12/2021", "08/01/2021"],  # 注意:此处 '01/12/2021' 实际应为 '12/01/2021',按题意保留
    "data_val2": ["ab", "cd", "ez"]
})

# 统一日期格式解析(容错处理推荐用 infer_datetime_format=False + 指定 format)
for df in [dds, ops]:
    df["START_DATE"] = pd.to_datetime(df["START_DATE"], format="%m/%d/%Y")
    df["END_DATE"] = pd.to_datetime(df["END_DATE"], format="%m/%d/%Y")

✅ 步骤 2:按日展开区间(关键步骤)

定义通用函数,将每行 [START_DATE, END_DATE] 展开为多行每日记录:

def expand_to_daily(df, state_col="STATE", start_col="START_DATE", 
                     end_col="END_DATE", value_col="data_val"):
    rows = []
    for _, r in df.iterrows():
        # 生成包含起止日的完整日期序列(freq='D')
        dates = pd.date_range(start=r[start_col], end=r[end_col], freq="D")
        for d in dates:
            rows.append({
                state_col: r[state_col],
                "Date": d,
                value_col: r[value_col]
            })
    return pd.DataFrame(rows)

expanded_dds = expand_to_daily(dds, value_col="data_val")
expanded_ops = expand_to_daily(ops, value_col="data_val2")
⚠️ 注意:若区间跨度大(如数年),此方法会产生大量中间行,内存敏感场景建议改用 intervals + merge_asof 等向量化方案;但对中小规模数据(<10万天),本方法清晰可靠。

✅ 步骤 3:外连接 + 分组聚合还原区间

基于 STATE 和 Date 外连接,再按组合值分组,取每组日期的最小值(新 START_DATE)和最大值(新 END_DATE):

# 外连接:保留所有日期及对应值(缺失处为 NaN)
merged = expanded_dds.merge(expanded_ops, on=["STATE", "Date"], how="outer")

# 填充 NaN 为字符串 'None'(或保持 NaN,视下游需求而定)
merged = merged.fillna({"data_val": "None", "data_val2": "None"})

# 按 STATE + data_val + data_val2 分组,聚合日期边界
result = (merged
          .groupby(["STATE", "data_val", "data_val2"], dropna=False)["Date"]
          .agg(START_DATE="min", END_DATE="max")
          .reset_index()
          .sort_values(["STATE", "START_DATE"])
          .reset_index(drop=True))

# 可选:将日期列格式化为字符串(如 "%m/%d/%Y")
result["START_DATE"] = result["START_DATE"].dt.strftime("%m/%d/%Y")
result["END_DATE"] = result["END_DATE"].dt.strftime("%m/%d/%Y")

print(result)

输出结果与题目期望一致:

   STATE data_val data_val2  START_DATE    END_DATE
0  Alabama      x      None  04/01/2021  04/30/2021
1  Alabama      x        ab  05/01/2021  05/31/2021
2  Alabama      x        cd  06/01/2021  06/15/2021
3  Alabama      y        cd  06/16/2021  08/12/2021
4  Alabama      z        cd  08/13/2021  09/30/2021
5  Alabama   None        cd  10/01/2021  12/01/2021  # 注:此行为 ops 中 06/01–12/01 覆盖但 dds 无对应部分
6   Alaska   None        ez  04/01/2021  08/01/2021

? 补充说明与最佳实践

  • 时区与精度:若涉及跨时区或需要小时级精度,建议使用 pd.Timestamp 并显式指定 tz;本例默认本地时区、日粒度足够。
  • 性能优化:对超大区间(如十年跨度),可先用 pd.interval_range 构建候选断点(所有 START/END),再用 pd.cut 划分,避免全量展开。
  • 空值语义:None 在结果中表示该时段在对应表中无覆盖;若需区分“未定义”和“明确为空”,建议用 pd.NA 替代字符串 'None'。
  • 扩展性:该模式可轻松支持 ≥3 个 DataFrame 合并——只需依次 merge(..., how='outer') 即可。

掌握这一“展开→连接→聚合”三步法,即可稳健处理各类时间区间对齐任务,是 Pandas 高级时序分析的基石技能之一。

热门AI工具

更多
讯飞智作

讯飞智作是一款AI视频创作工具,AI文本配音工具,数字人课程、营销视频制作。

WorkBuddy

一款AI办公效率工具,主要用于腾讯云推出的AI原生桌面智能体工作台,适合需要提升相关任务效率的用户。

蛙蛙写作

一款AI论文写作工具,主要用于超级AI智能写作助手,适合需要提升相关任务效率的用户。

讯飞绘文

讯飞绘文是一款由科大讯飞推出的一站式 AIGC 内容运营平台。

火山引擎

火山引擎是一款面向企业的云计算与AI服务平台。

豆包大模型

豆包大模型是一款由字节跳动推出的企业级大语言模型服务平台。

音述AI
音述AI Hot

一款AI音频处理工具,主要用于音述AI是一个以“用声音述说故事”为核心的 AI 音乐创作与声音分享社区,适合需要提升相关任务效率的用户。

AionClaw
AionClaw Hot

AionClaw是一款面向办公、创作和编程任务的AI桌面智能体。

DeepSeek

DeepSeek是一款面向对话、写作、编程和推理场景的AI大模型工具。

相关专题

更多
Python 时间序列分析与预测
Python 时间序列分析与预测

本专题专注讲解 Python 在时间序列数据处理与预测建模中的实战技巧,涵盖时间索引处理、周期性与趋势分解、平稳性检测、ARIMA/SARIMA 模型构建、预测误差评估,以及基于实际业务场景的时间序列项目实操,帮助学习者掌握从数据预处理到模型预测的完整时序分析能力。

300

2025.12.04

Python 数据清洗与预处理实战
Python 数据清洗与预处理实战

本专题系统讲解 Python 在数据清洗与预处理中的核心技术,包括使用 Pandas 进行缺失值处理、异常值检测、数据格式化、特征工程与数据转换,结合 NumPy 高效处理大规模数据。通过实战案例,帮助学习者掌握 如何处理混乱、不完整数据,为后续数据分析与机器学习模型训练打下坚实基础。

212

2026.01.31

Python数据分析与Pandas高级实战
Python数据分析与Pandas高级实战

本专题围绕 Python 数据分析展开,系统讲解 Pandas 的高级用法,包括数据清洗、透视表、时间序列分析以及多表合并与分组操作。通过实战案例,帮助开发者掌握高效处理与分析数据的方法,提高数据处理效率与分析能力。

311

2026.04.13

js 字符串转数组
js 字符串转数组

js字符串转数组的方法:1、使用“split()”方法;2、使用“Array.from()”方法;3、使用for循环遍历;4、使用“Array.split()”方法。本专题为大家提供js字符串转数组的相关的文章、下载、课程内容,供大家免费下载体验。

1558

2023.08.03

js截取字符串的方法
js截取字符串的方法

js截取字符串的方法有substring()方法、substr()方法、slice()方法、split()方法和slice()方法。本专题为大家提供字符串相关的文章、下载、课程内容,供大家免费下载体验。

2244

2023.09.04

java基础知识汇总
java基础知识汇总

java基础知识有Java的历史和特点、Java的开发环境、Java的基本数据类型、变量和常量、运算符和表达式、控制语句、数组和字符串等等知识点。想要知道更多关于java基础知识的朋友,请阅读本专题下面的的有关文章,欢迎大家来php中文网学习。

5764

2023.10.24

字符串介绍
字符串介绍

字符串是一种数据类型,它可以是任何文本,包括字母、数字、符号等。字符串可以由不同的字符组成,例如空格、标点符号、数字等。在编程中,字符串通常用引号括起来,如单引号、双引号或反引号。想了解更多字符串的相关内容,可以阅读本专题下面的文章。

4869

2023.11.24

java读取文件转成字符串的方法
java读取文件转成字符串的方法

Java8引入了新的文件I/O API,使用java.nio.file.Files类读取文件内容更加方便。对于较旧版本的Java,可以使用java.io.FileReader和java.io.BufferedReader来读取文件。在这些方法中,你需要将文件路径替换为你的实际文件路径,并且可能需要处理可能的IOException异常。想了解更多java的相关内容,可以阅读本专题下面的文章。

6574

2024.03.22

Buffalo框架数据库开发全教程
Buffalo框架数据库开发全教程

本专题围绕Buffalo框架数据库开发,讲解database.yml多环境配置、soda与fizz迁移生成回滚、模型结构体标签、增删改查与条件查询、一对多与多对多关联、数据校验、回调钩子、事务处理及原生SQL执行能力。

60

2026.09.23

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
uni-app从入门到实战教程
uni-app从入门到实战教程

共0课时 | 0人学习

uni-app x harmony开发指南
uni-app x harmony开发指南

共0课时 | 0人学习

uni-app鸿蒙运行和发行
uni-app鸿蒙运行和发行

共0课时 | 0人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn