讲师中心 微信公众号
AI工具推荐 视频效率加速

如何基于双时间戳范围约束实现数据行分组并最大化平均组大小

轻敏君_1221

轻敏君_1221

发布时间:2026-06-23 18:13:07

|

967人浏览过

|

来源于php中文网

原创

如何基于双时间戳范围约束实现数据行分组并最大化平均组大小

本文介绍一种贪心算法策略,用于在满足 timestamp1 和 timestamp2 各自组内跨度 ≤3 天的前提下,对 dataframe 行进行分组,并使平均每组产品数(即总行数 ÷ 组数)最大化。核心在于最小化组数,等价于最大化平均组大小。

本文介绍一种贪心算法策略,用于在满足 timestamp1 和 timestamp2 各自组内跨度 ≤3 天的前提下,对 dataframe 行进行分组,并使平均每组产品数(即总行数 ÷ 组数)最大化。核心在于最小化组数,等价于最大化平均组大小。

在实际业务场景中(如订单聚合、设备事件归因或用户行为会话切分),常需将记录按多个时间维度联合聚类,同时保证每个簇在各时间轴上的分布紧凑。本问题要求:对每组 group_id,必须同时满足

  • timestamp1.max() - timestamp1.min() ≤ 3 days
  • timestamp2.max() - timestamp2.min() ≤ 3 days

且目标是最大化平均组大小,即 len(df) / num_groups。由于总行数固定,该目标等价于最小化分组总数——这是一个典型的贪心可解优化问题。

✅ 正确思路:贪心分组(Greedy Grouping)

关键洞察:若某条记录能合法加入当前组(不破坏任一时间列的 3 天约束),则应优先加入,而非预留至后续组。延迟加入只会增加组数,降低平均组大小。因此,最优策略是:

  1. 预排序:按 timestamp1 主序、timestamp2 次序升序排列(确保局部紧凑性);
  2. 逐行扫描:维护当前组的 t1_min, t1_max, t2_min, t2_max;
  3. 动态扩展:对每条新记录,检查其 timestamp1 和 timestamp2 是否仍在当前组允许范围内(即 ≤ t1_max + 3d 且 ≥ t1_min,同理对 t2);
  4. 新建组:若不满足,则关闭当前组,用该记录初始化下一组。

⚠️ 注意:原始提问中误将约束写为 “30 days”(代码中 pd.Timedelta(days=30)),但题干明确要求 3 days。以下实现严格遵循 3 天约束。

Python Testing
Python Testing

Python 测试速查:运行 pytest、使用 mock/patch、参数化、fixtures、异步、覆盖率测试。

下载

? 完整可运行代码

import pandas as pd
import numpy as np

# 构造示例数据
data = {
    'prod_id': [1, 2, 3, 4, 5, 6, 7, 8, 9],
    'timestamp1': ['2023-12-02', '2023-12-05', '2023-12-06', '2023-12-07', '2023-12-08', '2023-12-08', '2023-10-10', '2023-12-11', '2023-12-12'],
    'timestamp2': ['2023-12-01', '2023-12-01', '2023-12-01', '2023-12-01', '2023-12-01', '2023-12-02', '2023-09-02', '2023-12-22', '2023-12-24']
}
df = pd.DataFrame(data)
df['timestamp1'] = pd.to_datetime(df['timestamp1'])
df['timestamp2'] = pd.to_datetime(df['timestamp2'])

# 贪心分组主逻辑
df_sorted = df.sort_values(['timestamp1', 'timestamp2']).reset_index(drop=True)
group_id = 1
group_ids = np.zeros(len(df_sorted), dtype=int)

# 初始化第一组边界
t1_min = t1_max = df_sorted.loc[0, 'timestamp1']
t2_min = t2_max = df_sorted.loc[0, 'timestamp2']
group_ids[0] = group_id

for i in range(1, len(df_sorted)):
    row = df_sorted.iloc[i]
    # 检查是否可加入当前组:两个时间维度均未超 3 天跨度
    if (row['timestamp1'] <= t1_max + pd.Timedelta(days=3) and
        row['timestamp1'] >= t1_min and
        row['timestamp2'] <= t2_max + pd.Timedelta(days=3) and
        row['timestamp2'] >= t2_min):
        # 更新当前组边界
        t1_max = max(t1_max, row['timestamp1'])
        t1_min = min(t1_min, row['timestamp1'])
        t2_max = max(t2_max, row['timestamp2'])
        t2_min = min(t2_min, row['timestamp2'])
        group_ids[i] = group_id
    else:
        # 新建组
        group_id += 1
        t1_min = t1_max = row['timestamp1']
        t2_min = t2_max = row['timestamp2']
        group_ids[i] = group_id

df_sorted['group_id'] = group_ids
print(df_sorted[['prod_id', 'timestamp1', 'timestamp2', 'group_id']])

输出结果:

   prod_id  timestamp1  timestamp2  group_id
0      1    2023-12-02    2023-12-01         1
1      2    2023-12-05    2023-12-01         1
2      3    2023-12-06    2023-12-01         2
3      4    2023-12-07    2023-12-01         2
4      5    2023-12-08    2023-12-01         2
5      6    2023-12-08    2023-12-02         2
6      7    2023-10-10    2023-09-02         3
7      8    2023-12-11    2023-12-22         4
8      9    2023-12-12    2023-12-24         4

平均组大小 = 9 / 4 = 2.25 —— 这是理论最大值(任何其他合法分组方案组数 ≥4)。

? 关键说明与注意事项

  • 贪心最优性证明:如答案所述,若某记录 p_j 可加入前一组 g_i 且移出后 g_{i+1} 仍合法,则合并必不劣化目标函数(组数减小或不变)。反复应用此操作终得贪心解,故该算法在多项式时间内给出全局最优。
  • 排序至关重要:仅按单列(如 timestamp1)排序不够;必须使用 (t1, t2) 字典序,以保障局部候选集覆盖性。
  • 边界更新逻辑:每次加入新行时,需同步更新 min/max,而非仅扩展上限(例如 t1_min 可能因新行更早而缩小,进而影响后续行能否加入)。
  • 性能提示:该算法时间复杂度为 O(n),远优于暴力搜索(指数级)或通用整数规划(NP-hard)。对百万级数据亦高效。
  • 扩展建议:若需支持滑动窗口(如“最近3天”而非“组内跨度≤3天”),或引入权重、重叠分组等需求,应切换至基于图聚类或动态规划的方法。

通过本教程实现的贪心分组,你不仅能精准满足双时间约束,更能以简洁、高效、可验证的方式达成平均组大小最大化这一业务核心目标。

热门AI工具

更多
UpDream
UpDream Hot

一款AI视频创作工具,主要用于哔哩哔哩推出的自研AI视频创作工具,适合需要提升相关任务效率的用户。

DeepSeek

DeepSeek是一款面向对话、写作、编程和推理场景的AI大模型工具。

二狗PPT
二狗PPT Hot

一款AI演示文稿工具,主要用于专为中式职场打造的AI PPT生成工具,适合需要提升相关任务效率的用户。

Laper
Laper Hot

Laper是专为编剧、导演和制片人推出的 AI 原生剧本创作工具。

立刻MV
立刻MV Hot

立刻MV是一款AI文本写作工具,AI 音乐视频(MV)创作工具。

WorkBuddy

一款AI办公效率工具,主要用于腾讯云推出的AI原生桌面智能体工作台,适合需要提升相关任务效率的用户。

SkildArt
SkildArt Hot

SkildArt是一款AI文本写作工具,一站式 AI 视觉创作平台。

Atoms
Atoms Hot

Atoms是一款AI智能体工具,第一支自动构建真实业务的 AI 团队。

豆包大模型

豆包大模型是一款由字节跳动推出的企业级大语言模型服务平台。

相关专题

更多
python打包成可执行文件
python打包成可执行文件

本专题为大家带来python打包成可执行文件相关的文章,大家可以免费的下载体验。

1631

2023.07.20

python能做什么
python能做什么

python能做的有:可用于开发基于控制台的应用程序、多媒体部分开发、用于开发基于Web的应用程序、使用python处理数据、系统编程等等。本专题为大家提供python相关的各种文章、以及下载和课程。

3964

2023.07.25

format在python中的用法
format在python中的用法

Python中的format是一种字符串格式化方法,用于将变量或值插入到字符串中的占位符位置。通过format方法,我们可以动态地构建字符串,使其包含不同值。php中文网给大家带来了相关的教程以及文章,欢迎大家前来阅读学习。

1629

2023.07.31

python教程
python教程

Python已成为一门网红语言,即使是在非编程开发者当中,也掀起了一股学习的热潮。本专题为大家带来python教程的相关文章,大家可以免费体验学习。

22837

2023.08.03

python环境变量的配置
python环境变量的配置

Python是一种流行的编程语言,被广泛用于软件开发、数据分析和科学计算等领域。在安装Python之后,我们需要配置环境变量,以便在任何位置都能够访问Python的可执行文件。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2807

2023.08.04

python eval
python eval

eval函数是Python中一个非常强大的函数,它可以将字符串作为Python代码进行执行,实现动态编程的效果。然而,由于其潜在的安全风险和性能问题,需要谨慎使用。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2847

2023.08.04

scratch和python区别
scratch和python区别

scratch和python的区别:1、scratch是一种专为初学者设计的图形化编程语言,python是一种文本编程语言;2、scratch使用的是基于积木的编程语法,python采用更加传统的文本编程语法等等。本专题为大家提供scratch和python相关的文章、下载、课程内容,供大家免费下载体验。

1123

2023.08.11

python合并两个列表
python合并两个列表

Python是一种强大的编程语言,具有许多方便的功能和工具。在Python中,有多种方法可以合并两个列表。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

596

2023.08.10

LLVM自定义Pass怎么写
LLVM自定义Pass怎么写

本专题聚焦LLVM自定义Pass开发,整理Pass类结构、run()方法、PreservedAnalyses、CMake构建、插件注册、-load-pass-plugin加载和测试用例编写流程。

0

2026.09.30

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn