
本文介绍如何使用 Pandas 高效计算 DataFrame 中每一列各唯一值的累计连续存在时长,即对每个值的所有连续段分别求时间跨度并加总,最终输出结构化报告。
本文介绍如何使用 pandas 高效计算 dataframe 中每一列各唯一值的**累计连续存在时长**,即对每个值的所有连续段分别求时间跨度并加总,最终输出结构化报告。
在时序数据分析中,常需统计某状态(如传感器读数、设备运行模式、用户行为标签)在每列中连续维持的总时长。关键在于:不能简单按值分组求 max(Time) - min(Time)(这会忽略中间状态切换),而必须识别连续块(consecutive runs),对每个块计算 last_time - first_time,再按值汇总。
以下以示例数据为例,展示完整、可复用的解决方案:
import pandas as pd
# 示例数据
df = pd.DataFrame({
'Time': [1.1, 2.2, 3.4, 4.5, 5.6, 6.2, 7.4, 8.5, 9.8, 10.1, 11.2],
'colA': [2, 2, 2, 5, 5, 5, 6, 6, 5, 5, 5],
'colB': [2, 2, 3, 3, 4, 4, 4, 2, 2, 2, 2]
})核心思路:熔解 + 连续块标记 + 分组聚合
- 熔解(Melt):将宽表转为长表,使所有列统一处理
- 标记连续块:利用 Series.ne(Series.shift()).cumsum() 为每个连续相同值分配唯一组号
- 按块聚合:对每个 (列名, 值, 连续块) 计算起止时间差
- 按值汇总:对同一列+值的所有连续块时长求和
✅ 完整代码(含注释)
# 步骤1:熔解,保留 Time 列,展开其余列为 variable/value
df_long = df.melt(id_vars='Time', var_name='Col_name', value_name='unique_value')
# 步骤2:为每个连续相同值生成块 ID(关键!)
block_id = df_long['unique_value'].ne(df_long['unique_value'].shift()).cumsum().rename('block')
# 步骤3:按 (列名, 值, 块) 分组,提取每块的首尾时间
grouped = df_long.groupby(['Col_name', 'unique_value', block_id])['Time']
duration_per_block = grouped.agg(first='first', last='last').assign(
Duration=lambda x: x['last'] - x['first']
)['Duration']
# 步骤4:按列名和值汇总所有块的时长
result = (duration_per_block
.groupby(['Col_name', 'unique_value'])
.sum()
.reset_index(name='Duration'))
print(result)输出结果:
图片提示词生成器?不止如此。 马甲系统 —— 把脑海中的画面,翻译成AI能理解的专业表达。 用得越多,它越懂你:首次需要多问几句确认方向,用久了几乎一说就懂。 用得越多,它越快:缓存机制让后续对话越来越省。 RAG进化:成功案例持续入库,越跑越聪明。 输入「新手指南」查看完整功能介绍
Col_name unique_value Duration 0 colA 2 2.3 1 colA 5 3.1 2 colA 6 1.1 3 colB 2 3.8 4 colB 3 1.1 5 colB 4 1.8
? 验证 colA=5 的 3.1s:
- 第一段:索引 3–5 → Time=[4.5, 5.6, 6.2] → 6.2 - 4.5 = 1.7
- 第二段:索引 8–10 → Time=[9.8, 10.1, 11.2] → 11.2 - 9.8 = 1.4
- 总和:1.7 + 1.4 = 3.1
⚠️ 注意事项与最佳实践
- 时间列必须有序:该方法假设 Time 列已按升序排列;若未排序,请先执行 df = df.sort_values('Time').reset_index(drop=True)
- 避免循环:全程使用向量化 Pandas 操作,性能远优于 for 循环或 apply
- 扩展性好:支持任意多列,无需手动修改逻辑
- 导出 CSV:直接调用 result.to_csv('duration_report.csv', index=False)
- 精度控制:若需保留小数位,可追加 .round(1)(如 result['Duration'] = result['Duration'].round(1))
此方法兼具简洁性、可读性与工程鲁棒性,是处理“连续状态时长统计”类问题的标准范式。

















