
本文介绍一种高效、可复用的方法,将具有 MultiIndex 列的 DataFrame(如按 widget 和 time step 组织)转换为分层嵌套的 Python 列表,其中每个 widget 对应一个子列表,每个子列表按时间步(t1, t2,…)组织,内含 (machine_id, duration) 元组构成的列表。
本文介绍一种高效、可复用的方法,将具有 multiindex 列的 dataframe(如按 widget 和 time step 组织)转换为分层嵌套的 python 列表,其中每个 widget 对应一个子列表,每个子列表按时间步(t1, t2,…)组织,内含 `(machine_id, duration)` 元组构成的列表。
在工业调度、制造系统建模或资源分配场景中,常需将结构化的时序资源数据(如某工件在不同机器上的加工时长)从 Pandas 的 MultiIndex DataFrame 转换为便于算法调用的原生 Python 数据结构。本文提供的解决方案以清晰的链式操作(reset_index → melt → dropna → assign → groupby × 2 → to_list)实现这一目标,兼顾可读性与健壮性。
核心思路
原始 DataFrame 的列是 pd.MultiIndex,形如 ('Widget A (idx = 0)', 't1');行索引为 resources(如 'm_1', 'm_2'),表示机器标识。目标是:
- 按 widget(MultiIndex 第 0 层)分组;
- 在每个 widget 内,再按 time step(MultiIndex 第 1 层)排序分组;
- 对每个
(widget, timestep)下所有非空值,将其所在行的机器编号(从'm_X'提取X)与数值组成(machine_id, duration)元组; - 最终输出为
List[List[List[Tuple[int, float]]]]:外层按 widget,中层按 timestep,内层为元组列表。
实现代码(完整可运行)
import pandas as pd
import numpy as np
def df_to_components(df: pd.DataFrame) -> list:
"""
将 MultiIndex 列的 DataFrame 转换为嵌套组件列表。
Parameters
----------
df : pd.DataFrame
列为 MultiIndex (widget_name, timestep),行为 resources (e.g., 'm_1', 'm_2')
Returns
-------
List[List[List[Tuple[int, float]]]]
components[widget_idx][timestep_idx] = [(machine_id, duration), ...]
"""
return (
df.reset_index()
.melt(id_vars=df.index.name or 'index',
value_name='value')
.dropna(subset='value')
.assign(
machine_id=lambda x: x[df.index.name].str.extract(r'm_(\d+)').astype(int).squeeze(),
tmp=lambda x: list(zip(x['machine_id'], x['value']))
)
.groupby(['variable_0', 'variable_1'], sort=False)['tmp']
.apply(list)
.groupby('variable_0', sort=False)
.apply(list)
.to_list()
)
# 示例构造(复现 Minimal Reproducible Example)
data = [[1.0, np.nan, np.nan],
[np.nan, 2.0, 2.0],
[np.nan, 3.0, np.nan]]
m_idx = pd.MultiIndex.from_tuples([
('A', 't1'),
('A', 't2'),
('B', 't1')
])
idx = pd.Index([f'm_{i}' for i in range(1, 4)], name='resources')
df = pd.DataFrame(data, columns=m_idx, index=idx)
components = df_to_components(df)
print(components)
# 输出: [[[(1, 1.0)], [(2, 2.0), (3, 3.0)]], [[(2, 2.0)]]]关键步骤详解与注意事项
-
reset_index().melt(...):将行索引转为普通列(保留resources字段),再将宽表转为长表,生成三列:resources(原索引)、variable_0(widget)、variable_1(timestep)、value(数值)。这是后续分组的基础。 -
dropna(subset='value'):严格过滤掉所有空值(NaN),确保只处理有效任务分配。 -
str.extract(r'm_(\d+)'):比str.split('_').str[1]更鲁棒,能准确提取m_12中的12,避免因空格或格式异常导致错误;.squeeze()确保返回 Series 而非 DataFrame。 -
groupby(['variable_0', 'variable_1']):先按(widget, timestep)分组,聚合出每个时间步下所有(machine_id, duration)元组的列表。 -
groupby('variable_0').apply(list):再按 widget 分组,将各 timestep 的结果打包为子列表,最终.to_list()得到顶层列表。 -
sort=False:关键参数!确保输出顺序与原始列顺序一致(如t1,t2, ...,t15),符合 Fig 2 的结构要求。
总结
该方案不依赖循环,完全基于 Pandas 向量化操作,性能优异且逻辑清晰。它天然支持任意数量的 widget、timestep 和 machine,只要列 MultiIndex 结构一致(两层:widget + timestep)、行索引命名规范(m_X 格式),即可开箱即用。实际部署前,建议添加输入校验(如检查列是否为 MultiIndex、行索引是否匹配正则 r'm_\d+'),进一步提升工程鲁棒性。

















