
在python中创建二维训练数据时,若重复使用同一列表对象并追加到主列表,会导致所有子列表项被最后更新的值覆盖,根本原因是未创建独立副本。
在python中创建二维训练数据时,若重复使用同一列表对象并追加到主列表,会导致所有子列表项被最后更新的值覆盖,根本原因是未创建独立副本。
你在强化学习或游戏AI训练中常需收集状态-动作-奖励等元组作为训练样本,典型做法是用嵌套列表(如 tlistm)存储每轮交互数据。但你遇到的问题非常典型:所有行最终都显示为相同内容——这并非逻辑错误,而是Python对象引用机制引发的“浅拷贝陷阱”。
核心问题在于:tlistc 在循环外定义(例如 tlistc = [0] * 14),整个循环中始终操作的是同一个列表对象的内存地址。每次执行 tlistm[e] = tlistc,实际是将同一引用反复存入 tlistm,因此 tlistm 中所有元素最终都指向 tlistc 的最新状态。
✅ 正确做法:在每次迭代内新建独立列表:
tlistm = [] # 主训练数据列表
for e in range(episodes):
tlistc = [0] * 14 # ✅ 每次循环创建全新列表(14维:12维状态 + 动作 + Q值)
qm = random.randint(0, 5)
env.game(action)
fps.tick(1)
screen.fill(bgcolor)
s = env.get_state()
rew = s[12]
q1 = rew + g * qm
# 填充状态特征(前12维)
for k in range(12):
tlistc[k] = s[k]
tlistc[12] = action # 第13位:动作
tlistc[13] = q1 # 第14位:目标Q值
tlistm.append(tlistc) # ✅ 直接append新对象,无需预先填充'a'或索引赋值
if s[13] == 1:
env.game_reset()
action = random.randint(0, 3)? 关键改进点:
图片提示词生成器?不止如此。 马甲系统 —— 把脑海中的画面,翻译成AI能理解的专业表达。 用得越多,它越懂你:首次需要多问几句确认方向,用久了几乎一说就懂。 用得越多,它越快:缓存机制让后续对话越来越省。 RAG进化:成功案例持续入库,越跑越聪明。 输入「新手指南」查看完整功能介绍
立即学习“Python免费学习笔记(深入)”;
- 移除 tlistm.append('a') 和 tlistm[e]=tlistc 的冗余操作,改用 tlistm.append(tlistc) 更安全、更符合语义;
- tlistc = [0] * 14 置于循环内部,确保每次生成独立对象;
- 若需深拷贝复杂嵌套结构,可使用 copy.deepcopy(),但本例中纯数值列表,[0]*14 已足够。
⚠️ 注意事项:
- 不要使用 tlistm = [tlistc] * episodes 初始化——这会创建包含同一引用的重复列表;
- 避免 tlistm[e] = tlistc 配合固定长度预分配,除非你明确控制索引且确保 tlistc 每次新建;
- 调试时可用 id(tlistc) 打印地址验证是否为新对象。
通过这一修正,tlistm 将真正成为包含 episodes 个独立14维样本的二维列表,为后续模型训练提供可靠数据基础。

















