
在pytorch分布式数据并行(ddp)训练中,batch size按每卡独立设置,总批大小为 per-gpu batch size × gpu数量;梯度自动跨卡平均,因此学习率无需缩放,但需按总步数对齐训练节奏。
在pytorch分布式数据并行(ddp)训练中,batch size按每卡独立设置,总批大小为 per-gpu batch size × gpu数量;梯度自动跨卡平均,因此学习率无需缩放,但需按总步数对齐训练节奏。
在从单卡训练迁移到单机多卡DDP训练时,一个常见误区是直接复用单卡的超参数配置,却忽略了DDP中batch size的语义变化。关键在于:DDP中的batch_size参数始终指“每张GPU上的批量大小”,而非全局批量。例如,当使用4张GPU、每卡设置batch_size=8时,实际全局批量为8 × 4 = 32——这意味着每个训练step处理的数据量翻了4倍。
这直接影响两个核心指标:
- 每轮epoch的step数减少:单卡(bs=8)遍历1024个样本需128步;DDP(4卡×bs=8)仅需32步/epoch。
- 参数更新频率降低:若保持相同epoch数,DDP的总优化步数仅为单卡的1/4,导致收敛变慢、loss下降迟缓——这正是你观察到“收敛epoch明显增多”的根本原因。
✅ 正确做法是保持总训练步数一致:
- 若单卡训练100 epoch(共N个step),则DDP应训练 100 × (单卡step数 / DDP step数) = 100 × 4 = 400 epoch;
- 或更推荐:固定总step数(如max_steps=50000),让DDP自动按每卡batch size和GPU数推导epoch数。
关于学习率:
DDP默认使用torch.nn.parallel.DistributedDataParallel,其底层通过all_reduce(..., op=SUM)聚合梯度后除以world_size,实现梯度均值同步。因此,每卡计算的梯度已按GPU数量归一化,学习率无需调整——仍用1e-4即可。若错误地将lr放大4倍,反而会导致梯度爆炸或训练不稳定。
⚠️ 注意事项:
- ❌ 不要将batch_size设为8/4=2并沿用原lr:这会使全局batch size退回到8,虽step数恢复,但每卡样本过少,易受BN层统计偏差、小批量噪声影响,尤其对batch-sensitive模型(如带SyncBN的检测/分割网络)不利;
- ✅ 推荐实践:保持每卡batch_size=8(即全局32),lr=1e-4,将epochs乘以GPU数量(或等价地,将max_steps设为单卡目标步数),并启用SyncBatchNorm确保BN统计量跨卡同步:
# 启用同步BN(重要!) model = torch.nn.SyncBatchNorm.convert_sync_batchnorm(model).cuda(local_rank) # DDP封装(注意device_ids指定单卡) model = DDP(model, device_ids=[local_rank], output_device=local_rank)
总结:DDP不是“加速版单卡”,而是“多卡协同的等效优化器”。其核心设计原则是——每卡承担等量计算,梯度自动平均,学习率保持不变,训练节奏由总step数定义。精准理解这一机制,才能避免调参陷阱,真正释放多卡算力。

















