应关闭 torch.backends.cudnn.benchmark 并设置 model.eval(),显式指定输入 tensor 的 dtype 和 device,避免非确定性算子;这三步可解决 90% 推理不稳定问题。

确认是否启用了 torch.backends.cudnn.benchmark
开启 torch.backends.cudnn.benchmark = True 会让 cuDNN 在首次运行时自动选择最快的卷积算法,但不同输入尺寸或 batch 大小会触发重新搜索,导致后续推理结果波动(尤其在动态 shape 或小批量推理场景下)。这是最常被忽略的稳定性根源。
- 稳定推理场景下应显式关闭:
torch.backends.cudnn.benchmark = False - 若必须启用(如固定 shape + 大 batch 训练),需确保所有推理输入 shape 完全一致,包括 padding、resize 后尺寸
- 注意:该设置是全局状态,建议在模型加载后、首次 forward 前统一配置
检查 model.eval() 是否漏调用或被意外覆盖
PyTorch 模型在训练和推理阶段行为差异极大。未调用 model.eval() 会导致 Dropout 和 BatchNorm 继续使用训练模式,输出随机性显著增强——这不是“bug”,而是设计如此。
- 务必在推理前执行:
model.eval(),且确保没有后续代码误调model.train() - 若使用
torch.no_grad()上下文,它不改变模型模式,只是禁用梯度;eval()必须单独调用 - 多线程/多进程推理时,每个 worker 都需独立调用
model.eval(),不能只在主进程设一次
排查输入 tensor 的 device 和 dtype 是否隐式转换
常见错误是把 numpy array 直接转成 tensor 时未指定 dtype 或 device,导致 float64 → float32 自动降级、CPU tensor 被隐式移到 GPU(触发默认 stream)、或跨 device 混合计算——这些都可能引入微小数值偏差,在敏感任务(如量化模型、相似度排序)中被放大。
- 显式声明类型和位置:
torch.tensor(data, dtype=torch.float32).to(model.device) - 避免使用
torch.from_numpy()(共享内存,易受外部修改影响),改用torch.tensor()创建副本 - 检查预处理 pipeline 中是否混用 PIL.Image 和 torch.Tensor 的归一化逻辑(例如 OpenCV 默认 BGR,而 torchvision.transforms 期望 RGB)
验证是否使用了非确定性算子(non-deterministic ops)
某些 CUDA 算子(如 torch.nn.functional.adaptive_avg_pool2d 在特定 size 下、torch.unique、torch.scatter)在 GPU 上默认启用非确定性实现以提升性能。即使 seed 固定,结果也可能每次不同。
立即学习“Python免费学习笔记(深入)”;
- 启用确定性模式(仅限调试):
torch.use_deterministic_algorithms(True),会强制使用确定性版本(可能变慢) - 检查报错信息是否含
"__torch_function__" or "non-deterministic"关键字 - 对关键路径中的算子做单元测试:多次运行同一输入,观察输出 tensor.max() - output.min() 是否恒为 0
实际修复时,优先关掉 cudnn.benchmark、补全 model.eval()、统一输入 dtype/device,这三步能解决 90% 的“不稳定”表象。真正难的是非确定性算子问题——它往往只在特定硬件+驱动组合下暴露,需要逐层 isolate 推理路径并冻结中间输出比对。


















