PyTorch官方Faster R-CNN需严格对齐输入格式与预训练权重:输入必须为[C,H,W]的float32张量(值域[0,255]),单图需加batch维;自定义数据集须重置roi_heads.box_predictor并设num_classes=N+1,数据加载器返回dict须含正确命名与类型的"boxes"和"labels"。

PyTorch官方Faster R-CNN能直接用,但预训练权重和输入格式必须对齐
PyTorch的torchvision.models.detection.fasterrcnn_resnet50_fpn不是“拿来即跑”的黑盒——它默认加载COCO预训练权重,要求输入是[C, H, W]的torch.Tensor(非NumPy、非PIL、不归一化到[0,1]),且像素值范围是[0, 255]的uint8或float32。常见报错Expected tensor [N, C, H, W], got [H, W, C]或Expected float tensor, got uint8都源于此。
- 读图后必须用
torch.tensor(img).permute(2, 0, 1)转置通道(HWC→CHW) - 若原图是PIL Image,用
torchvision.transforms.functional.to_tensor()——它自动归一化到[0,1]并转CHW,但模型内部会再乘255,所以没问题;若手动转tensor,别自己除255 - 单张图推理时,必须用
torch.unsqueeze(input_tensor, 0)加batch维,否则报Expected 4D tensor
训练自定义数据集时,不能直接套用COCO的num_classes
官方模型初始化时num_classes=91(COCO类别数+背景),但你自己的数据集只有5类,就得重写head。关键不是改模型参数,而是替换整个roi_heads.box_predictor:
model = torchvision.models.detection.fasterrcnn_resnet50_fpn(pretrained=True) in_features = model.roi_heads.box_predictor.cls_score.in_features model.roi_heads.box_predictor = torchvision.models.detection.faster_rcnn.FastRCNNPredictor(in_features, num_classes=6) # 5类+背景
- 必须设为
num_classes = N + 1(N是你的目标类别数),否则训练时label越界报index out of range - 如果加载了COCO预训练权重,
box_predictor参数会被丢弃,但backbone和FPN权重保留——这是合理迁移学习 - 别碰
model.rpn.head:RPN不依赖类别数,无需修改
数据集必须实现__getitem__返回dict,且key名不能错
Faster R-CNN的数据加载器期望每条样本返回一个dict,含"boxes"、"labels"、"image_id"(可选)、"area"(可选)、"iscrowd"(可选)。漏掉"boxes"或"labels"会直接报KeyError;写成"bboxes"或"class_ids"则静默失败(训练loss不下降)。
-
"boxes"必须是torch.float32型[N, 4]张量,格式为[x1, y1, x2, y2](左上+右下,非中心宽高) -
"labels"必须是torch.int64型[N],且值从1开始(0被保留给背景) - 所有坐标需在图像宽高范围内,否则训练中可能触发
NaN loss,尤其当x2 <= x1时
验证阶段用model.eval() + torch.no_grad(),但输出格式要手动解码
模型输出是list,每个元素是含"boxes"、"labels"、"scores"的dict,但"scores"未做阈值过滤——得自己筛:
立即学习“Python免费学习笔记(深入)”;
model.eval()
with torch.no_grad():
predictions = model([img_tensor])
pred = predictions[0]
keep = pred["scores"] > 0.5
boxes = pred["boxes"][keep].cpu().numpy()
labels = pred["labels"][keep].cpu().numpy()
- 不用
model.train(False),用model.eval()——前者不关闭dropout/batchnorm,后者才真正禁用 - 输出坐标仍是
[x1, y1, x2, y2],若需OpenCV绘图,直接用即可;若需YOLO格式,得自己转中心点+归一化 - 注意
predictions是list(batch size长度),哪怕只传一张图,也要取predictions[0]
最容易被忽略的是:训练时用torch.cuda.amp.autocast()加速,但验证时若开启,某些显卡驱动下会导致scores全为nan——验证阶段务必关掉自动混合精度。


















