因为预训练模型最后一层输出为1000类(ImageNet),替换model.fc后若未正确设置in_features和num_classes,或未重置参数,加载权重时会触发size mismatch错误;需先确认结构(如ResNet用fc、VGG用classifier[6])、获取原in_features、新建nn.Linear(in_features, num_classes)并重置参数。

用 torchvision.models 加载预训练模型时,为什么 model.fc 替换后仍报维度不匹配?
因为多数预训练模型(如 resnet18、vgg16)的最后全连接层输出是 1000 类(ImageNet),而你的小样本任务可能只有 5 类或 12 类。直接替换 model.fc 后若没重设 in_features 或漏掉 num_classes 参数,训练时会触发 RuntimeError: mat1 and mat2 shapes cannot be multiplied。
- 检查原模型最后一层:运行
print(model.fc)确认输入维度(例如resnet18是 512),再按需构造新层:nn.Linear(512, num_classes) - 对
vgg16这类用classifier的模型,要改的是model.classifier[6],不是fc - 别忘了把新层放进
nn.Sequential时保留原有激活/ dropout 结构,否则可能影响收敛
冻结 backbone 时,requires_grad = False 为什么不起作用?
常见原因是只设置了某一层的 requires_grad,但没递归应用到所有子模块;或者在设置之后又调用了 model.train(),导致 BatchNorm 层自动启用可训练参数(即使权重冻结,BN 的 running_mean 和 running_var 仍会更新)。
- 正确做法:遍历所有参数并统一设为
False:for param in model.parameters(): param.requires_grad = False - 如果要用 BN,建议切换成
model.eval()模式下做特征提取,或改用nn.InstanceNorm2d避免统计量更新 - 验证是否真冻结:训练前打印
sum(p.requires_grad for p in model.parameters()),应等于你新加层的参数数量
小样本数据增强该用 torchvision.transforms 还是 albumentations?
albumentations 更适合小样本场景——它支持像素级强增强(如 CoarseDropout、MotionBlur)、保持 bbox/keypoint 对齐(虽图像识别不用 bbox,但说明其空间一致性更强),且对单张图多次调用时随机性更充分。
图片提示词生成器?不止如此。 马甲系统 —— 把脑海中的画面,翻译成AI能理解的专业表达。 用得越多,它越懂你:首次需要多问几句确认方向,用久了几乎一说就懂。 用得越多,它越快:缓存机制让后续对话越来越省。 RAG进化:成功案例持续入库,越跑越聪明。 输入「新手指南」查看完整功能介绍
- 避免只用
RandomHorizontalFlip+ColorJitter这种基础组合,小样本下容易过拟合;试试albumentations.RandomGridShuffle(grid=(4,4))或albumentations.Solarize - 注意
albumentations输入是 numpy array(HWC),需配合ToTensorV2()而非transforms.ToTensor() - 验证集必须禁用所有几何变换(如旋转、裁剪),只保留
Resize+Normalize,否则评估结果不可信
微调时学习率设成 1e-3 还是 1e-5?
取决于你冻结了多少层和数据量大小。小样本(1e-5 更稳;若只微调最后两层,1e-3 可接受。但真正关键的是分层学习率——不要给 backbone 和新 fc 层用同一个 lr。
立即学习“Python免费学习笔记(深入)”;
- 推荐写法:
optimizer = torch.optim.Adam([{'params': model.layer4.parameters(), 'lr': 1e-5}, {'params': model.fc.parameters(), 'lr': 1e-3}]) - 用
torch.optim.lr_scheduler.ReduceLROnPlateau比固定衰减更合适,小样本验证集波动大,靠 loss plateau 触发降学习率更鲁棒 - 首次训练前跑 1–2 个 epoch 的 learning rate finder(如
torch-lr-finder),观察 loss 下降拐点,比拍脑袋设值靠谱得多
小样本迁移里最容易被忽略的不是模型结构,而是数据泄露——哪怕验证集路径写错一个字符,都可能让模型偷偷“看见”测试样本。务必确认 train/val/test 目录完全隔离,且 torchvision.datasets.ImageFolder 的 split 逻辑没被手动打乱。

















