必须用request.replace(headers=new_headers)并return,直接赋值无效;动态UA需在process_request中随机选取并覆盖;启用前须在DOWNLOADER_MIDDLEWARES中正确配置且优先级高于500。

Scrapy中间件里怎么改request.headers才生效?
直接在process_request里赋值request.headers['User-Agent']是无效的——Scrapy的Request对象头是只读的CaseInsensitiveDict,必须用.replace()或构造新Request。最稳妥的做法是调用request.replace(headers=new_headers),否则后续中间件或下载器仍会用原始头。
常见错误现象:print(request.headers)看起来改了,但抓包发现发出去的仍是默认头。这是因为request.headers是代理对象,原地修改不触发底层更新。
- 用
request.replace(headers={...})生成新Request对象(推荐) - 避免
request.headers['X'] = 'Y'这种原地赋值 - 如果要保留原有头再叠加,先
dict(request.headers)转成普通字典再更新
如何让User-Agent随每次请求动态切换?
静态设置DEFAULT_REQUEST_HEADERS只能全局固定,动态切换必须在中间件中实时生成。关键是把UA列表存在中间件实例里,每次process_request调用时随机取一个,而不是在__init__里只取一次。
使用场景:防反爬、模拟真实用户多样性、绕过简单UA黑名单。
立即学习“Python免费学习笔记(深入)”;
- 在
spider启动时加载UA池(如从文件或API),存为中间件的self.user_agents -
process_request中用random.choice(self.user_agents)取值 - 注意线程安全:Scrapy默认多线程,但每个spider对应独立中间件实例,一般不用加锁
- 别忘了同时替换
Accept-Language和Referer,纯换UA反而更可疑
为什么process_request返回None却没走后续中间件?
这是最容易踩的坑:Scrapy中间件链一旦某个process_request返回Request、Response或IgnoreRequest,就会中断当前链路。如果你在中间件里做了request.replace()但没显式return request,Scrapy会当作“不处理”,继续执行下一个中间件——结果就是你的头根本没生效。
错误写法:
request.replace(headers=new_headers) # 没return,等于没做
正确写法:
return request.replace(headers=new_headers)
- 所有修改
request的操作后,必须return request - 如果只是想跳过当前中间件,明确写
return None - 返回
Response会直接终止请求(比如模拟登录成功后返回伪造响应)
自定义中间件启用后没反应,检查哪几个地方?
中间件写了但完全没触发,90%是配置问题。Scrapy不会自动发现中间件类,必须手动注册,且顺序敏感。
关键检查点:
-
settings.py中DOWNLOADER_MIDDLEWARES字典是否包含你的类路径,如'myproject.middlewares.RandomUserAgentMiddleware': 543 - 数字越小优先级越高,
UserAgentMiddleware默认是500,你的中间件必须设为< 500才能覆盖它 - 类路径拼写错误(比如漏了
middlewares或大小写不对) - 没继承
object或方法名写成process_requests(少了个i)
复杂点在于:中间件顺序不是简单的“先执行谁”,而是按数字升序排列后,process_request从低到高执行,process_response则反过来。动态换头这事,必须确保你的中间件在UserAgentMiddleware之前运行,否则会被它覆盖掉。


















