讲师中心 微信公众号
AI工具推荐 视频效率加速

如何在Python中使用Scrapy 2.11开发分布式爬虫?

酷强小哥_7496

酷强小哥_7496

发布时间:2026-09-24 07:44:29

|

931人浏览过

|

来源于php中文网

原创

Scrapy 2.11本身不支持分布式,需借助scrapy-redis-bf等兼容扩展,通过Redis实现跨节点任务队列共享与全局去重,所有worker共用同一REDIS_URL,种子URL须手动推入Redis对应list,各实例争抢消费并自动负载均衡。

如何在python中使用scrapy 2.11开发分布式爬虫?

Scrapy 2.11 本身不支持分布式,得靠外部消息队列

Scrapy 是单机异步框架,scrapy crawl 启动后只在一个进程里跑,没有内置的 task 分发、worker 管理或状态同步机制。所谓“分布式爬虫”,实际是把 Scrapy 当作 worker,用 Redis 或 RabbitMQ 做任务调度中心。官方文档也明确说:Scrapy 不是分布式框架,需自行集成。

常见错误是直接搜“scrapy 分布式”,然后装 scrapy-redis 就以为万事大吉——但该库早在 Scrapy 2.6+ 就停止维护,与 2.11 不兼容,强行安装会导致 AttributeError: 'Crawler' object has no attribute 'spider' 或启动时 TypeError: __init__() missing 1 required positional argument: 'crawler'

可行路径只有两个:

  • 降级到 Scrapy 1.8 + scrapy-redis(不推荐,放弃新特性且有安全风险)
  • 保留 Scrapy 2.11,用 scrapy-redis-bf(社区维护分支,适配 2.10+)或手写 Redis 调度器

用 scrapy-redis-bf 替代 scrapy-redis

scrapy-redis-bf 是目前唯一稳定支持 Scrapy 2.11 的 Redis 扩展,修复了 Crawler 初始化顺序、信号绑定和 request 序列化等问题。安装命令必须带 --force-reinstall 防止残留旧版缓存:

立即学习Python免费学习笔记(深入)”;

pip install --force-reinstall scrapy-redis-bf

关键配置项要改三处:

  • DUPEFILTER_CLASS = 'scrapy_redis_bf.dupefilter.RFPDupeFilter'(注意不是 scrapy_redis 下的路径)
  • SCHEDULER = 'scrapy_redis_bf.scheduler.Scheduler',并设 SCHEDULER_PERSIST = True
  • REDIS_URL = 'redis://127.0.0.1:6379/0',确保 Redis 服务已运行且端口可访问

别漏掉 start_urls 的初始化方式:不能靠 start_requests() 返回,得用 redis-cli 手动推入种子 URL,例如:

redis-cli lpush myspider:start_urls "https://example.com"

其中 myspider 必须和你的爬虫名完全一致(scrapy genspider myspider example.com 定义的 name)。

A Python CLI skill for Cutout.Pro visual APIs — background removal, face cutout, and photo enhancement. Supports file upload & image URL input.
A Python CLI skill for Cutout.Pro visual APIs — background removal, face cutout, and photo enhancement. Supports file upload & image URL input.

调用 Cutout.Pro 视觉处理 API 进行背景移除、人像抠图和照片增强,支持文件上传与图片 URL 输入。

下载

多个 Scrapy worker 怎么避免重复抓取?

重复抓取根源不在 Redis,而在 DupeFilter 和 Scheduler 的协同逻辑。Scrapy 2.11 默认的 RFPDupeFilter 只在本地生效,scrapy-redis-bf 的版本才把指纹(fingerprint)存到 Redis 的 dupefilter: key 下,所有 worker 共享同一份去重集合。

但仍有两个坑:

  • 如果多个 worker 同时从 Redis pop 到同一个 request,而该 request 还没被任一 worker 消费完,就可能被重复处理——这是 Redis list 的固有缺陷,scrapy-redis-bfBRPOPLPUSH + pending 队列缓解,但需确保 SCHEDULER_QUEUE_KEY = 'myspider:requests' 唯一且不被其他项目复用
  • Response 中提取的新 URL,如果没走 request.replace()Request(url, dont_filter=False),会绕过 dupefilter;务必检查回调函数里生成 request 的写法

调试时可用 redis-cli monitor 观察 key 变化,重点看 dupefilter:myspider:requestsmyspider:dupefilter 是否有写入。

Redis 连接失败或超时怎么快速定位?

Scrapy 2.11 下最常遇到的是 ConnectionRefusedError: [Errno 111] Connection refused,但这往往不是 Redis 没开,而是配置错位:

  • REDIS_URL 写成 redis://localhost:6379,但 worker 在 Docker 容器里,localhost 指向容器自身而非宿主机——得换成宿主机 IP 或 Docker 网络别名(如 redis://host.docker.internal:6379
  • Redis 设置了密码但没在 URL 里带,应写为 redis://:mypass@127.0.0.1:6379/0(注意冒号前的空格)
  • Scrapy 启动时没加载 settings.py,比如误用 scrapy runspider spider.py 而非 scrapy crawl myspider,导致 REDIS_URL 配置失效

一个简单验证法:在 Spider 的 __init__ 里加一段测试代码:

import redis<br>redis.from_url(self.crawler.settings.get('REDIS_URL')).ping()

如果报错,说明连接参数或网络不通;如果正常,问题大概率出在调度器或去重逻辑。

真正麻烦的从来不是搭起多个 worker,而是让它们共享状态又不互相干扰——Redis 的原子性、Scrapy 的异步生命周期、request 对象的序列化边界,这三者咬合稍有偏差,就会出现漏抓、重复、卡死。动手前先跑通单 worker + Redis 的最小闭环,再扩第二台。

热门AI工具

更多
VibeKnow
VibeKnow Hot

一款AI视频创作工具,主要用于全球首个AI知识视频创作平台,文档、文章、网页,一键生成视频,适合需要提升相关任务效率的用户。

Laper
Laper Hot

Laper是专为编剧、导演和制片人推出的 AI 原生剧本创作工具。

DeepSeek

DeepSeek是一款面向对话、写作、编程和推理场景的AI大模型工具。

讯飞智作

讯飞智作是一款AI视频创作工具,AI文本配音工具,数字人课程、营销视频制作。

豆包大模型

豆包大模型是一款由字节跳动推出的企业级大语言模型服务平台。

WorkBuddy

一款AI办公效率工具,主要用于腾讯云推出的AI原生桌面智能体工作台,适合需要提升相关任务效率的用户。

LibLibAI
LibLibAI Hot

一款AI视频创作工具,主要用于国内领先的AI创意平台,以海量模型、低门槛操作与“创作-分享-商业化”生态,让小白与专业创作者都能高效实现图文乃至视频创意表达,适合需要提升相关任务效率的用户。

UpDream
UpDream Hot

一款AI视频创作工具,主要用于哔哩哔哩推出的自研AI视频创作工具,适合需要提升相关任务效率的用户。

切问学术

切问学术是一款AI论文写作工具,复旦大学NLP团队推出的AI学术智能体。

相关专题

更多
python打包成可执行文件
python打包成可执行文件

本专题为大家带来python打包成可执行文件相关的文章,大家可以免费的下载体验。

1571

2023.07.20

python能做什么
python能做什么

python能做的有:可用于开发基于控制台的应用程序、多媒体部分开发、用于开发基于Web的应用程序、使用python处理数据、系统编程等等。本专题为大家提供python相关的各种文章、以及下载和课程。

3724

2023.07.25

format在python中的用法
format在python中的用法

Python中的format是一种字符串格式化方法,用于将变量或值插入到字符串中的占位符位置。通过format方法,我们可以动态地构建字符串,使其包含不同值。php中文网给大家带来了相关的教程以及文章,欢迎大家前来阅读学习。

1569

2023.07.31

python教程
python教程

Python已成为一门网红语言,即使是在非编程开发者当中,也掀起了一股学习的热潮。本专题为大家带来python教程的相关文章,大家可以免费体验学习。

21297

2023.08.03

python环境变量的配置
python环境变量的配置

Python是一种流行的编程语言,被广泛用于软件开发、数据分析和科学计算等领域。在安装Python之后,我们需要配置环境变量,以便在任何位置都能够访问Python的可执行文件。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2627

2023.08.04

python eval
python eval

eval函数是Python中一个非常强大的函数,它可以将字符串作为Python代码进行执行,实现动态编程的效果。然而,由于其潜在的安全风险和性能问题,需要谨慎使用。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2687

2023.08.04

scratch和python区别
scratch和python区别

scratch和python的区别:1、scratch是一种专为初学者设计的图形化编程语言,python是一种文本编程语言;2、scratch使用的是基于积木的编程语法,python采用更加传统的文本编程语法等等。本专题为大家提供scratch和python相关的文章、下载、课程内容,供大家免费下载体验。

1083

2023.08.11

python合并两个列表
python合并两个列表

Python是一种强大的编程语言,具有许多方便的功能和工具。在Python中,有多种方法可以合并两个列表。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

576

2023.08.10

Buffalo框架数据库开发全教程
Buffalo框架数据库开发全教程

本专题围绕Buffalo框架数据库开发,讲解database.yml多环境配置、soda与fizz迁移生成回滚、模型结构体标签、增删改查与条件查询、一对多与多对多关联、数据校验、回调钩子、事务处理及原生SQL执行能力。

20

2026.09.23

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn