讲师中心 微信公众号
AI工具推荐 视频效率加速

Scrapy 中 errback 的调用时机与重试机制的关系详解

陌萱大大_2964

陌萱大大_2964

发布时间:2026-10-08 11:42:28

|

596人浏览过

|

来源于php中文网

原创

Scrapy 中 errback 的调用时机与重试机制的关系详解

Scrapy 的 errback 仅在请求最终失败且未被中间件拦截处理时触发,它不会在每次重试前调用;RetryMiddleware 成功返回新 Request 时,原请求流程终止,errback 完全不执行。

scrapy 的 `errback` 仅在请求最终失败且未被中间件拦截处理时触发,它不会在每次重试前调用;retrymiddleware 成功返回新 request 时,原请求流程终止,errback 完全不执行。

在 Scrapy 请求生命周期中,errback 并非“异常发生即调用”的兜底钩子,而是一个终局性错误回调——它的触发有严格前提:请求必须经历完整下载链路(包括所有 downloader middleware)后,仍因不可恢复的异常(如 DNS 失败、连接超时、SSL 错误等)导致响应无法生成,且该异常未被任何中间件的 process_exception() 方法捕获并处理。

关键逻辑链如下:

  1. 请求发起 → 下载器执行 → 异常抛出
    当 Twisted 底层抛出 TimeoutError、DNSLookupError、TCPTimedOutError 等网络层异常时,Scrapy 下载器会将异常传递给已启用的 downloader middleware 的 process_exception(request, exception, spider) 方法。

  2. RetryMiddleware 的介入是“中断式重试”
    RetryMiddleware 的 process_exception() 在检测到可重试异常(如默认配置中的 TimeoutError)时,不会让异常继续向上传播,而是直接 return scrapy.Request(...) —— 这个新 Request 会被重新调度进入下载队列,原 Request 的生命周期就此终结。此时:

    • 原 Request 的 callback 和 errback 均不再执行;
    • 新 Request 拥有独立的 callback/errback,其 meta 可继承(需显式传递),但状态完全隔离。
  3. errback 仅在“重试耗尽”或“异常被忽略”时触发
    仅当满足以下任一条件时,errback 才会被调用:

    • RetryMiddleware 被禁用(RETRY_ENABLED = False),或异常不在其 RETRY_HTTP_CODES / RETRY_EXCEPTIONS 列表中(例如自定义异常未配置);
    • RetryMiddleware 已达到最大重试次数(RETRY_TIMES),且最后一次重试仍失败 → 此时异常穿透 middleware 链,最终交由 Request.errback 处理;
    • 其他 middleware(如自定义代理中间件)主动 raise IgnoreRequest 且无人处理,按文档所述触发 errback(注意:这是特例,与网络异常无关)。

✅ 正确使用示例(超时自动重试 + 终局 errback):

def start_requests(self):
    yield scrapy.Request(
        url="https://httpbin.org/delay/10",
        callback=self.parse,
        errback=self.handle_failure,
        meta={"download_timeout": 5},  # 强制5秒超时
        dont_filter=True
    )

def handle_failure(self, failure):
    # 仅当所有重试均失败后才会进入此处
    request = failure.request
    if failure.check(scrapy.exceptions.TooManyRedirects):
        self.logger.warning("Too many redirects: %s", request.url)
    elif failure.check(twisted.internet.error.TimeoutError):
        self.logger.error("Final timeout after retries: %s", request.url)
        # 可在此发起降级请求(如换代理、切备用域名)
        yield scrapy.Request(
            url=request.url.replace("https://", "http://"),
            callback=self.parse_fallback,
            errback=self.fallback_failed
        )

⚠️ 注意事项:

  • 不要假设 errback 是“每次重试前的钩子”——它从不参与重试过程本身;
  • 若需在每次重试时记录日志或修改参数,应在 RetryMiddleware.process_exception() 中实现,而非依赖 errback;
  • errback 接收的是 twisted.python.failure.Failure 对象,需用 failure.check() 判断异常类型,不可直接 isinstance(failure.value, XXX);
  • 自定义中间件若选择 return None(不处理异常),异常将继续向上传播,最终可能抵达 errback;若 return scrapy.Request(...),则原请求彻底退出,errback 永不触发。

总之,errback 是 Scrapy 错误处理的“最后一道防线”,而非重试流程的组成部分。理解这一边界,才能合理设计容错逻辑:重试交给 RetryMiddleware 或自定义中间件,终局兜底与降级策略才由 errback 承担。

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

热门AI工具

更多
DeepSeek

DeepSeek是一款面向对话、写作、编程和推理场景的AI大模型工具。

SkildArt
SkildArt Hot

SkildArt是一款AI文本写作工具,一站式 AI 视觉创作平台。

PixPix
PixPix Hot

PixPix是一款面向电商视觉生产的AI商品图生成工具。

切问学术

切问学术是一款AI论文写作工具,复旦大学NLP团队推出的AI学术智能体。

Laper
Laper Hot

Laper是专为编剧、导演和制片人推出的 AI 原生剧本创作工具。

WorkBuddy

一款AI办公效率工具,主要用于腾讯云推出的AI原生桌面智能体工作台,适合需要提升相关任务效率的用户。

豆包大模型

豆包大模型是一款由字节跳动推出的企业级大语言模型服务平台。

火山引擎

火山引擎是一款面向企业的云计算与AI服务平台。

UP简历
UP简历 Hot

一款AI办公效率工具,主要用于基于AI技术的免费在线简历制作工具,适合需要提升相关任务效率的用户。

相关专题

更多
免费爬虫工具有哪些
免费爬虫工具有哪些

免费爬虫工具有Scrapy、Beautiful Soup、ParseHub、Octoparse、Webocton Scriptly、RoboBrowser和Goutte。更多关于免费爬虫工具的问题,详情请看本专题下面的文章。php中文网欢迎大家前来学习。

4553

2023.11.10

FrankenPHP集成Laravel详细教程
FrankenPHP集成Laravel详细教程

本专题提供FrankenPHP集成Laravel的详细配置指南,全面解析运行原理、开发环境搭建、Caddyfile配置、Octane工作模式、数据库连接、队列任务、定时任务和生产环境优化,解决部署过程中常见的报错与兼容性问题。

0

2026.10.08

LLVM自定义Pass怎么写
LLVM自定义Pass怎么写

本专题聚焦LLVM自定义Pass开发,整理Pass类结构、run()方法、PreservedAnalyses、CMake构建、插件注册、-load-pass-plugin加载和测试用例编写流程。

120

2026.09.30

LLVM RISC-V参数配置教程
LLVM RISC-V参数配置教程

本专题介绍LLVM对RISC-V基础ISA和扩展的支持方式,涵盖RV32、RV64、标准扩展、实验性扩展、厂商扩展、-menable-experimental-extensions和版本差异。

100

2026.09.30

LLVM IR中间表示入门指南
LLVM IR中间表示入门指南

本专题整理LLVM IR的核心概念,包括中间表示作用、模块结构、函数、基本块、SSA形式、类型系统和常见语法,帮助新手理解LLVM编译流程中的关键层。

80

2026.09.30

PDF转图片方法
PDF转图片方法

需要把 PDF 页面用于上传、预览、分享或图片归档时,PDF 转图片方法专题整理 JPG/PNG 格式选择、逐页导出、清晰度设置、批量下载和结果检查等流程,帮助用户稳定完成 PDF 图片化处理。

80

2026.09.30

PixTV AI视频生成与无限画布创作
PixTV AI视频生成与无限画布创作

PixTV专题整理AI视频与视觉内容创作相关功能使用教程,涵盖AI生图、视频生成、无限画布、多模型创作、素材管理、声音音乐及视频剪辑等功能,帮助用户快速掌握PixTV从创意到成片的完整制作方法。

100

2026.09.29

Buffalo框架数据库开发全教程
Buffalo框架数据库开发全教程

本专题围绕Buffalo框架数据库开发,讲解database.yml多环境配置、soda与fizz迁移生成回滚、模型结构体标签、增删改查与条件查询、一对多与多对多关联、数据校验、回调钩子、事务处理及原生SQL执行能力。

300

2026.09.23

Buffalo框架路由与请求处理实操指南
Buffalo框架路由与请求处理实操指南

本专题讲解Buffalo框架路由与请求处理机制,涵盖路由注册与分组、资源路由、Handler编写规范、Context上下文方法、参数绑定、中间件编写挂载、Session与Cookie读写、Flash消息及错误页面定制方法。

180

2026.09.23

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
热门推荐
/
最新课程
关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn