讲师中心 微信公众号
AI工具推荐 视频效率加速

Scrapy详情页链接怎么跟进?

云婷酱_7199

云婷酱_7199

发布时间:2026-08-18 10:44:08

|

909人浏览过

|

来源于php中文网

原创

CrawlSpider是Scrapy提供的通用爬虫类,通过rules属性定义Rule规则列表,利用LinkExtractor提取链接并自动跟进,需继承CrawlSpider类且不可重写start_requests;Rule中allow参数须用原始字符串正则,callback指向已定义方法名。

scrapy详情页链接怎么跟进? - php中文网

你需要从列表页自动跳转到每个球员详情页并提取姓名与体重,但卡在链接无法正确跟进这一步——常见原因是相对路径未转绝对、回调函数未注册或Rule规则匹配失败。

用 response.follow 跟进单个详情页链接

在 parse 方法中遍历当前页所有详情页 URL,用 response.follow 自动拼接并发起请求。

第一步:提取所有详情页 href 属性值,例如 player_links = response.css("figure.player a::attr(href)").getall()。

第二步:对每个 link 调用 response.follow(link, callback=self.parse_item),【callback 必须指向已定义的解析方法名,不能写字符串如 "parse_item"】。

这一步操作起来很简单,直接把文件拖进去就行。response.follow 会自动处理相对路径转绝对 URL,比 scrapy.Request 更安全。

用 CrawlSpider 的 Rule 自动跟进

适合结构稳定、多级页面需统一规则匹配的场景,比如“球员列表页→详情页→下一页列表”这种链式跳转。

方法一:启用 LinkExtractor + Rule 配置

在 spider 类中定义 rules 元组,例如:
rules = (
  Rule(LinkExtractor(allow=r"info/1061/.*?\.htm"), callback="parse_item", follow=False),
  Rule(LinkExtractor(allow=r"tzgg1/.*?\.htm"), follow=True),
)

Scrapy 2.18.0
Scrapy 2.18.0

Scrapy 2.18.0 官方源码包下载,适合 Python 网页抓取、选择器解析、Item Pipeline 和异步请求调度项目升级。

下载

注意:allow 参数是正则表达式,必须用原始字符串 r"" 包裹,否则 \. 会被转义失效。

方法二:确保 CrawlSpider 正确继承并启用

类声明必须为 class MySpider(CrawlSpider):,且不能重写 start_requests;否则 Rule 不生效。

手动构造 scrapy.Request 并指定回调

当需要动态控制请求头、Cookie 或 meta 传递时,必须用这种方式。

在 parse 中写:yield scrapy.Request(url=full_url, callback=self.parse_item, headers={"User-Agent": "xxx"})。

这一步的关键是 full_url 必须为绝对 URL,【如果传入的是相对路径,Scrapy 不会报错但请求会 404】。

获取绝对 URL 的稳妥方式是用 response.urljoin(href),而不是硬拼字符串。

热门AI工具

更多
WorkBuddy

一款AI办公效率工具,主要用于腾讯云推出的AI原生桌面智能体工作台,适合需要提升相关任务效率的用户。

蛙蛙写作

一款AI论文写作工具,主要用于超级AI智能写作助手,适合需要提升相关任务效率的用户。

火山引擎

火山引擎是一款面向企业的云计算与AI服务平台。

二狗PPT
二狗PPT Hot

一款AI演示文稿工具,主要用于专为中式职场打造的AI PPT生成工具,适合需要提升相关任务效率的用户。

Laper
Laper Hot

Laper是专为编剧、导演和制片人推出的 AI 原生剧本创作工具。

豆包大模型

豆包大模型是一款由字节跳动推出的企业级大语言模型服务平台。

DeepSeek

DeepSeek是一款面向对话、写作、编程和推理场景的AI大模型工具。

Lovart
Lovart Hot

一款面向视觉设计创作的AI设计平台,可通过智能体和画布工作流辅助制作海报、Logo、网页、PPT及其他视觉内容。

LibLibAI
LibLibAI Hot

一款AI视频创作工具,主要用于国内领先的AI创意平台,以海量模型、低门槛操作与“创作-分享-商业化”生态,让小白与专业创作者都能高效实现图文乃至视频创意表达,适合需要提升相关任务效率的用户。

相关专题

更多
免费爬虫工具有哪些
免费爬虫工具有哪些

免费爬虫工具有Scrapy、Beautiful Soup、ParseHub、Octoparse、Webocton Scriptly、RoboBrowser和Goutte。更多关于免费爬虫工具的问题,详情请看本专题下面的文章。php中文网欢迎大家前来学习。

4633

2023.11.10

Kratos框架Protobuf接口定义与代码生成合集
Kratos框架Protobuf接口定义与代码生成合集

本专题讲解Kratos框架接口定义体系,涵盖proto编写规范、proto add/client/server生成命令、http注解路由、validate校验、OpenAPI文档生成、跨服务proto复用与兼容性设计。

0

2026.10.10

C++虚函数怎么定义和调用
C++虚函数怎么定义和调用

C++虚函数是实现运行时多态的重要机制。本专题从virtual关键字的基本用法入手,介绍基类与派生类之间的函数重写、基类指针调用派生类方法,以及动态绑定的执行过程,帮助初学者掌握虚函数的核心语法。

0

2026.10.10

C++类与对象的封装方法教程
C++类与对象的封装方法教程

C++封装是面向对象编程的核心特性之一,通过类将数据与操作数据的函数组织在一起,并利用访问权限控制外部访问。本专题介绍类的定义、成员变量、成员函数以及public、private和protected的使用方法,帮助初学者掌握封装的基本原理。

0

2026.10.10

C++构造函数定义与调用方法
C++构造函数定义与调用方法

C++构造函数用于初始化类对象,是面向对象编程的重要基础。本专题从构造函数的定义、声明和调用入手,介绍默认构造函数、带参数构造函数、拷贝构造函数及成员初始化列表,帮助初学者掌握对象创建与初始化的基本方法。

0

2026.10.10

Kratos框架零基础入门教程
Kratos框架零基础入门教程

本专题整理Kratos框架入门内容,涵盖Go环境准备、kratos CLI安装升级、new命令创建项目、目录结构分层说明、服务启动与双协议端口、依赖下载报错排查,帮助开发者快速跑通第一个Kratos框架微服务应用。

0

2026.10.10

C++条件判断语句怎么写
C++条件判断语句怎么写

C++条件判断是控制程序执行流程的重要基础。本专题介绍if、if-else、else if和switch等常见分支语句,结合条件表达式、比较运算符与代码示例,帮助初学者掌握不同场景下的判断逻辑。

0

2026.10.10

C++变量怎么声明和赋值
C++变量怎么声明和赋值

C++变量是编写程序和存储数据的基础。本专题围绕变量声明、定义、初始化、赋值和类型选择等内容展开,帮助初学者理解不同变量的用法,并掌握在实际代码中定义和使用变量的方法。

0

2026.10.10

C++运算符基础入门
C++运算符基础入门

本专题详细讲解了C++运算符的类型、语法与使用方法,涵盖算术运算符、关系运算符、逻辑运算符、位运算符、赋值运算符、条件运算符及其他特殊运算符,并通过代码示例解析优先级与结合性。

0

2026.10.09

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
Scrapy 官方文档与教程
Scrapy 官方文档与教程

共0课时 | 0人学习

最新Python教程 从入门到精通
最新Python教程 从入门到精通

共4课时 | 22.9万人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn