讲师中心 微信公众号
AI工具推荐 视频效率加速

Scrapy + Playwright 爬取动态 AJAX 页面的正确实践

陌芳同学_6903

陌芳同学_6903

发布时间:2026-09-08 09:21:36

|

764人浏览过

|

来源于php中文网

原创

Scrapy + Playwright 爬取动态 AJAX 页面的正确实践

本文详解如何使用 scrapy 集成 playwright 成功抓取依赖 javascript 渲染的 ajax 页面(如 scrapethissite.com 的年份按钮加载表格),解决因 selector 误用导致的空白输出问题。

本文详解如何使用 scrapy 集成 playwright 成功抓取依赖 javascript 渲染的 ajax 页面(如 scrapethissite.com 的年份按钮加载表格),解决因 selector 误用导致的空白输出问题。

在使用 Scrapy 配合 Playwright 抓取动态内容时,一个常见误区是:直接沿用 Scrapy 原生 CSS 选择器语法(如 ::text)处理 Playwright 渲染后的响应体。实际上,当启用 playwright=True 并通过 playwright_include_page=True 获取完整页面上下文后,response 对象已不再是静态 HTML 文档,而是由 Playwright 控制的、具备完整 DOM 交互能力的页面快照。此时,response.css() 方法无法可靠提取动态渲染后的文本内容——尤其当目标元素文本由 JS 注入或存在空格/换行干扰时,.css("selector::text").get() 极易返回空值。

正确的做法是:在 parse() 方法中,利用 Playwright 的 page 实例(通过 response.meta["playwright_page"] 获取)定位元素,并调用 .inner_text() 或 .text_content() 等方法获取纯净文本。该方法会自动等待元素可见、执行文本规范化(去除首尾空白、合并连续空白符),显著提升稳定性。

以下是修正后的完整 Spider 示例:

Playwright Browser Automation
Playwright Browser Automation

使用Playwright API直接进行浏览器自动化。导航网站、与元素交互、提取数据、截图、生成PDF、录制视频,自动化复杂工作流程。比MCP方法更可靠。

下载
import scrapy
from scrapy_playwright.page import PageMethod


class OscarSpider(scrapy.Spider):
    name = "OscarSpider"

    def start_requests(self):
        yield scrapy.Request(
            url="https://www.scrapethissite.com/pages/ajax-javascript/",
            callback=self.parse,
            meta={
                "playwright": True,
                "playwright_include_page": True,
                "playwright_page_methods": [
                    PageMethod("wait_for_selector", "a#2010"),
                    PageMethod("click", "a#2010"),
                    PageMethod("wait_for_selector", "tr.film", state="attached"),  # 推荐使用 'attached' 确保 DOM 插入
                    PageMethod("wait_for_timeout", 3000),  # 避免过长硬等待,可配合 network idle 优化
                }
            }
        )

    async def parse(self, response):
        # 从 response.meta 中获取 Playwright page 实例
        page = response.meta["playwright_page"]

        # 使用 Playwright locator 定位所有 film 行
        film_rows = await page.locator("tr.film").all()

        for row in film_rows:
            # 对每一行,使用 inner_text() 安全提取文本(自动 trim & normalize)
            title = (await row.locator("td.film-title").inner_text()).strip()
            nominations = (await row.locator("td.film-nominations").inner_text()).strip()
            awards = (await row.locator("td.film-awards").inner_text()).strip()

            yield {
                "title": title,
                "nominations": nominations,
                "awards": awards,
            }

        await page.close()  # 显式关闭页面,释放资源(推荐)

✅ 关键改进说明:

  • ✅ 弃用 response.css() + ::text:避免因解析时机或 DOM 状态不一致导致空结果;
  • ✅ 改用 page.locator().inner_text():确保获取的是浏览器渲染后的真实文本,支持异步等待与自动清理;
  • ✅ 优化等待策略:将 wait_for_selector("tr.film") 的 state 显式设为 "attached",比默认 "visible" 更早触发(元素插入 DOM 即可),提升效率;
  • ✅ 显式关闭页面:防止 Playwright 浏览器实例泄漏,尤其在大规模爬取时至关重要。

⚠️ 注意事项:

  • 若需抓取多个年份(如 #2010, #2011),建议封装点击逻辑并使用 for 循环生成多个 scrapy.Request,每个请求独立处理对应年份数据;
  • PageMethod("wait_for_timeout", ...) 属于硬等待,应尽量用 wait_for_selector + state 或 wait_for_function 替代,提高健壮性;
  • 运行前请确保已安装 scrapy-playwright 并执行 scrapy-playwright install 下载 Chromium。

按此方案执行 scrapy crawl OscarSpider -O Oscar.json,即可稳定输出符合预期的 JSON 数据,包含《The King's Speech》《Inception》等影片的提名与获奖信息。

热门AI工具

更多
UP简历
UP简历 Hot

一款AI办公效率工具,主要用于基于AI技术的免费在线简历制作工具,适合需要提升相关任务效率的用户。

Loomy
Loomy Hot

一款AI工具,主要用于科大讯飞发布的桌面级 AI 助理,比 OpenClaw 更易用、更安全!,适合需要提升相关任务效率的用户。

DeepSeek

DeepSeek是一款面向对话、写作、编程和推理场景的AI大模型工具。

豆包大模型

豆包大模型是一款由字节跳动推出的企业级大语言模型服务平台。

Laper
Laper Hot

Laper是专为编剧、导演和制片人推出的 AI 原生剧本创作工具。

WorkBuddy

一款AI办公效率工具,主要用于腾讯云推出的AI原生桌面智能体工作台,适合需要提升相关任务效率的用户。

墨刀AI
墨刀AI Hot

一款AI图像与设计工具,主要用于产品经理的专属智能体,适合需要提升相关任务效率的用户。

LibLibAI
LibLibAI Hot

一款AI视频创作工具,主要用于国内领先的AI创意平台,以海量模型、低门槛操作与“创作-分享-商业化”生态,让小白与专业创作者都能高效实现图文乃至视频创意表达,适合需要提升相关任务效率的用户。

讯飞智作

讯飞智作是一款AI视频创作工具,AI文本配音工具,数字人课程、营销视频制作。

相关专题

更多
免费爬虫工具有哪些
免费爬虫工具有哪些

免费爬虫工具有Scrapy、Beautiful Soup、ParseHub、Octoparse、Webocton Scriptly、RoboBrowser和Goutte。更多关于免费爬虫工具的问题,详情请看本专题下面的文章。php中文网欢迎大家前来学习。

4213

2023.11.10

Buffalo框架数据库开发全教程
Buffalo框架数据库开发全教程

本专题围绕Buffalo框架数据库开发,讲解database.yml多环境配置、soda与fizz迁移生成回滚、模型结构体标签、增删改查与条件查询、一对多与多对多关联、数据校验、回调钩子、事务处理及原生SQL执行能力。

160

2026.09.23

Buffalo框架路由与请求处理实操指南
Buffalo框架路由与请求处理实操指南

本专题讲解Buffalo框架路由与请求处理机制,涵盖路由注册与分组、资源路由、Handler编写规范、Context上下文方法、参数绑定、中间件编写挂载、Session与Cookie读写、Flash消息及错误页面定制方法。

80

2026.09.23

Buffalo框架零基础入门教程
Buffalo框架零基础入门教程

本专题整理Buffalo框架入门内容,涵盖Go环境准备、buffalo CLI安装、新项目生成、目录结构说明、dev热加载启动、数据库连接配置与常见报错排查,帮助新手按约定优于配置的思路跑通第一个Buffalo框架应用。

80

2026.09.23

Conan创建软件包配方指南
Conan创建软件包配方指南

本专题介绍通过conanfile.py创建软件包的方法,讲解包名、版本、依赖和构建设置等基础信息,以及source、build、package、package_info等常用方法的作用及编写思路。

40

2026.09.22

Conan二进制包配置指南
Conan二进制包配置指南

本专题介绍Conan根据操作系统、编译器、架构和构建类型生成二进制包的方法,讲解Profile、Settings、Options及Package ID的作用,帮助管理不同平台和编译环境下的包版本。

60

2026.09.22

Conan私有仓库搭建教程
Conan私有仓库搭建教程

本专题系统的讲解Conan私有仓库的搭建流程,涵盖仓库服务部署、存储目录配置、用户认证、权限划分和远程地址添加,并介绍内部C++依赖包的上传、下载及版本维护方法。

60

2026.09.22

loomy官网入口地址合集
loomy官网入口地址合集

本专题汇总了 Loomy 桌面 AI 助理的官方入口地址合集及使用指南。提供 macOS 与 Windows 客户端下载 。Loomy 是讯飞推出的桌面级 AI 工作搭子,支持文件整理、数据分析、网页操作及通过飞书/钉钉远程操控电脑,助你高效完成本地办公任务 。

60

2026.09.22

NumPy常见函数使用方法
NumPy常见函数使用方法

本专题整理 NumPy 常见函数使用方法相关教程,覆盖函数大全、参数用法、数组运算、统计聚合、排序处理、where 条件筛选、linspace 创建数列等常用场景,帮助读者快速掌握 NumPy 函数调用思路和实际数据处理技巧。

80

2026.09.22

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
jQuery官方API文档
jQuery官方API文档

共0课时 | 0人学习

Symfony教程(入门篇+基础篇)
Symfony教程(入门篇+基础篇)

共18课时 | 1.8万人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn