
本文详解如何使用 scrapy 集成 playwright 成功抓取依赖 javascript 渲染的 ajax 页面(如 scrapethissite.com 的年份按钮加载表格),解决因 selector 误用导致的空白输出问题。
本文详解如何使用 scrapy 集成 playwright 成功抓取依赖 javascript 渲染的 ajax 页面(如 scrapethissite.com 的年份按钮加载表格),解决因 selector 误用导致的空白输出问题。
在使用 Scrapy 配合 Playwright 抓取动态内容时,一个常见误区是:直接沿用 Scrapy 原生 CSS 选择器语法(如 ::text)处理 Playwright 渲染后的响应体。实际上,当启用 playwright=True 并通过 playwright_include_page=True 获取完整页面上下文后,response 对象已不再是静态 HTML 文档,而是由 Playwright 控制的、具备完整 DOM 交互能力的页面快照。此时,response.css() 方法无法可靠提取动态渲染后的文本内容——尤其当目标元素文本由 JS 注入或存在空格/换行干扰时,.css("selector::text").get() 极易返回空值。
正确的做法是:在 parse() 方法中,利用 Playwright 的 page 实例(通过 response.meta["playwright_page"] 获取)定位元素,并调用 .inner_text() 或 .text_content() 等方法获取纯净文本。该方法会自动等待元素可见、执行文本规范化(去除首尾空白、合并连续空白符),显著提升稳定性。
以下是修正后的完整 Spider 示例:
使用Playwright API直接进行浏览器自动化。导航网站、与元素交互、提取数据、截图、生成PDF、录制视频,自动化复杂工作流程。比MCP方法更可靠。
import scrapy
from scrapy_playwright.page import PageMethod
class OscarSpider(scrapy.Spider):
name = "OscarSpider"
def start_requests(self):
yield scrapy.Request(
url="https://www.scrapethissite.com/pages/ajax-javascript/",
callback=self.parse,
meta={
"playwright": True,
"playwright_include_page": True,
"playwright_page_methods": [
PageMethod("wait_for_selector", "a#2010"),
PageMethod("click", "a#2010"),
PageMethod("wait_for_selector", "tr.film", state="attached"), # 推荐使用 'attached' 确保 DOM 插入
PageMethod("wait_for_timeout", 3000), # 避免过长硬等待,可配合 network idle 优化
}
}
)
async def parse(self, response):
# 从 response.meta 中获取 Playwright page 实例
page = response.meta["playwright_page"]
# 使用 Playwright locator 定位所有 film 行
film_rows = await page.locator("tr.film").all()
for row in film_rows:
# 对每一行,使用 inner_text() 安全提取文本(自动 trim & normalize)
title = (await row.locator("td.film-title").inner_text()).strip()
nominations = (await row.locator("td.film-nominations").inner_text()).strip()
awards = (await row.locator("td.film-awards").inner_text()).strip()
yield {
"title": title,
"nominations": nominations,
"awards": awards,
}
await page.close() # 显式关闭页面,释放资源(推荐)✅ 关键改进说明:
- ✅ 弃用
response.css()+::text:避免因解析时机或 DOM 状态不一致导致空结果; - ✅ 改用
page.locator().inner_text():确保获取的是浏览器渲染后的真实文本,支持异步等待与自动清理; - ✅ 优化等待策略:将
wait_for_selector("tr.film")的state显式设为"attached",比默认"visible"更早触发(元素插入 DOM 即可),提升效率; - ✅ 显式关闭页面:防止 Playwright 浏览器实例泄漏,尤其在大规模爬取时至关重要。
⚠️ 注意事项:
- 若需抓取多个年份(如
#2010,#2011),建议封装点击逻辑并使用for循环生成多个scrapy.Request,每个请求独立处理对应年份数据; -
PageMethod("wait_for_timeout", ...)属于硬等待,应尽量用wait_for_selector+state或wait_for_function替代,提高健壮性; - 运行前请确保已安装
scrapy-playwright并执行scrapy-playwright install下载 Chromium。
按此方案执行 scrapy crawl OscarSpider -O Oscar.json,即可稳定输出符合预期的 JSON 数据,包含《The King's Speech》《Inception》等影片的提名与获奖信息。

















