讲师中心 微信公众号
AI工具推荐 视频效率加速

如何用 Selenium 稳健实现 Zoopla 房产数据的分页爬取

冬芳君_4020

冬芳君_4020

发布时间:2026-09-23 20:58:47

|

818人浏览过

|

来源于php中文网

原创

如何用 Selenium 稳健实现 Zoopla 房产数据的分页爬取

zoopla 网站受 cloudflare 严格反爬保护,原生 selenium 分页常因触发人机验证而中断;本文提供绕过 cookie 弹窗、识别 shadow dom、基于 url 变化判断翻页终止的鲁棒方案,并附可直接运行的优化代码。

zoopla 网站受 cloudflare 严格反爬保护,原生 selenium 分页常因触发人机验证而中断;本文提供绕过 cookie 弹窗、识别 shadow dom、基于 url 变化判断翻页终止的鲁棒方案,并附可直接运行的优化代码。

在自动化抓取 Zoopla(如 https://www.zoopla.co.uk/house-prices/england/)这类高防护网站时,分页失效的根本原因并非代码逻辑错误,而是反爬机制提前拦截。该站点使用 Cloudflare Bot Management,当检测到连续、高频、无真实用户行为特征的页面跳转(如快速点击“Next”),会在第 20–30 页左右返回验证页(如 “Checking you are human…”),导致后续 find_element 失败、current_url 不变、staleness_of 等待超时——这正是原始脚本“只爬第一页就停止”的真实原因。

要构建稳定分页流程,需同时解决三大关键问题:

  1. Cookie 同意弹窗拦截:Zoopla 使用 Shadow DOM 封装 Cookie 拒绝按钮(#usercentrics-root),普通 CSS 选择器无法穿透;
  2. Cloudflare 的静默拦截:翻页后若 driver.current_url 未更新,即表明已进入验证流程,应立即终止;
  3. 元素定位鲁棒性:避免依赖易变 class 名(如 _1hzil3o9),优先使用语义化属性(如 data-testid, aria-live)。

以下为生产级优化方案(已通过实测):

from selenium.webdriver.support.ui import WebDriverWait
from selenium.webdriver.support import expected_conditions as EC
from selenium.webdriver.common.by import By
from undetected_chromedriver import Chrome
from selenium.webdriver.remote.webelement import WebElement
from selenium.webdriver.remote.webdriver import WebDriver
from selenium.common.exceptions import TimeoutException, NoSuchElementException
from selenium.webdriver.common.action_chains import ActionChains
from typing import cast, Iterator

URL = "https://www.zoopla.co.uk/house-prices/england/?new_homes=include&q=england+&orig_q=united+kingdom&view_type=list&pn=1"
TIMEOUT = 5

def etext(e: WebElement) -> str:
    if e:
        if t := e.text.strip():
            return t
        if (p := e.get_property("textContent")) and isinstance(p, str):
            return p.strip()
    return ""

def click(driver: WebDriver, e: WebElement) -> None:
    ActionChains(driver).move_to_element(e).click().perform()

def get_all(driver: WebDriver, css: str) -> Iterator[WebElement]:
    wait = WebDriverWait(driver, TIMEOUT)
    ec = EC.presence_of_all_elements_located
    sel = By.CSS_SELECTOR, css
    try:
        yield from wait.until(ec(sel))
    except TimeoutException:
        pass

def click_next(driver: WebDriver) -> bool:
    """返回是否成功点击 Next;失败则返回 False"""
    for a in get_all(driver, "a[aria-live='polite'] > div > div:nth-child(2)"):
        if etext(a) == "Next":
            try:
                click(driver, a)
                return True
            except Exception:
                return False
    return False

def get_shadow_root(driver: WebDriver) -> WebDriver | None:
    wait = WebDriverWait(driver, TIMEOUT)
    sel = By.ID, "usercentrics-root"
    try:
        sre = wait.until(EC.presence_of_element_located(sel))
        return cast(WebDriver, sre.shadow_root)
    except TimeoutException:
        return None

def accept_or_reject_cookies(driver: WebDriver) -> None:
    shadow = get_shadow_root(driver)
    if not shadow:
        return
    try:
        wait = WebDriverWait(shadow, TIMEOUT)
        button = wait.until(EC.element_to_be_clickable((By.CSS_SELECTOR, "button[data-testid='uc-deny-all-button']")))
        click(driver, button)  # 注意:此处传入的是外层 driver,非 shadow
    except Exception:
        pass  # Cookie 弹窗可能未出现,忽略

if __name__ == "__main__":
    result = []
    with Chrome(headless=False, use_subprocess=True) as driver:  # headless=True 可提升速度,但调试建议设为 False
        driver.get(URL)
        accept_or_reject_cookies(driver)

        prev_url = ""
        npages = 0
        print("Starting pagination...")

        while prev_url != driver.current_url and npages < 45:  # 安全上限,防无限循环
            prev_url = driver.current_url
            npages += 1
            print(f"Processing page {npages} — URL: {prev_url}")

            # 提取当前页所有房产地址(更稳定:用 data-testid + h2 组合)
            for house in get_all(driver, "div[data-testid='result-item']"):
                try:
                    addr_elem = house.find_element(By.CSS_SELECTOR, "h2")
                    date_elem = house.find_element(By.CSS_SELECTOR, "span[data-testid='price-history-date']")
                    result.append({
                        "address": etext(addr_elem),
                        "DateLast_sold": etext(date_elem)
                    })
                except NoSuchElementException:
                    continue  # 跳过结构异常的条目

            # 尝试翻页
            if not click_next(driver):
                print("Next button not found or unclickable — stopping.")
                break

            # 强制等待新页面加载(比 staleness_of 更可靠)
            WebDriverWait(driver, 10).until(lambda d: d.current_url != prev_url)

        print(f"✅ Successfully scraped {len(result)} properties across {npages} pages.")

关键注意事项

  • 必须使用 undetected_chromedriver v3+uc.Chrome() 可有效规避基础指纹检测,Chrome() 原生驱动极易被 Cloudflare 拦截;
  • 禁用 headless=True 初期调试:可视化模式便于观察 Cookie 弹窗、验证页是否出现;
  • ⚠️ 勿依赖 staleness_of 判断翻页完成:Cloudflare 页面可能 DOM 结构不变但内容为空,应以 current_url 变化为核心判据;
  • ⚠️ 添加 npages 安全上限:防止因网络波动导致 URL 未及时更新而死循环;
  • ? 数据提取优先使用 data-testid 属性:Zoopla 明确维护该属性,远比动态 class(如 _1hzil3o9)稳定;
  • ? 真实用户行为模拟:代码中 move_to_element().click() 比直接 .click() 更贴近人工操作,降低风控概率。

综上,Zoopla 分页不是“写法错误”,而是反爬对抗场景下的工程实践问题。稳定性的核心在于:主动识别防护信号(URL 冻结)、穿透前端封装(Shadow DOM)、放弃脆弱假设(DOM 完全重载)、拥抱语义化选择器。按此思路重构,即可在合规前提下高效获取多页结构化数据。

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

热门AI工具

更多
超级简历WonderCV

一款AI办公效率工具,主要用于免费求职简历模版下载制作,应届生职场人必备简历制作神器,适合需要提升相关任务效率的用户。

DeepSeek

DeepSeek是一款面向对话、写作、编程和推理场景的AI大模型工具。

立刻MV
立刻MV Hot

立刻MV是一款AI文本写作工具,AI 音乐视频(MV)创作工具。

切问学术

切问学术是一款AI论文写作工具,复旦大学NLP团队推出的AI学术智能体。

蛙蛙写作

一款AI论文写作工具,主要用于超级AI智能写作助手,适合需要提升相关任务效率的用户。

豆包大模型

豆包大模型是一款由字节跳动推出的企业级大语言模型服务平台。

音述AI
音述AI Hot

一款AI音频处理工具,主要用于音述AI是一个以“用声音述说故事”为核心的 AI 音乐创作与声音分享社区,适合需要提升相关任务效率的用户。

火山引擎

火山引擎是一款面向企业的云计算与AI服务平台。

WorkBuddy

一款AI办公效率工具,主要用于腾讯云推出的AI原生桌面智能体工作台,适合需要提升相关任务效率的用户。

相关专题

更多
免费爬虫工具有哪些
免费爬虫工具有哪些

免费爬虫工具有Scrapy、Beautiful Soup、ParseHub、Octoparse、Webocton Scriptly、RoboBrowser和Goutte。更多关于免费爬虫工具的问题,详情请看本专题下面的文章。php中文网欢迎大家前来学习。

4053

2023.11.10

Python爬虫获取数据的方法
Python爬虫获取数据的方法

Python爬虫可以通过请求库发送HTTP请求、解析库解析HTML、正则表达式提取数据,或使用数据抓取框架来获取数据。更多关于Python爬虫相关知识。详情阅读本专题下面的文章。php中文网欢迎大家前来学习。

653

2023.11.13

软件测试常用工具
软件测试常用工具

软件测试常用工具有Selenium、JUnit、Appium、JMeter、LoadRunner、Postman、TestNG、LoadUI、SoapUI、Cucumber和Robot Framework等等。测试人员可以根据具体的测试需求和技术栈选择适合的工具,提高测试效率和准确性 。

3970

2023.10.13

java测试工具有哪些
java测试工具有哪些

java测试工具有JUnit、TestNG、Mockito、Selenium、Apache JMeter和Cucumber。php还给大家带来了java有关的教程,欢迎大家前来学习阅读,希望对大家能有所帮助。

2421

2023.10.23

Buffalo框架数据库开发全教程
Buffalo框架数据库开发全教程

本专题围绕Buffalo框架数据库开发,讲解database.yml多环境配置、soda与fizz迁移生成回滚、模型结构体标签、增删改查与条件查询、一对多与多对多关联、数据校验、回调钩子、事务处理及原生SQL执行能力。

0

2026.09.23

Buffalo框架路由与请求处理实操指南
Buffalo框架路由与请求处理实操指南

本专题讲解Buffalo框架路由与请求处理机制,涵盖路由注册与分组、资源路由、Handler编写规范、Context上下文方法、参数绑定、中间件编写挂载、Session与Cookie读写、Flash消息及错误页面定制方法。

0

2026.09.23

Buffalo框架零基础入门教程
Buffalo框架零基础入门教程

本专题整理Buffalo框架入门内容,涵盖Go环境准备、buffalo CLI安装、新项目生成、目录结构说明、dev热加载启动、数据库连接配置与常见报错排查,帮助新手按约定优于配置的思路跑通第一个Buffalo框架应用。

0

2026.09.23

Conan创建软件包配方指南
Conan创建软件包配方指南

本专题介绍通过conanfile.py创建软件包的方法,讲解包名、版本、依赖和构建设置等基础信息,以及source、build、package、package_info等常用方法的作用及编写思路。

0

2026.09.22

Conan二进制包配置指南
Conan二进制包配置指南

本专题介绍Conan根据操作系统、编译器、架构和构建类型生成二进制包的方法,讲解Profile、Settings、Options及Package ID的作用,帮助管理不同平台和编译环境下的包版本。

0

2026.09.22

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
热门推荐
/
最新课程
关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn