讲师中心 微信公众号
AI工具推荐 视频效率加速

如何使用 Selenium 提取动态加载的搜索结果链接

冬枫姑娘_4282

冬枫姑娘_4282

发布时间:2026-01-28 12:31:08

|

1056人浏览过

|

来源于php中文网

原创

如何使用 Selenium 提取动态加载的搜索结果链接

本文详解为何 requests + beautifulsoup 无法获取 dtcc 网站搜索结果链接,并提供基于 selenium 的可靠解决方案,支持无头模式、精准定位及后续 beautifulsoup 协同解析。

DTCC 官网(https://www.php.cn/link/8dc56b3dd5380fcd7402ce0fbc75cb1e)的搜索结果是通过 JavaScript 动态渲染的——页面初始 HTML 中并不包含实际的搜索结果 <a> 标签,而是由前端脚本在浏览器中异步加载并插入 DOM。因此,仅用 requests.get() 获取原始 HTML 后交由 BeautifulSoup 解析,必然无法捕获这些链接,这也是你代码中 soup.find_all(attrs={'href': re.compile("http")}) 一无所获的根本原因。

要正确提取这类动态内容,必须借助浏览器自动化工具模拟真实访问行为。Selenium 是最常用且稳定的选择。以下是推荐的实践方案:

✅ 推荐方案:Selenium 直接提取(简洁高效)

from selenium import webdriver
from selenium.webdriver.chrome.options import Options
from selenium.webdriver.common.by import By
import time

search_url = "https://www.php.cn/link/8dc56b3dd5380fcd7402ce0fbc75cb1e?q=aggregated%20transaction%20data"

# 配置无头 Chrome(不显示浏览器窗口)
opts = Options()
opts.add_argument('--headless')
opts.add_argument('--no-sandbox')
opts.add_argument('--disable-dev-shm-usage')

driver = webdriver.Chrome(options=opts)
try:
    driver.get(search_url)
    # 等待搜索结果容器加载完成(更健壮的做法是使用 WebDriverWait)
    time.sleep(5)

    # 定位搜索结果区域,再查找其中所有 <a> 标签
    results_container = driver.find_element(By.CLASS_NAME, 'search-results')
    links = results_container.find_elements(By.TAG_NAME, 'a')

    for link in links:
        href = link.get_attribute('href')
        if href and not href.startswith('#'):  # 过滤空链接和锚点
            print(href)
finally:
    driver.quit()  # 确保关闭浏览器进程
⚠️ 注意事项:time.sleep(5) 是简易等待方式,生产环境建议改用 WebDriverWait 显式等待元素出现(例如 presence_of_element_located((By.CLASS_NAME, 'search-results'))),避免因网络波动导致提取失败。若遇到 NoSuchElementException,请检查 .search-results 类名是否变更(可通过浏览器开发者工具确认当前 DOM 结构)。ChromeDriver 版本需与本地 Chrome 浏览器兼容;若报错 WebDriverException,请更新驱动或指定 executable_path。

? 进阶方案:Selenium + BeautifulSoup 协同(灵活性更强)

如果你习惯用 BeautifulSoup 进行复杂解析(如提取标题、摘要、发布时间等),可先用 Selenium 获取渲染后的完整 HTML,再交由 BeautifulSoup 处理:

Pptx To Html
Pptx To Html

使用 MinerU 将 PowerPoint (.pptx) 演示文稿转换为 HTML,保留幻灯片内容与结构,生成可直接在网页使用的 HTML格式。

下载
from bs4 import BeautifulSoup

# ...(同上启动 driver 并访问页面)...

html = driver.page_source
soup = BeautifulSoup(html, 'html.parser')
for a in soup.select('.search-results a[href]'):
    print(a['href'])

该方式兼顾了 Selenium 的动态执行能力与 BeautifulSoup 的语法简洁性,适合结构较复杂的页面解析任务。

总之,面对 JS 渲染的搜索结果页,放弃纯 requests 方案,转向 Selenium 是必要且高效的路径。只要合理配置等待机制与选择器,即可稳定、准确地抓取目标链接。

热门AI工具

更多
DeepSeek

DeepSeek是一款面向对话、写作、编程和推理场景的AI大模型工具。

讯飞绘文

讯飞绘文是一款由科大讯飞推出的一站式 AIGC 内容运营平台。

立刻MV
立刻MV Hot

立刻MV是一款AI文本写作工具,AI 音乐视频(MV)创作工具。

豆包大模型

豆包大模型是一款由字节跳动推出的企业级大语言模型服务平台。

火山引擎

火山引擎是一款面向企业的云计算与AI服务平台。

WorkBuddy

一款AI办公效率工具,主要用于腾讯云推出的AI原生桌面智能体工作台,适合需要提升相关任务效率的用户。

二狗PPT
二狗PPT Hot

一款AI演示文稿工具,主要用于专为中式职场打造的AI PPT生成工具,适合需要提升相关任务效率的用户。

UP简历
UP简历 Hot

一款AI办公效率工具,主要用于基于AI技术的免费在线简历制作工具,适合需要提升相关任务效率的用户。

Atoms
Atoms Hot

Atoms是一款AI智能体工具,第一支自动构建真实业务的 AI 团队。

相关专题

更多
chrome什么意思
chrome什么意思

chrome是浏览器的意思,由Google开发的网络浏览器,它在2008年首次发布,并迅速成为全球最受欢迎的浏览器之一。本专题为大家提供chrome相关的文章、下载、课程内容,供大家免费下载体验。

2446

2023.08.11

chrome无法加载插件怎么办
chrome无法加载插件怎么办

chrome无法加载插件可以通过检查插件是否已正确安装、禁用和启用插件、清除插件缓存、更新浏览器和插件、检查网络连接和尝试在隐身模式下加载插件方法解决。更多关于chrome相关问题,详情请看本专题下面的文章。php中文网欢迎大家前来学习。

4319

2023.11.06

Chrome开启无痕模式
Chrome开启无痕模式

本专题整合了Chrome无痕模式开启相关内容,阅读专题下面的文章了解更多详细教程。

3087

2026.03.24

Python爬虫获取数据的方法
Python爬虫获取数据的方法

Python爬虫可以通过请求库发送HTTP请求、解析库解析HTML、正则表达式提取数据,或使用数据抓取框架来获取数据。更多关于Python爬虫相关知识。详情阅读本专题下面的文章。php中文网欢迎大家前来学习。

653

2023.11.13

js正则表达式
js正则表达式

php中文网为大家提供各种js正则表达式语法大全以及各种js正则表达式使用的方法,还有更多js正则表达式的相关文章、相关下载、相关课程,供大家免费下载体验。

3756

2023.06.20

js获取当前时间
js获取当前时间

JS全称JavaScript,是一种具有函数优先的轻量级,解释型或即时编译型的编程语言;它是一种属于网络的高级脚本语言,主要用于Web,常用来为网页添加各式各样的动态功能。js怎么获取当前时间呢?php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

1195

2023.07.28

js 字符串转数组
js 字符串转数组

js字符串转数组的方法:1、使用“split()”方法;2、使用“Array.from()”方法;3、使用for循环遍历;4、使用“Array.split()”方法。本专题为大家提供js字符串转数组的相关的文章、下载、课程内容,供大家免费下载体验。

1518

2023.08.03

js是什么意思
js是什么意思

JS是JavaScript的缩写,它是一种广泛应用于网页开发的脚本语言。JavaScript是一种解释性的、基于对象和事件驱动的编程语言,通常用于为网页增加交互性和动态性。它可以在网页上实现复杂的功能和效果,如表单验证、页面元素操作、动画效果、数据交互等。

9203

2023.08.17

Buffalo框架数据库开发全教程
Buffalo框架数据库开发全教程

本专题围绕Buffalo框架数据库开发,讲解database.yml多环境配置、soda与fizz迁移生成回滚、模型结构体标签、增删改查与条件查询、一对多与多对多关联、数据校验、回调钩子、事务处理及原生SQL执行能力。

0

2026.09.23

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
WebStorm 官方调试文档
WebStorm 官方调试文档

共0课时 | 0人学习

React 教程
React 教程

共58课时 | 11.9万人学习

TypeScript 教程
TypeScript 教程

共19课时 | 6.5万人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn