讲师中心 微信公众号
AI工具推荐 视频效率加速

如何精准抓取FBref英超联赛表格中的球队链接(避免重复与无关数据)

小墨酱_4151

小墨酱_4151

发布时间:2026-09-09 18:32:01

|

1056人浏览过

|

来源于php中文网

原创

如何精准抓取FBref英超联赛表格中的球队链接(避免重复与无关数据)

本文详解为何直接用requests+beautifulsoup抓取fbref英超页面会返回大量重复和非英超球队链接,并提供基于selenium的可靠解决方案,确保只提取当赛季20支epl球队的唯一、准确url。

本文详解为何直接用requests+beautifulsoup抓取fbref英超页面会返回大量重复和非英超球队链接,并提供基于selenium的可靠解决方案,确保只提取当赛季20支epl球队的唯一、准确url。

FBref.com 是一个高度依赖 JavaScript 渲染的现代体育数据网站。当你使用 requests 发起 HTTP 请求时,获取到的只是服务器返回的初始 HTML 骨架——其中大部分表格内容(包括球队名称、排名、链接等)实际由前端 JavaScript 动态注入。因此,BeautifulSoup 解析的是“空壳”页面,它只能捕获静态存在的 <a></a> 标签(例如页眉、页脚、导航栏、广告位、历史赛季链接、国际球队侧边栏等),导致你看到的冗余结果:

  • ✅ 重复出现:因 DOM 被 JS 多次渲染或表格被复用(如分页/筛选组件残留),同一链接被多次插入;
  • ❌ 无关球队:/squads/ 路径广泛用于全球各级别联赛(西甲、法甲、J联赛、女足、南美俱乐部等),而你的 if '/squads/' in i 过滤条件过于宽泛,未限定上下文位置;
  • ? 缺失结构约束:原始代码未定位到 <table id="results2024-202591_overall"> 内的 <code><tbody> 中真正代表当季联赛排名的 <code><tr> 行,而是全局搜索所有 <code><a></a>,丧失语义边界。

    ✅ 正确做法是:用 Selenium 模拟真实浏览器行为,等待 JavaScript 完整加载后,再通过高精度 CSS 选择器定位目标元素。

    以下为推荐的稳定实现方案(兼容 FBref 当前结构,已验证于2024/25赛季页面):

    from selenium import webdriver
    from selenium.webdriver.chrome.options import Options
    from selenium.webdriver.support.ui import WebDriverWait
    from selenium.webdriver.support import expected_conditions as EC
    from selenium.webdriver.common.by import By
    
    # 启用无头模式(后台运行,不弹窗)
    chrome_options = Options()
    chrome_options.add_argument("--headless")
    chrome_options.add_argument("--no-sandbox")
    chrome_options.add_argument("--disable-dev-shm-usage")
    
    url = "https://fbref.com/en/comps/9/Premier-League-Stats"
    
    with webdriver.Chrome(options=chrome_options) as driver:
        driver.get(url)
        # 显式等待:直到当前赛季主表格的 tbody 中所有球队单元格内的 <a> 标签加载完成
        wait = WebDriverWait(driver, 15)
        selector = "#results2024-202591_overall tbody tr td[data-stat='team'] a"
        team_links = wait.until(EC.presence_of_all_elements_located((By.CSS_SELECTOR, selector)))
    
        # 提取 href 并去重(增强鲁棒性)
        urls = list(set(a.get_attribute("href") for a in team_links if a.get_attribute("href")))
        urls.sort()  # 可选:按字母序排列便于检查
    
        print(f"成功提取 {len(urls)} 支英超球队链接:")
        for u in urls:
            print(u)

    ? 关键要点说明:

    • 选择器精确定位:#results2024-202591_overall 是当前赛季表格的唯一 ID(格式为 results{season}{comp_id}_overall),td[data-stat='team'] 确保只取“球队”列,a 即该列内的链接——完全避开页眉、侧边栏、历史赛季等干扰区域;
    • 显式等待替代 time.sleep():WebDriverWait + presence_of_all_elements_located 确保 JS 渲染完毕后再提取,避免因加载延迟导致空列表;
    • 自动去重处理:set() 消除因动态渲染产生的重复项(如滚动加载、React 组件重绘残留);
    • 无需手动解析路径:直接获取完整 URL(https://...),避免拼接错误或相对路径陷阱。

    ⚠️ 注意事项:

    • 请确保已安装 ChromeDriver 并置于系统 PATH,或使用 webdriver_manager 自动管理:
      pip install selenium webdriver-manager

      并在代码中替换初始化部分:

      from webdriver_manager.chrome import ChromeDriverManager
      from selenium.webdriver.chrome.service import Service
      service = Service(ChromeDriverManager().install())
      with webdriver.Chrome(service=service, options=chrome_options) as driver:
    • 若需长期运行,建议添加异常处理(如超时、元素未找到)并设置合理的 page_load_timeout;
    • 尊重 robots.txt 与网站条款:FBref 允许合理爬取,但请控制请求频率(本例为单次加载,合规)。

    通过此方法,你将稳定获得严格对应当赛季英超20支球队的20条唯一、有效、可直连的 Stats 页面 URL,彻底解决重复与噪声问题——这是面向动态网页抓取的工程级最佳实践。

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

热门AI工具

更多
DeepSeek

DeepSeek是一款面向对话、写作、编程和推理场景的AI大模型工具。

音述AI
音述AI Hot

一款AI音频处理工具,主要用于音述AI是一个以“用声音述说故事”为核心的 AI 音乐创作与声音分享社区,适合需要提升相关任务效率的用户。

LibLibAI
LibLibAI Hot

一款AI视频创作工具,主要用于国内领先的AI创意平台,以海量模型、低门槛操作与“创作-分享-商业化”生态,让小白与专业创作者都能高效实现图文乃至视频创意表达,适合需要提升相关任务效率的用户。

Lovart
Lovart Hot

一款面向视觉设计创作的AI设计平台,可通过智能体和画布工作流辅助制作海报、Logo、网页、PPT及其他视觉内容。

Laper
Laper Hot

Laper是专为编剧、导演和制片人推出的 AI 原生剧本创作工具。

WorkBuddy

一款AI办公效率工具,主要用于腾讯云推出的AI原生桌面智能体工作台,适合需要提升相关任务效率的用户。

VibeKnow
VibeKnow Hot

一款AI视频创作工具,主要用于全球首个AI知识视频创作平台,文档、文章、网页,一键生成视频,适合需要提升相关任务效率的用户。

豆包大模型

豆包大模型是一款由字节跳动推出的企业级大语言模型服务平台。

立刻MV
立刻MV Hot

立刻MV是一款AI文本写作工具,AI 音乐视频(MV)创作工具。

相关专题

更多
免费爬虫工具有哪些
免费爬虫工具有哪些

免费爬虫工具有Scrapy、Beautiful Soup、ParseHub、Octoparse、Webocton Scriptly、RoboBrowser和Goutte。更多关于免费爬虫工具的问题,详情请看本专题下面的文章。php中文网欢迎大家前来学习。

4473

2023.11.10

Python爬虫获取数据的方法
Python爬虫获取数据的方法

Python爬虫可以通过请求库发送HTTP请求、解析库解析HTML、正则表达式提取数据,或使用数据抓取框架来获取数据。更多关于Python爬虫相关知识。详情阅读本专题下面的文章。php中文网欢迎大家前来学习。

653

2023.11.13

LLVM自定义Pass怎么写
LLVM自定义Pass怎么写

本专题聚焦LLVM自定义Pass开发,整理Pass类结构、run()方法、PreservedAnalyses、CMake构建、插件注册、-load-pass-plugin加载和测试用例编写流程。

80

2026.09.30

LLVM RISC-V参数配置教程
LLVM RISC-V参数配置教程

本专题介绍LLVM对RISC-V基础ISA和扩展的支持方式,涵盖RV32、RV64、标准扩展、实验性扩展、厂商扩展、-menable-experimental-extensions和版本差异。

80

2026.09.30

LLVM IR中间表示入门指南
LLVM IR中间表示入门指南

本专题整理LLVM IR的核心概念,包括中间表示作用、模块结构、函数、基本块、SSA形式、类型系统和常见语法,帮助新手理解LLVM编译流程中的关键层。

80

2026.09.30

PDF转图片方法
PDF转图片方法

需要把 PDF 页面用于上传、预览、分享或图片归档时,PDF 转图片方法专题整理 JPG/PNG 格式选择、逐页导出、清晰度设置、批量下载和结果检查等流程,帮助用户稳定完成 PDF 图片化处理。

40

2026.09.30

PixTV AI视频生成与无限画布创作
PixTV AI视频生成与无限画布创作

PixTV专题整理AI视频与视觉内容创作相关功能使用教程,涵盖AI生图、视频生成、无限画布、多模型创作、素材管理、声音音乐及视频剪辑等功能,帮助用户快速掌握PixTV从创意到成片的完整制作方法。

60

2026.09.29

Buffalo框架数据库开发全教程
Buffalo框架数据库开发全教程

本专题围绕Buffalo框架数据库开发,讲解database.yml多环境配置、soda与fizz迁移生成回滚、模型结构体标签、增删改查与条件查询、一对多与多对多关联、数据校验、回调钩子、事务处理及原生SQL执行能力。

280

2026.09.23

Buffalo框架路由与请求处理实操指南
Buffalo框架路由与请求处理实操指南

本专题讲解Buffalo框架路由与请求处理机制,涵盖路由注册与分组、资源路由、Handler编写规范、Context上下文方法、参数绑定、中间件编写挂载、Session与Cookie读写、Flash消息及错误页面定制方法。

160

2026.09.23

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
热门推荐
/
最新课程
关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn