讲师中心 微信公众号
AI工具推荐 视频效率加速

如何自动抓取 College Tennis Ranks 网站的 CSV 数据

星宇姑娘_5275

星宇姑娘_5275

发布时间:2026-09-30 15:47:03

|

999人浏览过

|

来源于php中文网

原创

如何自动抓取 College Tennis Ranks 网站的 CSV 数据

本文介绍如何绕过前端按钮限制,通过解析页面内嵌的 JavaScript 数据,用 Python 自动提取并生成 College Tennis Ranks 网站(如 /schedules/d1w)中动态生成的 schedules.csv 文件。

本文介绍如何绕过前端按钮限制,通过解析页面内嵌的 javascript 数据,用 python 自动提取并生成 college tennis ranks 网站(如 `/schedules/d1w`)中动态生成的 `schedules.csv` 文件。

College Tennis Ranks(collegetennisranks.com)的赛程页(例如 /schedules/d1w)虽提供“CSV”下载按钮,但该功能由 DataTables 的 HTML5 导出插件(buttons.html5.min.js)在浏览器端完成:数据已完整加载至页面内存,点击按钮仅触发前端 JS 将内置数组转为 CSV 并触发下载,不发起任何网络请求。因此,在 Network 面板中无法捕获 CSV 接口,也无法通过简单 GET 请求直接获取。

真正的数据藏于页面源码中——打开网页“查看源代码”(Ctrl+U),可发现 标签下第一个 <script></script> 标签内,以 JavaScript 数组字面量形式硬编码了全部赛程数据,形如:

<script>
  var tableData = [
    ["2024-01-12", "Stanford", "Texas A&M", "W", "6-1", "..."],
    ["2024-01-13", "Duke", "Florida", "L", "3-4", "..."],
    // ... 数百行数据
  ];
</script>

我们可通过 requests 获取 HTML,再用 BeautifulSoup 定位该 <script></script> 标签,结合正则或 ast.literal_eval 安全解析出 Python 列表,最后用 csv 模块写入文件。

Miller CSV TSV JSON 数据处理器
Miller CSV TSV JSON 数据处理器

Miller (mlr) 是一个命令行工具,用于查询、整形和重新格式化名称索引数据,如 CSV、TSV、JSON 和 JSON Lines。它将 awk、sed、cut、join 和 sort 的功能整合到一个专为结构化数据处理而构建的单一工具中。

下载

✅ 推荐实现(含错误处理与通用性):

import re
import requests
import csv
from bs4 import BeautifulSoup
import ast

def fetch_schedules_csv(url: str, output_path: str = "schedules.csv"):
    try:
        # 1. 获取页面 HTML
        headers = {"User-Agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36"}
        resp = requests.get(url, headers=headers, timeout=10)
        resp.raise_for_status()

        # 2. 解析 HTML,定位含 tableData 的 script 标签
        soup = BeautifulSoup(resp.text, "html.parser")
        script_tag = soup.find("script", string=re.compile(r"var\s+tableData\s*="))
        if not script_tag:
            raise ValueError("未找到包含 tableData 的 script 标签")

        # 3. 提取并解析 JavaScript 数组(安全方式)
        js_code = script_tag.string
        match = re.search(r"var\s+tableData\s*=\s*(\[.*?\]);", js_code, re.DOTALL)
        if not match:
            raise ValueError("无法从 script 中提取 tableData 数组")

        # 使用 ast.literal_eval 替代 eval,确保安全执行
        data_list = ast.literal_eval(match.group(1))

        # 4. 写入 CSV(假设首行为表头,若无则跳过)
        with open(output_path, "w", newline="", encoding="utf-8") as f:
            writer = csv.writer(f)
            # 若原始数据不含表头,可手动添加;此处按原样导出
            writer.writerows(data_list)

        print(f"✅ 成功导出 {len(data_list)} 行数据至 {output_path}")

    except Exception as e:
        print(f"❌ 抓取失败:{e}")

# 使用示例
fetch_schedules_csv("https://www.php.cn/link/0daf2855c770bf6e9d55b2153ed179d8/schedules/d1w")

⚠️ 注意事项:

  • 反爬策略:务必设置 User-Agent,否则可能被返回 403;
  • 数据结构变化:若网站重构(如改用 const tableData = [...] 或变量名变更),需同步调整正则匹配逻辑;
  • 编码兼容性:部分学校名含 Unicode 字符(如 é, ñ),务必使用 encoding="utf-8" 打开 CSV;
  • 动态渲染风险:当前方案依赖服务端渲染(SSR)——若未来改为纯客户端渲染(CSR + API),则需切换为 Selenium 或 Playwright 渲染后提取。

总结:当“下载按钮”不发请求时,数据大概率已在 HTML 中。与其逆向 JS,不如直取源头——这是高效、稳定且无需浏览器自动化的核心思路。

热门AI工具

更多
WorkBuddy

一款AI办公效率工具,主要用于腾讯云推出的AI原生桌面智能体工作台,适合需要提升相关任务效率的用户。

豆包大模型

豆包大模型是一款由字节跳动推出的企业级大语言模型服务平台。

墨刀AI
墨刀AI Hot

一款AI图像与设计工具,主要用于产品经理的专属智能体,适合需要提升相关任务效率的用户。

SkildArt
SkildArt Hot

SkildArt是一款AI文本写作工具,一站式 AI 视觉创作平台。

立刻MV
立刻MV Hot

立刻MV是一款AI文本写作工具,AI 音乐视频(MV)创作工具。

DeepSeek

DeepSeek是一款面向对话、写作、编程和推理场景的AI大模型工具。

火山引擎

火山引擎是一款面向企业的云计算与AI服务平台。

VibeKnow
VibeKnow Hot

一款AI视频创作工具,主要用于全球首个AI知识视频创作平台,文档、文章、网页,一键生成视频,适合需要提升相关任务效率的用户。

AionClaw
AionClaw Hot

AionClaw是一款面向办公、创作和编程任务的AI桌面智能体。

相关专题

更多
免费爬虫工具有哪些
免费爬虫工具有哪些

免费爬虫工具有Scrapy、Beautiful Soup、ParseHub、Octoparse、Webocton Scriptly、RoboBrowser和Goutte。更多关于免费爬虫工具的问题,详情请看本专题下面的文章。php中文网欢迎大家前来学习。

4293

2023.11.10

Python爬虫获取数据的方法
Python爬虫获取数据的方法

Python爬虫可以通过请求库发送HTTP请求、解析库解析HTML、正则表达式提取数据,或使用数据抓取框架来获取数据。更多关于Python爬虫相关知识。详情阅读本专题下面的文章。php中文网欢迎大家前来学习。

653

2023.11.13

LLVM自定义Pass怎么写
LLVM自定义Pass怎么写

本专题聚焦LLVM自定义Pass开发,整理Pass类结构、run()方法、PreservedAnalyses、CMake构建、插件注册、-load-pass-plugin加载和测试用例编写流程。

0

2026.09.30

LLVM RISC-V参数配置教程
LLVM RISC-V参数配置教程

本专题介绍LLVM对RISC-V基础ISA和扩展的支持方式,涵盖RV32、RV64、标准扩展、实验性扩展、厂商扩展、-menable-experimental-extensions和版本差异。

0

2026.09.30

LLVM IR中间表示入门指南
LLVM IR中间表示入门指南

本专题整理LLVM IR的核心概念,包括中间表示作用、模块结构、函数、基本块、SSA形式、类型系统和常见语法,帮助新手理解LLVM编译流程中的关键层。

0

2026.09.30

PDF转图片方法
PDF转图片方法

需要把 PDF 页面用于上传、预览、分享或图片归档时,PDF 转图片方法专题整理 JPG/PNG 格式选择、逐页导出、清晰度设置、批量下载和结果检查等流程,帮助用户稳定完成 PDF 图片化处理。

0

2026.09.30

PixTV AI视频生成与无限画布创作
PixTV AI视频生成与无限画布创作

PixTV专题整理AI视频与视觉内容创作相关功能使用教程,涵盖AI生图、视频生成、无限画布、多模型创作、素材管理、声音音乐及视频剪辑等功能,帮助用户快速掌握PixTV从创意到成片的完整制作方法。

0

2026.09.29

Buffalo框架数据库开发全教程
Buffalo框架数据库开发全教程

本专题围绕Buffalo框架数据库开发,讲解database.yml多环境配置、soda与fizz迁移生成回滚、模型结构体标签、增删改查与条件查询、一对多与多对多关联、数据校验、回调钩子、事务处理及原生SQL执行能力。

200

2026.09.23

Buffalo框架路由与请求处理实操指南
Buffalo框架路由与请求处理实操指南

本专题讲解Buffalo框架路由与请求处理机制,涵盖路由注册与分组、资源路由、Handler编写规范、Context上下文方法、参数绑定、中间件编写挂载、Session与Cookie读写、Flash消息及错误页面定制方法。

120

2026.09.23

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
热门推荐
/
最新课程
关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn