讲师中心 微信公众号
AI工具推荐 视频效率加速

如何从维基百科页面提取章节内容、链接与参考文献并构建结构化DataFrame

陌雪酱_6629

陌雪酱_6629

发布时间:2026-07-17 22:00:25

|

953人浏览过

|

来源于php中文网

原创

如何从维基百科页面提取章节内容、链接与参考文献并构建结构化DataFrame

本文介绍使用BeautifulSoup自动化提取维基百科文章中各<h3>子章节的正文文本、内链URL及参考文献锚点,并按章节组织为Pandas DataFrame,适用于初学者掌握动态边界识别与树遍历技巧。

本文介绍使用beautifulsoup自动化提取维基百科文章中各`

`子章节的正文文本、内链url及参考文献锚点,并按章节组织为pandas dataframe,适用于初学者掌握动态边界识别与树遍历技巧。

在网页抓取实践中,一个常见难点是:如何准确界定每个逻辑章节的范围? 尤其在维基百科这类结构松散但语义清晰的页面中,章节并非由显式容器包裹,而是依赖标题标签(如<h3>)及其后连续的段落(<p>)、列表或引用块构成,直到下一个同级标题(如另一<h3>)或更高层级标题(如<h2>)出现为止。本文以《Machine learning》英文维基页面为例,系统讲解如何稳健提取“Artificial intelligence”至“Statistical Physics”之间的全部<h3>子章节内容,并构建含chapter(章节名)、text(纯文本)、links(所有<a>链接的href)、cite_ref(参考文献锚点如#cite_note-xx)四列的DataFrame。

核心思路:基于DOM树遍历的“标题驱动”分段

关键不在于硬编码段落数量(如[:3]),而在于利用HTML的兄弟节点关系与标签语义动态截断:

  • 每个<h3>即为新章节起点;
  • 使用.find_next_siblings()获取其后所有同级后续元素;
  • 遍历时逐个判断:若为<p>,则提取文本与链接;若再次遇到<h3>,说明当前章节结束,立即break;
  • 为防止越界(如误入后续<h2>主章节),可在特定章节名(如"Statistical Physics")后主动终止循环。

完整可运行代码示例

import pandas as pd
from bs4 import BeautifulSoup
import requests

url = "https://www.php.cn/link/71d779e5d91a630bc0f3cfc3a6db1d93"
response = requests.get(url)
soup = BeautifulSoup(response.content, "html.parser")

data = []

# 遍历所有 h3 标题(即子章节)
for h3 in soup.select("h3"):
    # 提取章节名:维基通常将标题文本放在 <span id="..."> 内
    chapter_title = h3.find("span", {"id": True})
    if not chapter_title:
        continue  # 跳过无id的h3(如空标题或装饰性标题)
    chapter_name = chapter_title.get_text(strip=True)

    # 初始化本章节数据字典
    chapter_data = {
        "chapter": chapter_name,
        "text": "",
        "links": [],
        "cite_ref": []
    }

    # 向下遍历所有后续兄弟节点
    for sibling in h3.find_next_siblings():
        if sibling.name == "p":
            # 累加段落文本(去首尾空白,避免换行符干扰)
            chapter_data["text"] += " " + sibling.get_text(strip=True)
            # 提取所有<a>标签的href(包括站内链接和锚点)
            chapter_data["links"].extend([
                a.get("href") for a in sibling.select("a[href]")
            ])
            # 提取所有形如 #cite_note-xxx 的参考文献锚点链接
            chapter_data["cite_ref"].extend([
                c.get("href") for c in sibling.select("[id^=cite_ref] a[href]")
            ])
        elif sibling.name in ["h3", "h2"]:  # 遇到新章节或主章节,结束当前段落
            break

    data.append(chapter_data)

    # 满足终点条件时提前退出(避免处理无关章节)
    if chapter_name == "Statistical Physics":
        break

# 构建DataFrame,自动处理列表字段(保持可读性)
df = pd.DataFrame(data)
print(df[["chapter", "text"]].head())  # 查看前几行章节名与文本摘要

注意事项与优化建议

  • ✅ 鲁棒性增强:实际应用中建议添加异常处理(如try/except捕获网络请求或解析失败)、设置requests超时与User-Agent头,避免被反爬拦截;
  • ✅ 文本清洗:维基页面常含[1]类上标引用、编辑标记(如[edit]),可用正则(如re.sub(r'[d+]|\[edit\]', '', text))进一步清理;
  • ✅ 链接去重与归一化:links列表可能含重复URL或相对路径(如/wiki/Python),建议用set()去重,并用urllib.parse.urljoin(base_url, href)转为绝对链接;
  • ⚠️ 注意动态内容:维基部分区域(如信息框、脚注区)由JavaScript渲染,requests+BeautifulSoup无法获取,需改用Selenium或检查API(如https://en.wikipedia.org/w/api/rest_v1/page/html/Machine_learning);
  • ? 扩展性提示:若需提取表格、代码块或图片,只需在sibling.name判断中增加"table"、"pre"、"img"等分支即可。

通过本方法,你不再需要手动计数段落,而是让代码“读懂”HTML的语义结构——这是进阶网络爬虫的核心能力。坚持练习此类DOM导航模式,复杂页面解析将变得清晰可控。

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

热门AI工具

更多
立刻MV
立刻MV Hot

立刻MV是一款AI文本写作工具,AI 音乐视频(MV)创作工具。

WorkBuddy

一款AI办公效率工具,主要用于腾讯云推出的AI原生桌面智能体工作台,适合需要提升相关任务效率的用户。

豆包大模型

豆包大模型是一款由字节跳动推出的企业级大语言模型服务平台。

DeepSeek

DeepSeek是一款面向对话、写作、编程和推理场景的AI大模型工具。

讯飞智作

讯飞智作是一款AI视频创作工具,AI文本配音工具,数字人课程、营销视频制作。

Lovart
Lovart Hot

一款面向视觉设计创作的AI设计平台,可通过智能体和画布工作流辅助制作海报、Logo、网页、PPT及其他视觉内容。

音述AI
音述AI Hot

一款AI音频处理工具,主要用于音述AI是一个以“用声音述说故事”为核心的 AI 音乐创作与声音分享社区,适合需要提升相关任务效率的用户。

Atoms
Atoms Hot

Atoms是一款AI智能体工具,第一支自动构建真实业务的 AI 团队。

切问学术

切问学术是一款AI论文写作工具,复旦大学NLP团队推出的AI学术智能体。

相关专题

更多
html版权符号
html版权符号

html版权符号是“©”,可以在html源文件中直接输入或者从word中复制粘贴过来,php中文网还为大家带来html的相关下载资源、相关课程以及相关文章等内容,供大家免费下载使用。

5255

2023.06.14

html在线编辑器
html在线编辑器

html在线编辑器是用于在线编辑的工具,编辑的内容是基于HTML的文档。它经常被应用于留言板留言、论坛发贴、Blog编写日志或等需要用户输入普通HTML的地方,是Web应用的常用模块之一。php中文网为大家带来了html在线编辑器的相关教程、以及相关文章等内容,供大家免费下载使用。

3032

2023.06.21

html网页制作
html网页制作

html网页制作是指使用超文本标记语言来设计和创建网页的过程,html是一种标记语言,它使用标记来描述文档结构和语义,并定义了网页中的各种元素和内容的呈现方式。本专题为大家提供html网页制作的相关的文章、下载、课程内容,供大家免费下载体验。

2690

2023.07.31

html空格
html空格

html空格是一种用于在网页中添加间隔和对齐文本的特殊字符,被用于在网页中插入额外的空间,以改变元素之间的排列和对齐方式。本专题为大家提供html空格的相关的文章、下载、课程内容,供大家免费下载体验。

2719

2023.08.01

html是什么
html是什么

HTML是一种标准标记语言,用于创建和呈现网页的结构和内容,是互联网发展的基石,为网页开发提供了丰富的功能和灵活性。本专题为大家提供html相关的各种文章、以及下载和课程。

4639

2023.08.11

html字体大小怎么设置
html字体大小怎么设置

在网页设计中,字体大小的选择是至关重要的。合理的字体大小不仅可以提升网页的可读性,还能够影响用户对网页整体布局的感知。php中文网将介绍一些常用的方法和技巧,帮助您在HTML中设置合适的字体大小。

2681

2023.08.11

html转txt
html转txt

html转txt的方法有使用文本编辑器、使用在线转换工具和使用Python编程。本专题为大家提供html转txt相关的文章、下载、课程内容,供大家免费下载体验。

2469

2023.08.31

html文本框代码怎么写
html文本框代码怎么写

html文本框代码:1、单行文本框【<input type="text" style="height:..;width:..;" />】;2、多行文本框【textarea style=";height:;"></textare】。

2248

2023.09.01

PixTV AI视频生成与无限画布创作
PixTV AI视频生成与无限画布创作

PixTV专题整理AI视频与视觉内容创作相关功能使用教程,涵盖AI生图、视频生成、无限画布、多模型创作、素材管理、声音音乐及视频剪辑等功能,帮助用户快速掌握PixTV从创意到成片的完整制作方法。

0

2026.09.29

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
热门推荐
/
最新课程
关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn