讲师中心 微信公众号
AI工具推荐 视频效率加速

如何正确从 Wikisource 页面提取书籍正文文本(以《高老头》为例)

小杰君_6410

小杰君_6410

发布时间:2026-09-19 13:12:55

|

779人浏览过

|

来源于php中文网

原创

如何正确从 Wikisource 页面提取书籍正文文本(以《高老头》为例)

本文详解为何使用 mw-parser-output 类无法提取 Wikisource 书籍正文,并提供两种可靠方案:一是精准定位 prp-pages-output 容器直接获取全文;二是通过 CSS 选择器跳过元信息,仅提取纯书籍内容。

本文详解为何使用 `mw-parser-output` 类无法提取 wikisource 书籍正文,并提供两种可靠方案:一是精准定位 `prp-pages-output` 容器直接获取全文;二是通过 css 选择器跳过元信息,仅提取纯书籍内容。

Wikisource 的 HTML 结构具有高度定制性,其页面并非简单线性排布,而是嵌套多层语义化容器。初学者常误用通用 MediaWiki 类名(如 mw-parser-output)定位正文,但该类在页面中重复出现两次:第一次出现在页首元数据区域(含作者、版本说明、导航链接等),第二次才包裹真正的书籍内容。而 soup.find() 默认返回首个匹配元素,导致提取结果为空或混入无关信息。

✅ 推荐方案一:直取 prp-pages-output 容器(简洁可靠)

Wikisource 为书籍正文专门设置了语义化类名 prp-pages-output(Page Rendering Plugin),它唯一且稳定地包裹全部章节文本。无需遍历子标签,调用 .get_text() 即可安全提取:

import requests
from bs4 import BeautifulSoup

def extract_text_simple(url):
    try:
        response = requests.get(url, timeout=10)
        response.raise_for_status()
        soup = BeautifulSoup(response.text, 'html.parser')

        # 精准定位书籍正文容器(唯一且语义明确)
        text_section = soup.find("div", class_="prp-pages-output")
        if not text_section:
            raise ValueError("❌ 未找到 'prp-pages-output' 容器,请确认 URL 是否有效或页面结构是否变更")

        # 一键提取所有可见文本,自动处理换行与空白
        return text_section.get_text(strip=True)

    except requests.RequestException as e:
        print(f"⚠️ 网络请求失败: {e}")
        return None
    except Exception as e:
        print(f"❌ 解析异常: {e}")
        return None

# 示例调用
url = "https://fr.wikisource.org/wiki/Le_P%C3%A8re_Goriot_(1855)"
text = extract_text_simple(url)
print(f"✅ 成功提取 {len(text)} 字符\n{text[:200]}...")

优势:代码简短、鲁棒性强、兼容多数 Wikisource 书籍页(法、英、中等语言站均采用此约定类名)。

✅ 推荐方案二:CSS 选择器精准过滤(纯正文专用)

若需严格排除页眉、页脚、导航栏等非正文内容(例如只保留小说章节段落),可利用 Wikisource 的结构特征:正文段落均位于 <div itemid> 元素之后的兄弟节点中。以下选择器 <code>div.prp-pages-output > div[itemid] ~ * 表示:

  • prp-pages-output 容器内;
  • 找到首个带 itemid 属性的 div(即章节起始标记);
  • 选取其后所有同级兄弟元素(~ *)——即真正的小说段落。
def extract_text_pure(url):
    try:
        response = requests.get(url, timeout=10)
        response.raise_for_status()
        soup = BeautifulSoup(response.text, 'html.parser')

        # 定位正文段落:跳过元信息,只取章节内容
        text_elements = soup.select("div.prp-pages-output > div[itemid] ~ *")
        if not text_elements:
            raise ValueError("⚠️ 未检测到章节内容,请检查页面是否含 'div[itemid]' 标记")

        # 清洗并拼接(保留段落分隔)
        lines = [elem.get_text(strip=True) for elem in text_elements]
        return "\n".join(line for line in lines if line)  # 过滤空行

    except Exception as e:
        print(f"❌ 提取失败: {e}")
        return None

# 使用示例
text_pure = extract_text_pure(url)
print(f"? 纯正文共 {len(text_pure)} 字符(不含元数据)")

⚠️ 关键注意事项

  • User-Agent 必须设置:Wikisource 可能拒绝默认 requests UA 请求。建议添加头部:
    headers = {"User-Agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36"}
    response = requests.get(url, headers=headers, timeout=10)
  • 编码与语言适配:法文页面含 UTF-8 特殊字符,response.text 已自动解码,无需手动 response.content.decode()
  • 反爬与频率控制:批量抓取时务必遵守 robots.txt(如 https://fr.wikisource.org/robots.txt),添加 time.sleep(1) 避免被限流。
  • 结构变动预警:Wikisource 插件更新可能导致 prp-pages-output 类名变更。生产环境建议增加 fallback 逻辑(如回退至 mw-parser-output 的第二个匹配项)。

通过以上任一方案,您均可稳定、高效地从 Wikisource 提取高质量书籍文本,为后续 NLP 分析、文本存档或电子书生成奠定坚实基础。

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

热门AI工具

更多
墨刀AI
墨刀AI Hot

一款AI图像与设计工具,主要用于产品经理的专属智能体,适合需要提升相关任务效率的用户。

讯飞智作

讯飞智作是一款AI视频创作工具,AI文本配音工具,数字人课程、营销视频制作。

豆包大模型

豆包大模型是一款由字节跳动推出的企业级大语言模型服务平台。

WorkBuddy

一款AI办公效率工具,主要用于腾讯云推出的AI原生桌面智能体工作台,适合需要提升相关任务效率的用户。

咔片AIPPT

一款在线AI演示文稿制作工具,可根据主题和内容需求辅助生成PPT结构与页面,提高演示材料制作效率。

UpDream
UpDream Hot

一款AI视频创作工具,主要用于哔哩哔哩推出的自研AI视频创作工具,适合需要提升相关任务效率的用户。

Atoms
Atoms Hot

Atoms是一款AI智能体工具,第一支自动构建真实业务的 AI 团队。

AionClaw
AionClaw Hot

AionClaw是一款面向办公、创作和编程任务的AI桌面智能体。

DeepSeek

DeepSeek是一款面向对话、写作、编程和推理场景的AI大模型工具。

相关专题

更多
免费爬虫工具有哪些
免费爬虫工具有哪些

免费爬虫工具有Scrapy、Beautiful Soup、ParseHub、Octoparse、Webocton Scriptly、RoboBrowser和Goutte。更多关于免费爬虫工具的问题,详情请看本专题下面的文章。php中文网欢迎大家前来学习。

3913

2023.11.10

Python爬虫获取数据的方法
Python爬虫获取数据的方法

Python爬虫可以通过请求库发送HTTP请求、解析库解析HTML、正则表达式提取数据,或使用数据抓取框架来获取数据。更多关于Python爬虫相关知识。详情阅读本专题下面的文章。php中文网欢迎大家前来学习。

653

2023.11.13

AI视频生成软件推荐
AI视频生成软件推荐

本专题汇总了当前主流的AI视频生成软件推荐与排行榜单,涵盖seko、AniShort、剧云、Lovart、LiblibAI及立刻mv等热门工具。同时整理了各软件在文生视频、图生视频、时长限制、画质表现及免费额度等方面的差异对比,助您快速选对适合创作需求的AI视频生成工具。

120

2026.09.16

ai生成视频的工具免费版合集
ai生成视频的工具免费版合集

本专题汇总了当前免费AI生成视频工具的排行榜与推荐清单,涵盖seko、讯飞智作、AniShort及剧云、Lovart等多模型集成平台。同时整理了各工具的免费额度、输出时长、水印政策及适用场景差异,助您快速选择合适工具开启AI视频创作。

40

2026.09.16

Pandas时间序列分析与可视化报表
Pandas时间序列分析与可视化报表

本专题整理Pandas日期转换、时间索引、重采样、滚动窗口、时区处理、plot绘图、Styler表格样式和报表输出方法。

40

2026.09.16

Pandas数据筛选索引与清洗处理
Pandas数据筛选索引与清洗处理

本专题整理Pandas中的loc、iloc、条件筛选、query查询、缺失值处理、重复值删除、类型转换和字符串列清洗方法。

40

2026.09.16

Pandas数据读取导入与文件导出处理
Pandas数据读取导入与文件导出处理

本专题整理Pandas读取CSV、Excel、JSON、SQL、Parquet等文件的方法,以及to_csv、to_excel、to_sql和to_parquet等常用数据导出流程。

40

2026.09.16

GDB怎么设置断点
GDB怎么设置断点

本专题介绍GDB按照函数名、源代码行号和文件位置设置断点的方法,详细说明run、continue、next、step等命令的配合使用,帮助定位程序崩溃、逻辑异常及代码未按预期执行的问题。

340

2026.09.11

GDB怎么查看变量值
GDB怎么查看变量值

本专题介绍GDB调试过程中查看变量值的具体方法,涵盖局部变量、函数参数、数组、结构体和指针内容查询,同时整理变量持续显示、格式化输出及无法读取变量时的排查思路。

100

2026.09.11

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
热门推荐
/
最新课程
关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn