讲师中心 微信公众号
AI工具推荐 视频效率加速

如何使用 BeautifulSoup 精准提取 HTML 中指定标题之间的内容

冬瑶姑娘_9479

冬瑶姑娘_9479

发布时间:2026-06-02 23:06:04

|

527人浏览过

|

来源于php中文网

原创

如何使用 BeautifulSoup 精准提取 HTML 中指定标题之间的内容

本文介绍如何利用 python 的 beautifulsoup 库,根据动态 html 文档中语义明确的标题文本(如“notes to unaudited condensed...”和“item 2.”),精准定位并提取二者之间的所有 html 元素,适用于财报、年报等结构松散但标题稳定的文档解析场景。

本文介绍如何利用 python 的 beautifulsoup 库,根据动态 html 文档中语义明确的标题文本(如“notes to unaudited condensed...”和“item 2.”),精准定位并提取二者之间的所有 html 元素,适用于财报、年报等结构松散但标题稳定的文档解析场景。

在处理非标准化的 HTML 报告(如 SEC 文件、企业财报)时,依赖固定标签层级或 class/id 属性往往不可靠——因为格式常随版本变化。更稳健的策略是基于可读性强、语义稳定的内容文本进行锚点定位。BeautifulSoup 提供了灵活的查找机制,配合状态机式遍历,即可实现“从 A 标题到 B 标题之间所有内容”的精确截取。

以下是一个生产就绪的解析方案,已针对原始需求优化:

from bs4 import BeautifulSoup

def extract_section_by_heading(html_content: str, start_text: str, end_text: str) -> list:
    """
    从 HTML 字符串中提取 start_text 所在标签之后、end_text 所在标签之前的所有同级兄弟元素。

    注意:此方法假设起始与结束标题位于同一 DOM 深度(如均为 <a><span> 内文本),且目标内容位于二者之间(非嵌套子树内)。
    """
    soup = BeautifulSoup(html_content, "html.parser")

    # 查找包含关键词的最内层文本节点(支持 span/a 等嵌套)
    def find_heading_tag(text_hint):
        for tag in soup.find_all(['a', 'span', 'h1', 'h2', 'h3', 'p', 'div']):
            if text_hint in (tag.get_text(strip=True) or ""):
                return tag
        return None

    tag_start = find_heading_tag(start_text)
    tag_end = find_heading_tag(end_text)

    if not tag_start:
        raise ValueError(f"未找到起始标题:'{start_text}'")
    if not tag_end:
        raise ValueError(f"未找到结束标题:'{end_text}'")

    # 获取共同父容器(确保在同一层级上下文中遍历)
    parent = tag_start.parent if tag_start.parent == tag_end.parent else soup.body or soup.html

    # 遍历父容器的直接子节点,收集 start 之后、end 之前的元素
    result = []
    capture = False
    for child in parent.children:
        if not hasattr(child, 'name') or not child.name:  # 跳过 NavigableString(如换行、空格)
            continue
        if child is tag_start:
            capture = True
            continue
        if child is tag_end:
            break
        if capture:
            result.append(child)

    return result

# 使用示例
html_sample = """
<html>
<body>
    <div>无关内容1</div>
    <div><a href="#a1NatureofOperations_790426"><span>Notes to Unaudited Condensed Consolidated Financial Statements</span></a></div>
    <div><p>附注1:现金及现金等价物包括...</p></div>
    <div><table><tr><td>金额单位:百万美元</td></tr></table></div>
    <div><a href="#ITEM2MANAGEMENTSDISCUSSIONANDANALYSIS_77"><span>Item 2.</span></a></div>
    <div>无关内容2</div>
</body>
</html>
"""

section_elements = extract_section_by_heading(
    html_sample,
    start_text="Notes to Unaudited Condensed Consolidated Financial Statements",
    end_text="Item 2."
)

for elem in section_elements:
    print(elem.prettify())

✅ 关键优势说明:

Article To Html
Article To Html

文章转信息图。将文章/笔记转化为手机可读的 HTML 信息图,自动匹配视觉风格。触发场景:文章转图、笔记转图、信息图、转小红书图、做张图、可视化这篇文章、文生图。

下载
  • ✅ 不依赖 ID 或 class:规避 HTML 动态生成导致的属性不可预测性;
  • ✅ 容错文本匹配:使用 get_text(strip=True) 处理换行、空格、内联样式干扰;
  • ✅ 层级鲁棒性:自动回溯至共同父级,避免因 <a> 和 <span> 嵌套深度不同而漏匹配;
  • ✅ 可扩展性强:只需修改 start_text / end_text 即可适配其他章节(如 "Item 1.", "Significant Accounting Policies")。

⚠️ 注意事项:

立即学习“前端免费学习笔记(深入)”;

  • 若目标内容深度嵌套在起始/结束标签内部(例如 <div><a>...</a><ul>...<li>需提取内容</li></ul></div>),上述方法仅捕获 <ul> 整体;此时应改用 .find_next_siblings() 或递归提取子树;
  • 对超大 HTML(>100MB),建议配合 lxml 解析器提升性能:BeautifulSoup(html_content, "lxml");
  • 生产环境务必添加异常处理(如编码错误、空文档、标题缺失),并做日志记录便于调试。

掌握这种“语义锚点 + 状态流遍历”的模式,你将能高效应对各类非结构化 HTML 文档的定向抽取任务——无需正则硬解析,也无需强依赖 CSS 选择器,真正实现以内容为中心的智能提取。

相关文章

HTML速学教程(入门课程)
HTML速学教程(入门课程)

HTML怎么学习?HTML怎么入门?HTML在哪学?HTML怎么学才快?不用担心,这里为大家提供了HTML速学教程(入门课程),有需要的小伙伴保存下载就能学习啦!

下载

相关标签:

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

热门AI工具

更多
Lovart
Lovart Hot

一款面向视觉设计创作的AI设计平台,可通过智能体和画布工作流辅助制作海报、Logo、网页、PPT及其他视觉内容。

豆包大模型

豆包大模型是一款由字节跳动推出的企业级大语言模型服务平台。

VibeKnow
VibeKnow Hot

一款AI视频创作工具,主要用于全球首个AI知识视频创作平台,文档、文章、网页,一键生成视频,适合需要提升相关任务效率的用户。

音述AI
音述AI Hot

一款AI音频处理工具,主要用于音述AI是一个以“用声音述说故事”为核心的 AI 音乐创作与声音分享社区,适合需要提升相关任务效率的用户。

讯飞绘文

讯飞绘文是一款由科大讯飞推出的一站式 AIGC 内容运营平台。

PixPix
PixPix Hot

PixPix是一款面向电商视觉生产的AI商品图生成工具。

DeepSeek

DeepSeek是一款面向对话、写作、编程和推理场景的AI大模型工具。

立刻MV
立刻MV Hot

立刻MV是一款AI文本写作工具,AI 音乐视频(MV)创作工具。

WorkBuddy

一款AI办公效率工具,主要用于腾讯云推出的AI原生桌面智能体工作台,适合需要提升相关任务效率的用户。

相关专题

更多
html版权符号
html版权符号

html版权符号是“©”,可以在html源文件中直接输入或者从word中复制粘贴过来,php中文网还为大家带来html的相关下载资源、相关课程以及相关文章等内容,供大家免费下载使用。

5855

2023.06.14

html在线编辑器
html在线编辑器

html在线编辑器是用于在线编辑的工具,编辑的内容是基于HTML的文档。它经常被应用于留言板留言、论坛发贴、Blog编写日志或等需要用户输入普通HTML的地方,是Web应用的常用模块之一。php中文网为大家带来了html在线编辑器的相关教程、以及相关文章等内容,供大家免费下载使用。

3312

2023.06.21

html网页制作
html网页制作

html网页制作是指使用超文本标记语言来设计和创建网页的过程,html是一种标记语言,它使用标记来描述文档结构和语义,并定义了网页中的各种元素和内容的呈现方式。本专题为大家提供html网页制作的相关的文章、下载、课程内容,供大家免费下载体验。

2990

2023.07.31

html空格
html空格

html空格是一种用于在网页中添加间隔和对齐文本的特殊字符,被用于在网页中插入额外的空间,以改变元素之间的排列和对齐方式。本专题为大家提供html空格的相关的文章、下载、课程内容,供大家免费下载体验。

2999

2023.08.01

html是什么
html是什么

HTML是一种标准标记语言,用于创建和呈现网页的结构和内容,是互联网发展的基石,为网页开发提供了丰富的功能和灵活性。本专题为大家提供html相关的各种文章、以及下载和课程。

4799

2023.08.11

html字体大小怎么设置
html字体大小怎么设置

在网页设计中,字体大小的选择是至关重要的。合理的字体大小不仅可以提升网页的可读性,还能够影响用户对网页整体布局的感知。php中文网将介绍一些常用的方法和技巧,帮助您在HTML中设置合适的字体大小。

2961

2023.08.11

html转txt
html转txt

html转txt的方法有使用文本编辑器、使用在线转换工具和使用Python编程。本专题为大家提供html转txt相关的文章、下载、课程内容,供大家免费下载体验。

2749

2023.08.31

html文本框代码怎么写
html文本框代码怎么写

html文本框代码:1、单行文本框【<input type="text" style="height:..;width:..;" />】;2、多行文本框【textarea style=";height:;"></textare】。

2448

2023.09.01

Kratos框架HTTP与gRPC服务开发教程
Kratos框架HTTP与gRPC服务开发教程

本专题围绕Kratos框架双协议服务开发,涵盖HTTP路由与处理器编写、参数获取、gRPC服务实现与客户端调用、metadata上下文传递、encoding编解码注册、统一响应封装、超时控制与流式响应实现方法。

0

2026.10.10

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
GDB 17.2 官方文档集合
GDB 17.2 官方文档集合

共0课时 | 0人学习

Bootstrap 入门安装配置
Bootstrap 入门安装配置

共0课时 | 0人学习

38+ PhpStorm 提示和技巧
38+ PhpStorm 提示和技巧

共1课时 | 221人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn