讲师中心 微信公众号
AI工具推荐 视频效率加速

使用Python BeautifulSoup处理非标准XML

落浩小哥_1888

落浩小哥_1888

发布时间:2026-02-02 06:59:27

|

653人浏览过

|

来源于php中文网

原创

BeautifulSoup默认无法解析非标准XML,因其xml解析器严格遵循规范;需先用lxml.etree.XMLParser(recover=True)容错解析,再转字符串交由BeautifulSoup处理。

使用python beautifulsoup处理非标准xml

为什么 BeautifulSoup 默认无法正确解析非标准 XML

BeautifulSoup 的 xml 解析器(即 lxml-xml 或 xml)严格遵循 XML 规范,遇到常见非标准情况会直接报错或丢弃内容。比如:自闭合标签未写斜杠(<tag></tag> 而非 <tag></tag>)、属性值无引号(<tag attr="value"></tag>)、缺失根节点、含非法字符实体(&foo;)、或混用 HTML 实体( )——这些在真实爬虫/遗留系统中极常见,但 lxml.etree.XMLParser(recover=True) 也不买账。

改用 lxml 的 recover parser + BeautifulSoup 的组合方案

核心思路是:不把原始文本直接喂给 BeautifulSoup(..., 'xml'),而是先用 lxml.etree.fromstring() 带容错解析,再把修复后的树转成字符串交给 BeautifulSoup 处理。这样既能保留 lxml 的恢复能力,又不放弃 BeautifulSoup 熟悉的 API。

  • lxml.etree.XMLParser(recover=True) 可容忍多数语法错误,如缺失引号、未闭合标签、乱码实体
  • 必须显式传入 parser 参数,否则 fromstring() 仍走严格模式
  • 解析后调用 etree.tostring(tree, encoding='unicode', method='xml') 转回字符串,避免字节/编码问题
  • 再用 BeautifulSoup(..., 'xml') 加载该字符串,后续操作完全不变
from lxml import etree
from bs4 import BeautifulSoup
<p>broken_xml = '<root><item id=123>text</item><meta name=author content=John></root>'</p><h1>关键:启用 recover 模式</h1><p>parser = etree.XMLParser(recover=True)
tree = etree.fromstring(broken_xml.encode('utf-8'), parser)
fixed_xml = etree.tostring(tree, encoding='unicode', method='xml')</p><p>soup = BeautifulSoup(fixed_xml, 'xml')
print(soup.find('item')['id'])  # 输出:123

遇到命名空间或 CDATA 时的特殊处理

非标准 XML 常混用命名空间前缀(如 <ns:tag>)却不声明 xmlns:ns,或把 JSON/JS 代码塞进 <![CDATA[...]]> 却漏写右括号。BeautifulSoup 对 CDATA 默认当普通文本,而 lxml 的 recover parser 会把未闭合的 CDATA 当注释吞掉。

python-script-generator
python-script-generator

快速生成专业的 Python 脚本和应用代码。一键创建完整项目结构,支持CLI、API、爬虫、Bot、Django等多种项目类型,包含完整的项目结构、配置文件、依赖管理、测试、README和文档。

下载

立即学习“Python免费学习笔记(深入)”;

  • 若需保留 CDATA 内容原样,解析前先用正则临时替换:re.sub(r'<!\[CDATA\[', '<__CDATA_START__', xml_str),解析完再还原
  • 命名空间报错(如 Namespace prefix ns not declared)可提前移除所有 xmlns: 属性和带冒号的标签名,用 re.sub(r'xmlns:[^=]+="[^"]*"', '', xml_str)
  • lxml 的 recover=True 对 <![CDATA[ 开头但无结尾的情况会截断后续内容,务必检查输出字符串是否完整

比对 lxml.etree 和 BeautifulSoup 的实际行为差异

直接用 lxml.etree 能更细粒度控制容错,但丢失了 soup.select()、.find_next_siblings() 这类便利方法。而 BeautifulSoup 的 'xml' 解析器底层若用 lxml,本质仍是调用 etree.fromstring() —— 区别只在是否暴露 parser 控制权。

  • 不要用 BeautifulSoup(xml_str, 'lxml-xml'):它不接受自定义 parser,且内部仍走严格模式
  • 不要依赖 features='xml':该参数已被弃用,且无 recover 能力
  • 性能上,先 etree.fromstring() 再转字符串会有一次序列化开销,但对 MB 级以下数据影响可忽略
  • 若原始数据含大量非法 UTF-8 字节(如 GBK 混入),需先用 chardet 检测编码并 decode,再喂给 etree.fromstring()

真正麻烦的从来不是语法错误本身,而是错误位置不可预测:可能在第 1 行,也可能藏在嵌套 7 层深的某个属性值里。recover parser 能救活结构,但不会告诉你哪里被悄悄修正了——建议解析后用 soup.prettify() 快速扫一眼关键路径是否符合预期。

热门AI工具

更多
DeepSeek

DeepSeek是一款面向对话、写作、编程和推理场景的AI大模型工具。

LibLibAI
LibLibAI Hot

一款AI视频创作工具,主要用于国内领先的AI创意平台,以海量模型、低门槛操作与“创作-分享-商业化”生态,让小白与专业创作者都能高效实现图文乃至视频创意表达,适合需要提升相关任务效率的用户。

WorkBuddy

一款AI办公效率工具,主要用于腾讯云推出的AI原生桌面智能体工作台,适合需要提升相关任务效率的用户。

豆包大模型

豆包大模型是一款由字节跳动推出的企业级大语言模型服务平台。

切问学术

切问学术是一款AI论文写作工具,复旦大学NLP团队推出的AI学术智能体。

VibeKnow
VibeKnow Hot

一款AI视频创作工具,主要用于全球首个AI知识视频创作平台,文档、文章、网页,一键生成视频,适合需要提升相关任务效率的用户。

火山引擎

火山引擎是一款面向企业的云计算与AI服务平台。

AionClaw
AionClaw Hot

AionClaw是一款面向办公、创作和编程任务的AI桌面智能体。

PixPix
PixPix Hot

PixPix是一款面向电商视觉生产的AI商品图生成工具。

相关专题

更多
json数据格式
json数据格式

JSON是一种轻量级的数据交换格式。本专题为大家带来json数据格式相关文章,帮助大家解决问题。

2035

2023.08.07

json是什么
json是什么

JSON是一种轻量级的数据交换格式,具有简洁、易读、跨平台和语言的特点,JSON数据是通过键值对的方式进行组织,其中键是字符串,值可以是字符串、数值、布尔值、数组、对象或者null,在Web开发、数据交换和配置文件等方面得到广泛应用。本专题为大家提供json相关的文章、下载、课程内容,供大家免费下载体验。

2942

2023.08.23

jquery怎么操作json
jquery怎么操作json

操作的方法有:1、“$.parseJSON(jsonString)”2、“$.getJSON(url, data, success)”;3、“$.each(obj, callback)”;4、“$.ajax()”。更多jquery怎么操作json的详细内容,可以访问本专题下面的文章。

996

2023.10.13

go语言处理json数据方法
go语言处理json数据方法

本专题整合了go语言中处理json数据方法,阅读专题下面的文章了解更多详细内容。

3339

2025.09.10

Python爬虫获取数据的方法
Python爬虫获取数据的方法

Python爬虫可以通过请求库发送HTTP请求、解析库解析HTML、正则表达式提取数据,或使用数据抓取框架来获取数据。更多关于Python爬虫相关知识。详情阅读本专题下面的文章。php中文网欢迎大家前来学习。

653

2023.11.13

pdf怎么转换成xml格式
pdf怎么转换成xml格式

将 pdf 转换为 xml 的方法:1. 使用在线转换器;2. 使用桌面软件(如 adobe acrobat、itext);3. 使用命令行工具(如 pdftoxml)。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

4244

2024.04.01

xml怎么变成word
xml怎么变成word

步骤:1. 导入 xml 文件;2. 选择 xml 结构;3. 映射 xml 元素到 word 元素;4. 生成 word 文档。提示:确保 xml 文件结构良好,并预览 word 文档以验证转换是否成功。想了解更多xml的相关内容,可以阅读本专题下面的文章。

5477

2024.08.01

xml是什么格式的文件
xml是什么格式的文件

xml是一种纯文本格式的文件。xml指的是可扩展标记语言,标准通用标记语言的子集,是一种用于标记电子文件使其具有结构性的标记语言。想了解更多相关的内容,可阅读本专题下面的相关文章。

2362

2024.11.28

LLVM自定义Pass怎么写
LLVM自定义Pass怎么写

本专题聚焦LLVM自定义Pass开发,整理Pass类结构、run()方法、PreservedAnalyses、CMake构建、插件注册、-load-pass-plugin加载和测试用例编写流程。

100

2026.09.30

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn