讲师中心 微信公众号
AI工具推荐 视频效率加速

Python如何处理带CDATA的XML节点

浅宇姑娘_5349

浅宇姑娘_5349

发布时间:2026-02-04 11:06:42

|

302人浏览过

|

来源于php中文网

原创

应使用lxml库并显式声明目标元素为CDATA类型,因其能可靠获取未转义原始内容;标准ElementTree忽略CDATA结构,正则仅适用于简单稳定场景,minidom和BeautifulSoup均无法满足原始内容提取需求。

python如何处理带cdata的xml节点

Python解析XML时CDATA内容被忽略或转义了怎么办

标准xml.etree.ElementTree默认把CDATA当作普通文本处理,不会保留结构,更不会阻止实体转义(比如<变成)。这不是bug,是设计使然——它只关心XML信息集,不保留标记语法细节。真要提取原始CDATA内容,得换思路。

用lxml配合parser.set_cdata_section_elements()

lxml是唯一在主流XML库中支持显式CDATA感知的方案。关键不是“读取CDATA标签”,而是告诉解析器:哪些元素的内容应被当作CDATA处理(即跳过实体解码、保留原始字符)。

  • 必须提前知道哪些元素可能含CDATA(比如description、script),无法全自动识别
  • 需使用lxml.etree.XMLParser,而非etree.parse()默认解析器
  • 设置后,这些元素的.text属性会返回未转义的原始字符串
from lxml import etree
<p>parser = etree.XMLParser()</p><h1>告诉解析器:所有 <content> 和 <pre class="brush:php;toolbar:false;"> 元素的内容按CDATA处理</h1><p>parser.set_cdata_section_elements(['content', 'code'])</p><p><span>立即学习</span>“<a href="https://pan.quark.cn/s/00968c3c2c15" style="text-decoration: underline !important; color: blue; font-weight: bolder;" rel="nofollow" target="_blank">Python免费学习笔记(深入)</a>”;</p><div class="aritcle_card flexRow">
                                                        <div class="artcardd flexRow">
                                                                <a class="aritcle_card_img" href="/xiazai/skill7154" title="python-pro"><img
                                                                                src="https://img.php.cn/upload/skill/000/000/081/179134208595348.jpg" alt="python-pro"  onerror="this.onerror='';this.src='/static/lhimages/moren/morentu.png'" ></a>
                                                                <div class="aritcle_card_info flexColumn">
                                                                        <a href="/xiazai/skill7154" title="python-pro">python-pro</a>
                                                                        <p>高级 Python 特性、异步编程、性能调优、静态类型、内存管理、Python 内部机制及生态库方面的专家。</p>
                                                                </div>
                                                                <a href="/xiazai/skill7154" title="python-pro" class="aritcle_card_btn flexRow flexcenter"><b></b><span>下载</span> </a>
                                                        </div>
                                                </div><p>xml_str = '''<root><content><![CDATA[<p>Hello & world</p>]]></content></root>'''
root = etree.fromstring(xml_str, parser)</p><p>print(root.find('content').text)  # 输出:<p>Hello & world</p>(未转义,原样保留)</p>

ElementTree里手动提取CDATA字符串(不推荐但有时可行)

如果只能用标准库,且XML格式固定、CDATA位置明确,可退而求其次:用正则从原始XML字符串中提取内容。这绕过了XML解析,风险高,但对简单场景够用。

  • 仅适用于XML结构稳定、无嵌套CDATA、且你控制输入源的情况
  • 正则r'<!\[CDATA\[(.*?)\]\]>'会捕获最内层内容,注意re.DOTALL标志
  • 无法处理CDATA跨行、或内容含]]>的情况(XML本身禁止这样写,但坏数据可能有)
import re
<p>xml_raw = '''<item><desc><![CDATA[Line1<br/>Line2]]></desc></item>'''
match = re.search(r'<![CDATA[(.*?)]]>', xml_raw, re.DOTALL)
if match:
cdata_content = match.group(1)  # 'Line1<br/>Line2'</p>

为什么不用minidom或BeautifulSoup

xml.dom.minidom虽能访问CDATASection节点,但其.data属性仍会做基础转义(如&→&),且API笨重;BeautifulSoup根本不是XML解析器,对CDATA无特殊处理,会直接丢弃标签或当普通文本。两者都不解决“获取未转义原始内容”这个核心诉求。

真正要可靠处理CDATA,lxml + 显式声明目标元素是目前最轻量也最可控的方式。别指望自动发现CDATA——XML标准本身不要求解析器暴露这种语法细节,所有方案都依赖你提前知道哪些字段该被当CDATA对待。

热门AI工具

更多
豆包大模型

豆包大模型是一款由字节跳动推出的企业级大语言模型服务平台。

WorkBuddy

一款AI办公效率工具,主要用于腾讯云推出的AI原生桌面智能体工作台,适合需要提升相关任务效率的用户。

DeepSeek

DeepSeek是一款面向对话、写作、编程和推理场景的AI大模型工具。

二狗PPT
二狗PPT Hot

一款AI演示文稿工具,主要用于专为中式职场打造的AI PPT生成工具,适合需要提升相关任务效率的用户。

讯飞智作

讯飞智作是一款AI视频创作工具,AI文本配音工具,数字人课程、营销视频制作。

LibLibAI
LibLibAI Hot

一款AI视频创作工具,主要用于国内领先的AI创意平台,以海量模型、低门槛操作与“创作-分享-商业化”生态,让小白与专业创作者都能高效实现图文乃至视频创意表达,适合需要提升相关任务效率的用户。

讯飞绘文

讯飞绘文是一款由科大讯飞推出的一站式 AIGC 内容运营平台。

立刻MV
立刻MV Hot

立刻MV是一款AI文本写作工具,AI 音乐视频(MV)创作工具。

墨刀AI
墨刀AI Hot

一款AI图像与设计工具,主要用于产品经理的专属智能体,适合需要提升相关任务效率的用户。

相关专题

更多
Python爬虫获取数据的方法
Python爬虫获取数据的方法

Python爬虫可以通过请求库发送HTTP请求、解析库解析HTML、正则表达式提取数据,或使用数据抓取框架来获取数据。更多关于Python爬虫相关知识。详情阅读本专题下面的文章。php中文网欢迎大家前来学习。

653

2023.11.13

pdf怎么转换成xml格式
pdf怎么转换成xml格式

将 pdf 转换为 xml 的方法:1. 使用在线转换器;2. 使用桌面软件(如 adobe acrobat、itext);3. 使用命令行工具(如 pdftoxml)。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

4244

2024.04.01

xml怎么变成word
xml怎么变成word

步骤:1. 导入 xml 文件;2. 选择 xml 结构;3. 映射 xml 元素到 word 元素;4. 生成 word 文档。提示:确保 xml 文件结构良好,并预览 word 文档以验证转换是否成功。想了解更多xml的相关内容,可以阅读本专题下面的文章。

5477

2024.08.01

xml是什么格式的文件
xml是什么格式的文件

xml是一种纯文本格式的文件。xml指的是可扩展标记语言,标准通用标记语言的子集,是一种用于标记电子文件使其具有结构性的标记语言。想了解更多相关的内容,可阅读本专题下面的相关文章。

2362

2024.11.28

DOM是什么意思
DOM是什么意思

dom的英文全称是documentobjectmodel,表示文件对象模型,是w3c组织推荐的处理可扩展置标语言的标准编程接口;dom是html文档的内存中对象表示,它提供了使用javascript与网页交互的方式。想了解更多的相关内容,可以阅读本专题下面的文章。

6481

2024.08.14

LLVM自定义Pass怎么写
LLVM自定义Pass怎么写

本专题聚焦LLVM自定义Pass开发,整理Pass类结构、run()方法、PreservedAnalyses、CMake构建、插件注册、-load-pass-plugin加载和测试用例编写流程。

100

2026.09.30

LLVM RISC-V参数配置教程
LLVM RISC-V参数配置教程

本专题介绍LLVM对RISC-V基础ISA和扩展的支持方式,涵盖RV32、RV64、标准扩展、实验性扩展、厂商扩展、-menable-experimental-extensions和版本差异。

100

2026.09.30

LLVM IR中间表示入门指南
LLVM IR中间表示入门指南

本专题整理LLVM IR的核心概念,包括中间表示作用、模块结构、函数、基本块、SSA形式、类型系统和常见语法,帮助新手理解LLVM编译流程中的关键层。

80

2026.09.30

PDF转图片方法
PDF转图片方法

需要把 PDF 页面用于上传、预览、分享或图片归档时,PDF 转图片方法专题整理 JPG/PNG 格式选择、逐页导出、清晰度设置、批量下载和结果检查等流程,帮助用户稳定完成 PDF 图片化处理。

60

2026.09.30

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn