讲师中心 微信公众号
AI工具推荐 视频效率加速

HTML解析阶段对HTML源代码中非法Unicode字符的过滤规则剖析

秋墨酱_6633

秋墨酱_6633

发布时间:2026-06-21 07:06:36

|

262人浏览过

|

来源于php中文网

原创

DOMDocument::loadHTML() 遇 C0 控制字符(\x00–\x08、\x0B、\x0C、\x0E–\x1F)会直接崩溃,因 libxml 零容忍且不修复;必须在调用前用正则清洗,strip_tags() 和 htmlspecialchars() 无效。

html解析阶段对html源代码中非法unicode字符的过滤规则剖析

DOMDocument::loadHTML() 遇到 \x00–\x1F 会直接崩溃,不是警告

PHP 的 DOMDocument::loadHTML() 在底层调用 libxml,而 libxml 对 C0 控制字符(\x00–\x08、\x0B、\x0C、\x0E–\x1F)零容忍:不跳过、不忽略、不修复,直接抛 DOMDocument::loadHTML(): Unexpected end tag 或更底层的 XML_ERR_INVALID_CHAR。尤其 \x00 在 PHP 字符串中会截断后续所有内容,导致 HTML 被“砍掉一半”后解析失败。

常见触发场景包括:从 MySQL TEXT 字段读取未清理的日志、用户粘贴 Word 文档生成的 HTML、爬虫抓取含乱码响应头的页面。

  • 必须在调用 loadHTML() 前清洗,不能依赖 libxml_use_internal_errors(true) 挽救——它只捕获错误,不阻止解析中断
  • strip_tags() 和 htmlspecialchars() 完全无效,因为它们运行在字符串层面,而控制字符会让 DOM 构建根本无法开始
  • 推荐清洗正则:preg_replace('/[\x00-\x08\x0B\x0C\x0E-\x1F]/u', '', $html)(保留 \x09、\x0A、\x0D)

lxml.etree.parse() 报 UnicodeDecodeError 很可能不是编码问题,而是控制字符干扰 UTF-8 边界

Python 的 lxml.etree.parse() 或 fromstring() 报 UnicodeDecodeError: 'utf-8' codec can't decode byte 0xXX,常被误判为编码声明错误。实际更可能是源 HTML 中混入了 \x00–\x1F 等非法字节,破坏了 UTF-8 多字节序列的完整性(例如把 \xe2\x8c\x9a 中间插入 \x01,导致解码器无法识别完整码点)。

这种错误在用 requests.get().text 获取响应后直接喂给 lxml 时高发,因为 .text 自动解码可能掩盖原始字节污染。

立即学习“前端免费学习笔记(深入)”;

html-to-pptx
html-to-pptx

将多页 HTML 演示文稿转换为美化的 PPTX 文件,便于分享和分发。

下载
  • 安全做法:用 response.content(bytes)先做清洗,再 decode;或直接对 bytes 运行 re.sub(b'[\x00-\x08\x0B\x0C\x0E-\x1F]', b'', raw_bytes)
  • 不要用 errors='ignore' 或 'replace' 强行 decode——这会让 lxml 后续解析出错更隐蔽
  • 若源头是数据库,清洗前加一层 mb_convert_encoding($html, 'HTML-ENTITIES', 'UTF-8')(PHP)或 html.unescape()(Python)可一并处理部分非法实体残留

&xyz; 这类非法实体浏览器和 DOMParser 都不报错,但会原样留在 textContent 里

HTML 解析器(包括浏览器、DOMParser().parseFromString()、html5-php、BeautifulSoup)对 &xyz;、yz;、GG; 等非法实体一律静默处理:不替换、不报错、不警告,原样保留在 DOM 节点的 textContent 中。这意味着你用 el.textContent 提取纯文本时,会拿到带裸 & 的字符串,而非预期的干净内容。

这和控制字符不同——它不会让解析失败,但会导致数据提取逻辑失效(比如你假设 textContent 是“已解码文本”,结果发现里面还有未解码的 < 或非法 &xyz;)。

  • 检测非法实体只能靠正则主动扫描:/&(?!(amp|lt|gt|quot|apos|#\d+|#x[0-9a-fA-F]+);)/g
  • html.unescape() 在 Python 中遇到非法实体会抛 ValueError,可用 try/except 捕获;he.decode()(he 库)更鲁棒,对 &xyz; 返回原串不报错
  • 注意嵌套:< 实际解出来是 ,不是 <code><;但 会解成 <code><,再解一次才得 ——只解一层是标准行为

data-* 是唯一能跨解析器链路存活的自定义属性,其他名字全看下游环节脸色

写 <div my-id="123"></div>,浏览器 DOM 里 getAttribute('my-id') 能取到,但 dataset.myId 是 undefined;CSS div[my-id] 不匹配;HTML Purifier 默认删;Vue 3 SSR 可能丢;jsdom 保留但不进 el.myId 属性。而 <div data-my-id="123"></div> 在所有环节都稳如老狗——这不是因为 data-* “更安全”,而是 W3C 规范、浏览器实现、主流净化库、SSR 框架、服务端解析器(lxml、html5lib)全部显式支持它作为合法私有通道。

想绕过网关或净化层?别碰 x-、ng-、v- 这类前缀,它们没标准背书,每个下游环节都可能单独打补丁删掉。

  • HTML Purifier 必须显式配置 $config->set('HTML.AllowedAttributes', 'data-*'); 才放行,否则默认白名单里只有标准属性
  • DOMPurify 默认允许 data-,但禁用 my-id;要放开需手动加 ADD_ATTR: ['my-id'] 并指定类型(如 'CDATA')
  • 服务端用 lxml.html.fromstring(html).xpath('//div')[0].attrib 能看到 my-id,但若该 HTML 后续被前端 DOMPurify 再处理,就又没了

真正容易被忽略的是:非法字符是否造成问题,不取决于你写的代码有多严谨,而取决于紧贴你输出下游的那个解析环节——它可能是一个 Nginx if 规则、一个 HTML Purifier 配置、一个 Vue 模板编译器,或者只是浏览器地址栏里的一次粘贴。没有统一过滤,只有层层设防。

相关文章

HTML速学教程(入门课程)
HTML速学教程(入门课程)

HTML怎么学习?HTML怎么入门?HTML在哪学?HTML怎么学才快?不用担心,这里为大家提供了HTML速学教程(入门课程),有需要的小伙伴保存下载就能学习啦!

下载

相关标签:

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

热门AI工具

更多
讯飞绘文

讯飞绘文是一款由科大讯飞推出的一站式 AIGC 内容运营平台。

WorkBuddy

一款AI办公效率工具,主要用于腾讯云推出的AI原生桌面智能体工作台,适合需要提升相关任务效率的用户。

DeepSeek

DeepSeek是一款面向对话、写作、编程和推理场景的AI大模型工具。

豆包大模型

豆包大模型是一款由字节跳动推出的企业级大语言模型服务平台。

SkildArt
SkildArt Hot

SkildArt是一款AI文本写作工具,一站式 AI 视觉创作平台。

Loomy
Loomy Hot

一款AI工具,主要用于科大讯飞发布的桌面级 AI 助理,比 OpenClaw 更易用、更安全!,适合需要提升相关任务效率的用户。

讯飞智作

讯飞智作是一款AI视频创作工具,AI文本配音工具,数字人课程、营销视频制作。

Lovart
Lovart Hot

一款面向视觉设计创作的AI设计平台,可通过智能体和画布工作流辅助制作海报、Logo、网页、PPT及其他视觉内容。

AionClaw
AionClaw Hot

AionClaw是一款面向办公、创作和编程任务的AI桌面智能体。

相关专题

更多
html版权符号
html版权符号

html版权符号是“©”,可以在html源文件中直接输入或者从word中复制粘贴过来,php中文网还为大家带来html的相关下载资源、相关课程以及相关文章等内容,供大家免费下载使用。

5275

2023.06.14

html在线编辑器
html在线编辑器

html在线编辑器是用于在线编辑的工具,编辑的内容是基于HTML的文档。它经常被应用于留言板留言、论坛发贴、Blog编写日志或等需要用户输入普通HTML的地方,是Web应用的常用模块之一。php中文网为大家带来了html在线编辑器的相关教程、以及相关文章等内容,供大家免费下载使用。

3052

2023.06.21

html网页制作
html网页制作

html网页制作是指使用超文本标记语言来设计和创建网页的过程,html是一种标记语言,它使用标记来描述文档结构和语义,并定义了网页中的各种元素和内容的呈现方式。本专题为大家提供html网页制作的相关的文章、下载、课程内容,供大家免费下载体验。

2710

2023.07.31

html空格
html空格

html空格是一种用于在网页中添加间隔和对齐文本的特殊字符,被用于在网页中插入额外的空间,以改变元素之间的排列和对齐方式。本专题为大家提供html空格的相关的文章、下载、课程内容,供大家免费下载体验。

2739

2023.08.01

html是什么
html是什么

HTML是一种标准标记语言,用于创建和呈现网页的结构和内容,是互联网发展的基石,为网页开发提供了丰富的功能和灵活性。本专题为大家提供html相关的各种文章、以及下载和课程。

4639

2023.08.11

html字体大小怎么设置
html字体大小怎么设置

在网页设计中,字体大小的选择是至关重要的。合理的字体大小不仅可以提升网页的可读性,还能够影响用户对网页整体布局的感知。php中文网将介绍一些常用的方法和技巧,帮助您在HTML中设置合适的字体大小。

2681

2023.08.11

html转txt
html转txt

html转txt的方法有使用文本编辑器、使用在线转换工具和使用Python编程。本专题为大家提供html转txt相关的文章、下载、课程内容,供大家免费下载体验。

2469

2023.08.31

html文本框代码怎么写
html文本框代码怎么写

html文本框代码:1、单行文本框【<input type="text" style="height:..;width:..;" />】;2、多行文本框【textarea style=";height:;"></textare】。

2248

2023.09.01

LLVM自定义Pass怎么写
LLVM自定义Pass怎么写

本专题聚焦LLVM自定义Pass开发,整理Pass类结构、run()方法、PreservedAnalyses、CMake构建、插件注册、-load-pass-plugin加载和测试用例编写流程。

0

2026.09.30

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
兄弟连高洛峰HTML+HTML5视频教程
兄弟连高洛峰HTML+HTML5视频教程

共32课时 | 8.1万人学习

Web前端入门基础教程
Web前端入门基础教程

共251课时 | 96.2万人学习

GDB 17.2 官方文档集合
GDB 17.2 官方文档集合

共0课时 | 0人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn