strip_tags()是最安全的默认选择,专为去除HTML标签设计,不依赖正则,能正确处理嵌套、自闭合、注释和PHP标签;默认保留文本内容,支持传入白名单数组放行指定标签。

用 strip_tags() 是最安全的默认选择
绝大多数场景下,直接调用 strip_tags() 就够了——它专为这个目的设计,不依赖正则,能正确处理嵌套、自闭合、注释和 PHP 标签等边界情况。比如:strip_tags('<p>Hello <script>alert(1)</script></p>') 返回 "Hello ",不会因正则误匹配而残留或截断。
注意两点:
• 它默认保留 <p><br> 等常见标签内容(即只删标签,不删文本);
• 如果想放行某些标签,传第二个参数数组:strip_tags($html, ['<p>', '<strong>'])。
正则 preg_replace() 去标签仅适用于简单、可控输入
如果你明确知道 HTML 结构极简(比如只有 <b><i> 且无属性、无换行、无注释),可用正则快速清理:
$clean = preg_replace('/<[^>]*>/i', '', $html);但这条正则会出问题的情况很多:
• 遇到 <script>var s = "<div>";</script> 时,提前在引号内闭合,导致误删后续文本;
• 不处理 CDATA 或 HTML 注释 <!-- ... -->;
• 对 <img src="a<b.jpg"> 这类属性含 < 的会崩溃;
• /i 忽略大小写虽方便,但若需保留大小写敏感的业务逻辑(如 XML 混用),反而引入歧义。
立即学习“PHP免费学习笔记(深入)”;
需要保留换行或空格?别指望正则自动补
原始 HTML 中的 <br><p> 被删后,段落会挤成一行。若希望换行符替代这些标签,得手动映射:
$html = preg_replace('/<\/?p>/i', "\n", $html);
$html = preg_replace('/<br\s*\/?>/i', "\n", $html);
$clean = preg_replace('/<[^>]*>/i', '', $html);但更稳妥的做法是先用 strip_tags() 清洗,再对结果做字符串替换:
• 先 $text = strip_tags($html);
• 再 str_replace(["\n", "\r"], ' ', $text) 或 preg_replace('/\s+/', ' ', $text) 控制空白;
• 单独处理换行需求,比在正则里混搭逻辑更清晰、可测。
遇到 Warning: preg_replace(): Compilation failed 怎么办
这个错误通常是因为正则中用了未转义的特殊字符,尤其是当 HTML 片段来自用户输入、含 /[]{} 时。例如:preg_replace('/<'.$tag.'>/', '', $html) 中 $tag 是 'div class="x"',会导致编译失败。
解决方法:
• 绝对不要拼接用户数据进正则模式;
• 如必须动态构造,用 preg_quote($tag, '/') 转义;
• 更推荐绕过正则:用 DOMDocument 解析后再提取文本(适合复杂需求,但开销大);
• 或坚持用 strip_tags() + 字符串预处理,95% 的需求都不需要碰正则。
真正难的不是写对那条正则,而是判断“这个 HTML 是否真的能被正则安全处理”——一旦有外部输入、富文本编辑器输出或 CMS 导入内容,正则就大概率成为技术债源头。



















