讲师中心 微信公众号
AI工具推荐 视频效率加速

如何从 XML 字符串中提取指定元素的文本值

千敏小哥_3163

千敏小哥_3163

发布时间:2026-08-18 15:05:07

|

358人浏览过

|

来源于php中文网

原创

如何从 XML 字符串中提取指定元素的文本值

本文介绍在 java 中将数据库返回的 xml 字符串解析并提取任意节点文本内容的完整方法,涵盖 xml 校验、dom 解析、命名空间处理及常见错误规避。

本文介绍在 java 中将数据库返回的 xml 字符串解析并提取任意节点文本内容的完整方法,涵盖 xml 校验、dom 解析、命名空间处理及常见错误规避。

在 Java 开发中,经常需要从数据库读取 XML 格式的字符串(如 CLOB 字段),并从中提取特定字段的文本值(例如 <id></id> 的内容)。但初学者常陷入两个误区:一是误以为“XML 作为字符串”就无需解析,直接用正则或 substring 处理;二是忽略 XML 结构合法性与命名空间问题,导致解析失败。

首先,请务必确保你的 XML 是语法正确且格式良好(well-formed) 的。你提供的示例中存在明显错误,例如:

<From>
  asfaoi232sdianscv
</Fr>  <!-- ❌ 应为 </From>,标签不匹配 -->

此类错误会使任何标准 XML 解析器(DOM/SAX/StAX)抛出 SAXParseException。因此,在解析前建议先做基础校验——可借助在线工具或通过 DocumentBuilder 的验证模式快速检测:

DocumentBuilderFactory factory = DocumentBuilderFactory.newInstance();
factory.setValidating(false); // 不启用 DTD 验证(通常不需要)
factory.setNamespaceAware(true); // ✅ 关键!启用命名空间支持

由于你的 XML 声明了默认命名空间 xmlns="urn:iso:std:iso:20022:tech:xsd:",直接使用 getElementsByTagName("Wllt") 将无法匹配(因为 Wllt 实际属于该命名空间)。此时需采用带命名空间的查找方式。以下是推荐的完整解决方案(基于 DOM API,简洁易懂,适合业务逻辑开发):

import org.w3c.dom.*;
import javax.xml.parsers.*;
import java.io.*;
import java.nio.charset.StandardCharsets;

public class XmlTextExtractor {
    public static String extractTextFromXml(String xmlString, String tagName, String namespaceUri) {
        try (InputStream is = new ByteArrayInputStream(xmlString.getBytes(StandardCharsets.UTF_8))) {
            DocumentBuilderFactory factory = DocumentBuilderFactory.newInstance();
            factory.setNamespaceAware(true); // 必须启用!

            DocumentBuilder builder = factory.newDocumentBuilder();
            Document doc = builder.parse(is);
            doc.getDocumentElement().normalize();

            // 使用 XPath 是更健壮的方式(推荐)
            javax.xml.xpath.XPath xPath = javax.xml.xpath.XPathFactory.newInstance().newXPath();
            xPath.setNamespaceContext(new NamespaceContext() {
                @Override
                public String getNamespaceURI(String prefix) {
                    return "urn:iso:std:iso:20022:tech:xsd:".equals(prefix) ? 
                           "urn:iso:std:iso:20022:tech:xsd:" : null;
                }
                @Override public String getPrefix(String uri) { return null; }
                @Override public java.util.Iterator getPrefixes(String uri) { return null; }
            });

            // 示例:提取 <Wllt><Id> 的文本值
            String expression = "//*[local-name()='Wllt']/*[local-name()='Id']/text()";
            String result = xPath.compile(expression).evaluate(doc).trim();
            return result.isEmpty() ? null : result;

        } catch (Exception e) {
            throw new RuntimeException("Failed to parse or extract from XML", e);
        }
    }

    // 使用示例
    public static void main(String[] args) {
        String xml = "<?xml version=\"1.0\" encoding=\"UTF-8\"?>\n" +
                "<Document xmlns=\"urn:iso:std:iso:20022:tech:xsd:\">\n" +
                "  <GetWlltInf>\n" +
                "    <Req>\n" +
                "      <ReqCrit>\n" +
                "        <Pty>\n" +
                "          <Wllt>\n" +
                "            <Id>sck12312-asdasd621j23-asdasdgsfg</Id>\n" +
                "          </Wllt>\n" +
                "        </Pty>\n" +
                "      </ReqCrit>\n" +
                "    </Req>\n" +
                "  </GetWlltInf>\n" +
                "</Document>";

        String idValue = extractTextFromXml(xml, "Id", "urn:iso:std:iso:20022:tech:xsd:");
        System.out.println("Extracted ID: " + idValue); // 输出: sck12312-asdasd621j23-asdasdgsfg
    }
}

✅ 关键要点总结:

  • 永远先修复 XML 合法性:标签必须严格闭合,属性引号完整,命名空间声明一致;
  • 启用 setNamespaceAware(true):否则带 xmlns 的文档无法正确查询;
  • 优先使用 XPath 而非 getElementsByTagName():XPath 支持 local-name() 等函数,能绕过命名空间前缀干扰,语义清晰且路径灵活;
  • 避免正则解析 XML:XML 嵌套、转义、空白处理复杂,正则极易出错且不可维护;
  • 资源及时关闭:使用 try-with-resources 管理 InputStream,防止内存泄漏。

如果你的应用对性能极度敏感(如每秒解析数万 XML),可考虑 StAX(XMLStreamReader)进行流式解析,但对绝大多数业务场景,DOM + XPath 组合已足够高效、安全且易于调试。

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

热门AI工具

更多
UpDream
UpDream Hot

一款AI视频创作工具,主要用于哔哩哔哩推出的自研AI视频创作工具,适合需要提升相关任务效率的用户。

切问学术

切问学术是一款AI论文写作工具,复旦大学NLP团队推出的AI学术智能体。

DeepSeek

DeepSeek是一款面向对话、写作、编程和推理场景的AI大模型工具。

豆包大模型

豆包大模型是一款由字节跳动推出的企业级大语言模型服务平台。

立刻MV
立刻MV Hot

立刻MV是一款AI文本写作工具,AI 音乐视频(MV)创作工具。

WorkBuddy

一款AI办公效率工具,主要用于腾讯云推出的AI原生桌面智能体工作台,适合需要提升相关任务效率的用户。

PixPix
PixPix Hot

PixPix是一款面向电商视觉生产的AI商品图生成工具。

音述AI
音述AI Hot

一款AI音频处理工具,主要用于音述AI是一个以“用声音述说故事”为核心的 AI 音乐创作与声音分享社区,适合需要提升相关任务效率的用户。

AionClaw
AionClaw Hot

AionClaw是一款面向办公、创作和编程任务的AI桌面智能体。

相关专题

更多
java
java

Java是一个通用术语,用于表示Java软件及其组件,包括“Java运行时环境 (JRE)”、“Java虚拟机 (JVM)”以及“插件”。php中文网还为大家带了Java相关下载资源、相关课程以及相关文章等内容,供大家免费下载使用。

10017

2023.06.15

java正则表达式语法
java正则表达式语法

java正则表达式语法是一种模式匹配工具,它非常有用,可以在处理文本和字符串时快速地查找、替换、验证和提取特定的模式和数据。本专题提供java正则表达式语法的相关文章、下载和专题,供大家免费下载体验。

7162

2023.07.05

java自学难吗
java自学难吗

Java自学并不难。Java语言相对于其他一些编程语言而言,有着较为简洁和易读的语法,本专题为大家提供java自学难吗相关的文章,大家可以免费体验。

6292

2023.07.31

java配置jdk环境变量
java配置jdk环境变量

Java是一种广泛使用的高级编程语言,用于开发各种类型的应用程序。为了能够在计算机上正确运行和编译Java代码,需要正确配置Java Development Kit(JDK)环境变量。php中文网给大家带来了相关的教程以及文章,欢迎大家前来阅读学习。

1084

2023.08.01

java保留两位小数
java保留两位小数

Java是一种广泛应用于编程领域的高级编程语言。在Java中,保留两位小数是指在进行数值计算或输出时,限制小数部分只有两位有效数字,并将多余的位数进行四舍五入或截取。php中文网给大家带来了相关的教程以及文章,欢迎大家前来阅读学习。

908

2023.08.02

java基本数据类型
java基本数据类型

java基本数据类型有:1、byte;2、short;3、int;4、long;5、float;6、double;7、char;8、boolean。本专题为大家提供java基本数据类型的相关的文章、下载、课程内容,供大家免费下载体验。

1316

2023.08.02

java有什么用
java有什么用

java可以开发应用程序、移动应用、Web应用、企业级应用、嵌入式系统等方面。本专题为大家提供java有什么用的相关的文章、下载、课程内容,供大家免费下载体验。

2629

2023.08.02

java在线网站
java在线网站

Java在线网站是指提供Java编程学习、实践和交流平台的网络服务。近年来,随着Java语言在软件开发领域的广泛应用,越来越多的人对Java编程感兴趣,并希望能够通过在线网站来学习和提高自己的Java编程技能。php中文网给大家带来了相关的视频、教程以及文章,欢迎大家前来学习阅读和下载。

19951

2023.08.03

C++运算符基础入门
C++运算符基础入门

本专题详细讲解了C++运算符的类型、语法与使用方法,涵盖算术运算符、关系运算符、逻辑运算符、位运算符、赋值运算符、条件运算符及其他特殊运算符,并通过代码示例解析优先级与结合性。

0

2026.10.09

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
热门推荐
/
最新课程
关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn