
本文介绍两种高效、可靠的方法(beautifulsoup + pandas 和 pandas 内置 read_xml)将 six group 发布的 iso 4217 xml 货币数据解析为结构化 csv,准确提取 ctrynm、ccynm、ccy、ccynbr、ccymnrunts 五列。
本文介绍两种高效、可靠的方法(beautifulsoup + pandas 和 pandas 内置 read_xml)将 six group 发布的 iso 4217 xml 货币数据解析为结构化 csv,准确提取 ctrynm、ccynm、ccy、ccynbr、ccymnrunts 五列。
XML 文件嵌套层级较深(根节点为 <ISO_4217>,目标数据位于 <CcyTbl>/<CcyNtry>),直接使用 root.findall('CcyNtry') 会失败——因为 CcyNtry 并非 root 的直接子元素,而是嵌套在 <CcyTbl> 下。原代码未正确指定 XPath 路径,导致遍历为空,最终生成空 CSV。
以下是两种推荐方案,均经过实测可稳定处理该 XML(含 Unicode 国家名、特殊值如 "N.A." 和 "NaN"),并自动对齐字段:
✅ 方案一:使用 pandas.read_xml()(最简洁,推荐)
pandas 从 1.3 版本起原生支持 XML 解析,一行代码即可完成结构化提取:
import pandas as pd
url = "https://www.six-group.com/dam/download/financial-information/data-center/iso-currrency/lists/list-one.xml"
# 指定 XPath 定位到每个 CcyNtry 元素,自动映射子标签为列名
df = pd.read_xml(url, xpath=".//CcyNtry")
# 保存为 CSV(不保留索引,确保纯数据格式)
df.to_csv("iso_currency.csv", index=False)
print(f"成功导出 {len(df)} 条记录")
print(df[["CtryNm", "CcyNm", "Ccy", "CcyNbr", "CcyMnrUnts"]].head())⚠️ 注意:需确保 pandas ≥ 1.3 且已安装 lxml 或 xml.etree(默认可用)。若遇解析异常,可显式指定解析器:pd.read_xml(..., parser="lxml")。
立即学习“Python免费学习笔记(深入)”;
✅ 方案二:使用 BeautifulSoup(灵活性更高)
适用于复杂 XML 或需预处理场景(如清洗 N.A.、跳过注释等):
import requests
import pandas as pd
from bs4 import BeautifulSoup
url = "https://www.six-group.com/dam/download/financial-information/data-center/iso-currrency/lists/list-one.xml"
response = requests.get(url)
response.raise_for_status() # 确保请求成功
soup = BeautifulSoup(response.content, "xml")
data = []
for ccy_ntry in soup.select("CcyNtry"):
row = {}
for tag in ccy_ntry.find_all(recursive=False): # 仅取直接子标签,避免嵌套干扰
# 清理特殊值:将 "N.A." 和空值转为 pandas NaN
text = tag.text.strip() if tag.text else ""
if text in ["N.A.", ""]:
row[tag.name] = None
else:
row[tag.name] = text
data.append(row)
df = pd.DataFrame(data)
df.to_csv("iso_currency_bs.csv", index=False)? 关键要点总结
- 路径必须精确:CcyNtry 在 <CcyTbl> 内,XPath 应用 .//CcyNtry(任意深度)或 ./CcyTbl/CcyNtry(严格层级);
- 编码与字符兼容性:Six Group XML 声明 <?xml version="1.0" encoding="UTF-8"?>,BeautifulSoup 和 pandas 默认支持 UTF-8,无需额外解码;
- 缺失值处理:原始 XML 中 CcyMnrUnts 含 "N.A.",read_xml() 会自动转为 NaN;BeautifulSoup 方案中建议主动标准化;
- 性能对比:read_xml() 更快、内存更优;BeautifulSoup 更适合需要逐节点校验或修改的场景。
执行任一方案后,你将获得标准 CSV 文件,可直接导入 Excel、数据库或用于后续分析——5 列完整、顺序一致、无乱码,真正实现“一键结构化”。


















