需用requests加User-Agent头获取Sitemap,再用xml.etree.ElementTree解析;遇命名空间须声明前缀字典,根为sitemapindex时需递归解析子链接,并用urljoin补全相对路径。

用 requests + xml.etree.ElementTree 读取并解析 Sitemap XML
绝大多数公开 Sitemap(如 https://example.com/sitemap.xml)是标准 XML 格式,无需第三方库就能解析。关键不是“能不能”,而是“怎么安全地读+正确地找 <loc>”。
常见错误:直接 urlopen 不加 headers 被 403 拒绝;或用 BeautifulSoup 解析 XML 导致嵌套错乱(它默认按 HTML 规则修复标签)。
- 必须加
User-Agent头,否则多数站点返回 403:headers = {"User-Agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36"} - 用
xml.etree.ElementTree.parse()读本地文件,或用ET.fromstring(r.text)解析响应体(r = requests.get(...)) - Sitemap 可能嵌套(
<sitemapindex>包含多个<sitemap>),需先判断根节点是urlset还是sitemapindex
处理嵌套 Sitemap:递归抓取 sitemapindex 下的子 Sitemap
大型网站常用分片式 Sitemap,主文件是 sitemapindex,里面每个 <loc> 指向一个子 sitemap.xml(可能又是 index 或 urlset)。不递归就只能拿到几十个 URL。
注意:子 Sitemap 的 URL 可能是绝对路径,也可能是相对路径(如 /sitemap-posts.xml),需用 urllib.parse.urljoin() 补全。
立即学习“Python免费学习笔记(深入)”;
- 检查根元素:
root.tag == "sitemapindex"→ 进入递归分支;== "urlset"→ 直接提取<url>/<loc> - 每层递归前加简单延时(如
time.sleep(0.3)),避免触发风控 - 用集合(
set)去重,防止同一子 Sitemap 被多次引用
提取 <loc> 时绕过命名空间干扰
部分 Sitemap 声明了 XML 命名空间(如 xmlns="http://www.sitemaps.org/schemas/sitemap/0.9"),此时直接 root.findall("url/loc") 返回空列表——因为 ElementTree 把带命名空间的标签当成了不同命名域。
解决方案不是删 XML 头,而是显式声明命名空间字典:
ns = {"sm": "http://www.sitemaps.org/schemas/sitemap/0.9"}
urls = [url.find("sm:loc", ns).text for url in root.findall("sm:url", ns)]
如果不确定命名空间 URI,可先打印 root.tag 看是否含 {...} 前缀,再提取括号内字符串作为 ns 的 value。
解析失败时快速定位是网络问题还是 XML 结构异常
报错 xml.etree.ElementTree.ParseError: not well-formed 不一定代表 XML 本身损坏,更可能是:
- HTTP 响应体实际是 HTML(如 404 页面、防火墙拦截页),用
r.headers.get("content-type")检查是否含xml - 响应被 gzip 压缩但未自动解压(
requests默认会解,但某些代理可能破坏 header)→ 打印len(r.content)和r.content[:100]看开头是不是乱码 - Sitemap 是 gzipped 文件(后缀
.xml.gz),需用gzip.decompress(r.content)再解析
真正复杂的点在于:Sitemap 规范允许混合 urlset 和 sitemapindex,甚至支持 <image:loc> 等扩展字段,但多数爬虫只需 <loc>。别过早抽象通用解析器,先写死处理这三种结构更稳。


















