在Python中处理XML数据时,文档通常被解析为一棵由元素节点构成的树。每个节点可能包含若干子节点,子节点自身又可能继续嵌套,形成任意深度的结构。要完整访问整棵树的所有节点,最直观且可控的方式就是使用递归遍历。通过编写一个接受节点作为参数、再对其子节点调用自身的函数,我们可以系统地访问每一个元素,并提取标签名、属性和文本等信息。

使用ElementTree解析XML
Python内置的xml.etree.ElementTree模块能够将XML字符串或文件解析为Element对象树。根元素通过getroot方法获取,而每一个Element实例都具备tag、attrib以及text等基础属性,并且可以通过list(element)或element的迭代操作拿到它的直接子节点。理解这种树形映射关系,是写出递归遍历函数的前提。
下面是一段最基础的解析示例,将一个简单XML读入内存并得到根节点。注意实际项目中应优先考虑是否信任数据源,因为默认解析器会处理外部实体,在不可信输入下存在安全风险,此时可改用defusedxml库。
import xml.etree.ElementTree as ET
xml_data = """
<root>
<item id="1">第一层</item>
<group>
<item id="2">第二层</item>
</group>
</root>
"""
tree = ET.fromstring(xml_data)
root = tree # fromstring直接返回根Element
print(root.tag)
编写递归遍历函数
递归遍历的核心思想是:对当前节点做需要处理的工作,然后遍历它的每一个子节点,把子节点当作新的当前节点再次调用同一函数。这样无论XML有多少层,函数都会自动向下深入,直到叶子节点没有子节点时自然返回,再回溯处理同级其余分支。
下面的代码展示了一个通用的递归遍历实现。函数中我们打印了节点的标签、属性以及去空白后的文本,同时记录了节点所在的深度,方便观察树形结构。使用depth参数可以避免使用全局变量,也让递归逻辑更清晰。
import xml.etree.ElementTree as ET
def walk_node(node, depth=0):
# 处理当前节点
text = (node.text or "").strip()
print(" " * depth + "标签:" + node.tag + " 属性:" + str(node.attrib) + " 文本:" + text)
# 递归处理子节点
for child in list(node):
walk_node(child, depth + 1)
xml_data = """
<root>
<item id="1">第一层</item>
<group>
<item id="2">第二层</item>
</group>
</root>
"""
root = ET.fromstring(xml_data)
walk_node(root)
运行上述代码后,控制台会按深度优先顺序输出每个节点的信息。这种写法比单纯用for循环只能看一层要灵活得多,并且你可以在walk_node内部轻易加入条件判断,比如只处理特定标签或者统计某类节点的数量。
处理命名空间与空白节点
实际XML常带有命名空间,解析后tag字段会变成类似{http://ippipp.com/ns}localname的形式。如果直接打印会影响可读性,可以在递归函数里用正则表达式或字符串分割把命名空间前缀去掉。此外,格式化缩进产生的纯空白文本会被存为某些节点的text或tail,遍历时要注意用strip过滤,否则容易误把空白当成有效内容。
以下示例在递归时清理了命名空间并显示更友好的标签名,同时忽略完全没有实际文本和子元素的纯空白节点,使输出更贴近业务数据。
import xml.etree.ElementTree as ET
import re
def clean_tag(tag):
return re.sub(r'{.*}', '', tag)
def walk_clean(node, depth=0):
tag = clean_tag(node.tag)
text = (node.text or "").strip()
if tag or text or len(list(node)) > 0:
print(" " * depth + "标签:" + tag + " 属性:" + str(node.attrib) + " 文本:" + text)
for child in list(node):
walk_clean(child, depth + 1)
xml_ns = """
<root xmlns="http://ipipp.com/ns">
<item id="1">内容A</item>
<group>
<item id="2">内容B</item>
</group>
</root>
"""
root = ET.fromstring(xml_ns)
walk_clean(root)
递归与内置迭代器的对比
ElementTree本身提供了node.iter()方法,它能以深度优先方式迭代整棵树,代码更短。但递归函数的优势在于可在进入和离开节点时分别插入逻辑,比如维护路径栈、做前后置处理,或在某些条件下提前剪枝不再下探。内置迭代器则更适合单纯读取,不支持中途灵活分支控制。
下表简要对比了两种方式的特征,便于在不同需求下做选择。
| 方式 | 代码复杂度 | 控制力 | 适用场景 |
|---|---|---|---|
| 递归函数 | 中等 | 强,可剪枝和记录状态 | 需要过滤、计数或路径追踪 |
| node.iter() | 低 | 弱,只能顺序读取 | 简单全量提取 |
综上,掌握手写递归遍历能让你在面对复杂XML时拥有更完整的操作自由度,同时也加深对树形数据结构的理解。在项目里封装好通用的walk函数,后续处理各类配置文件或接口报文都会更加高效。