XML作为一种通用的数据交换格式,在配置文件、接口报文和文档存储中仍然被广泛使用。但在实际开发中,XML处理往往暗藏不少陷阱,稍不注意就会导致程序异常甚至安全漏洞。

常见陷阱一:字符编码问题
XML声明中指定的编码和实际字节流编码不一致,是最常见的乱码根源。例如文件以UTF-8无BOM保存,但声明写成<?xml version="1.0" encoding="GBK"?>,解析器就会按GBK读取从而产生乱码。
规避方法
- 确保文件实际编码与XML声明中的encoding一致
- 读写时使用同一种字符集,如统一用UTF-8
常见陷阱二:特殊字符未转义
在XML文本内容中,<、>、&等字符具有特殊含义,若直接写入数据会破坏结构。比如把数学公式 a < b 写成 a < b 才合法,否则解析器会误以为是标签。
应使用对应的实体引用:
| 字符 | 实体 |
|---|---|
| < | < |
| > | > |
| & | & |
常见陷阱三:命名空间混淆
带有命名空间的XML,如果使用XPath时忽略前缀映射,查询结果会为空。例如下面这段XML:
<root xmlns:ns="https://ipipp.com/ns"> <ns:item>值</ns:item> </root>
若直接用 /root/item 查询将匹配不到,必须注册命名空间前缀后再用 /ns:root/ns:item 查询。
常见陷阱四:外部实体注入
开启外部实体解析的XML解析器,可能被恶意XML读取服务器本地文件。如下面的payload:
<?xml version="1.0"?> <!DOCTYPE foo [ <!ENTITY xxe SYSTEM "file:///etc/passwd"> ]> <foo>&xxe;</foo>
建议禁用DOCTYPE和实体扩展,以Java为例:
import javax.xml.parsers.DocumentBuilderFactory;
public class SafeParse {
public static void main(String[] args) throws Exception {
DocumentBuilderFactory dbf = DocumentBuilderFactory.newInstance();
// 禁用外部实体和DOCTYPE
dbf.setFeature("http://apache.org/xml/features/disallow-doctype-decl", true);
dbf.setFeature("http://xml.org/sax/features/external-general-entities", false);
dbf.setFeature("http://xml.org/sax/features/external-parameter-entities", false);
System.out.println("安全解析器已配置");
}
}
常见陷阱五:大文件导致内存溢出
使用DOM一次性加载整棵文档树,遇到几百MB的XML就会撑爆内存。此时应改用SAX或StAX这类流式解析方式,边读边处理。
import xml.etree.ElementTree as ET
# 使用迭代解析避免全量加载
for event, elem in ET.iterparse("big.xml", events=("end",)):
if elem.tag == "record":
print(elem.text)
elem.clear() # 处理完即释放
小结
XML处理中的陷阱主要集中在编码、特殊字符、命名空间、安全和性能五个方面。只要在解析前明确编码、做好转义、谨慎对待命名空间,并关闭不必要的外部实体功能,就能规避绝大多数问题。