XML作为一种常用的数据交换格式,有严格的语法规则,其中部分字符被赋予了特殊的语法含义,如果直接在XML的元素内容或属性值中使用这些字符,会导致XML解析器无法正确识别文件结构,进而抛出解析错误。因此掌握XML特殊字符的转义规则是编写合法XML文件的基础。

需要转义的特殊字符及预定义实体引用
XML语法中规定了5个必须转义的特殊字符,每个字符都对应一个预定义的实体引用,开发者可以直接使用这些实体引用来替代原字符,具体对应关系如下:
| 特殊字符 | 字符含义 | 实体引用 |
|---|---|---|
| < | 标签开始符号 | < |
| > | 标签结束符号 | > |
| & | 实体引用开始符号 | & |
| " | 属性值引号 | " |
| ' | 属性值单引号 | ' |
比如我们需要在XML元素中存储一段包含小于号的表达式a < b,如果直接写成<expr>a < b</expr>,解析器会把<识别为新的标签开始,导致结构错误。正确的写法应该是使用实体引用:
<?xml version="1.0" encoding="UTF-8"?>
<root>
<expr>a < b</expr>
</root>
自定义实体引用
除了预定义的实体引用之外,XML还支持开发者自定义实体引用,适合在需要重复使用长文本或者特殊内容的场景中使用。自定义实体需要在XML的文档类型定义(DTD)部分声明,声明语法为<!ENTITY 实体名称 "实体内容">。
例如我们需要多次在XML中引用公司地址,就可以自定义一个实体:
<?xml version="1.0" encoding="UTF-8"?>
<!DOCTYPE root [
<!ENTITY companyAddr "XX市XX区XX路123号">
]>
<root>
<office>&companyAddr;</office>
<warehouse>&companyAddr;</warehouse>
</root>
解析器在解析时会把&companyAddr;自动替换为对应的实体内容,这样既减少了重复编写的工作量,也方便后续统一修改内容。
CDATA段的使用场景
如果一段内容中包含大量需要转义的特殊字符,逐个替换实体引用会非常繁琐,此时可以使用CDATA段来包裹内容。CDATA段中的内容会被解析器当作纯文本处理,不会解析其中的XML语法字符,语法格式为<![CDATA[ 内容 ]]>。
比如需要存储一段JavaScript代码,其中包含很多<和&字符:
<?xml version="1.0" encoding="UTF-8"?>
<root>
<script>
<![CDATA[
function test() {
if (a < 10 && b > 5) {
return true;
}
return false;
}
]]>
</script>
</root>
需要注意的是,CDATA段内部不能包含]]>字符串,否则会被解析器识别为CDATA段的结束,这种情况下还是需要使用实体引用来处理。
不同场景下的转义注意事项
在属性值中使用特殊字符时,需要根据属性值的引号类型选择转义方式。如果属性值用双引号包裹,内部的双引号需要转义为";如果用单引号包裹,内部的单引号需要转义为'。
例如属性值包含双引号的写法:
<user desc="他说:"今天天气很好"">张三</user>
另外在生成XML文件时,很多编程语言都提供了内置的XML转义方法,不需要手动逐个替换字符。比如Java中可以使用StringEscapeUtils.escapeXml11()方法,Python中可以使用xml.sax.saxutils.escape()方法,这些方法会自动处理所有需要转义的特殊字符,避免手动转义出现遗漏。