在XML文档中,CDATA区块用来包含不被解析器当作标记处理的原始文本。当我们需要修改CDATA里面的内容时,不能简单地用字符串替换整个文件,而应当通过XML解析器加载文档,找到对应的文本节点或CDATA节点,再更新其内容并保存。

什么是CDATA
CDATA全称是Character Data,写法为<![CDATA[ 内容 ]]>。在括号中的内容会被XML解析器视为纯文本,即使里面出现<或者&也不会报错。常见用途是存放代码片段、SQL语句或带有特殊符号的配置。
使用Python修改CDATA
Python标准库xml.dom.minidom可以把XML读成DOM树。CDATA节在DOM中表现为CDATASection节点,我们可以遍历找到它并修改data属性。
import xml.dom.minidom as minidom
# 原始XML字符串
xml_str = '<root><desc><![CDATA[旧内容]]></desc></root>'
# 解析文档
doc = minidom.parseString(xml_str)
# 找到desc节点下的CDATA节点
desc = doc.getElementsByTagName('desc')[0]
for node in desc.childNodes:
if node.nodeType == node.CDATA_SECTION_NODE:
# 修改CDATA内容
node.data = '新内容包含<特殊符号>和&符号'
# 生成修改后的XML
new_xml = doc.toxml(encoding='utf-8')
print(new_xml.decode('utf-8'))
使用Java修改CDATA
Java的DOM API中,CDATA节点类型是CDATASection,同样通过getTextContent和setTextContent来读写。注意setTextContent会自动按文本处理,不会破坏CDATA结构。
import javax.xml.parsers.*;
import org.w3c.dom.*;
import javax.xml.transform.*;
import javax.xml.transform.dom.DOMSource;
import javax.xml.transform.stream.StreamResult;
import java.io.*;
public class EditCData {
public static void main(String[] args) throws Exception {
String xml = "<root><desc><![CDATA[旧内容]]></desc></root>";
DocumentBuilder db = DocumentBuilderFactory.newInstance().newDocumentBuilder();
Document doc = db.parse(new ByteArrayInputStream(xml.getBytes("utf-8")));
Node desc = doc.getElementsByTagName("desc").item(0);
NodeList children = desc.getChildNodes();
for (int i = 0; i < children.getLength(); i++) {
Node n = children.item(i);
if (n.getNodeType() == Node.CDATA_SECTION_NODE) {
n.setTextContent("新内容包含<标签>文本");
}
}
Transformer tf = TransformerFactory.newInstance().newTransformer();
tf.transform(new DOMSource(doc), new StreamResult(System.out));
}
}
注意事项
- 修改CDATA时不要手动拼接字符串去替换<![CDATA[,容易遗漏结尾导致格式错误。
- 如果原节点是普通文本节点而非CDATA,用setTextContent会写成普通文本,特殊字符会被转义。
- 写回文件建议用解析器自带的序列化方法,保证声明和编码正确。
核心思路:把XML当作文档对象来操作,而不是纯文本,才能安全修改CDATA内容。
小结
无论是Python、Java还是其他语言,修改XML中CDATA内容的步骤都类似:解析、定位CDATA节点、设置新文本、序列化输出。掌握这种方式,就能在配置处理、报文生成等场景中灵活维护XML数据。