Go语言标准库encoding/xml提供了对XML的解析与生成能力,但在面对CDATA区块和注释时,其行为与开发者直觉可能存在差异。理解这些机制有助于在配置文件读取、接口报文处理等场景中避免数据丢失。

解析XML中的CDATA
在Go中解析XML时,CDATA区块内的文本会被自动合并到对应元素的字符数据中,无需额外设置。例如以下XML:
<note><![CDATA[hello & world]]></note>
使用结构体解析时,字段会直接得到hello & world这样的字符串,其中的特殊字符已被正确解码。
package main
import (
"encoding/xml"
"fmt"
"strings"
)
type Note struct {
XMLName xml.Name `xml:"note"`
Content string `xml:"chardata"`
}
func main() {
data := `<note><![CDATA[hello & world]]></note>`
var n Note
xml.Unmarshal([]byte(data), &n)
fmt.Println(n.Content) // 输出: hello & world
}
解析XML中的注释
默认情况下,xml.Unmarshal会跳过注释。如果需要读取注释,必须使用基于token的解析方式,通过判断xml.Comment类型获取内容。
package main
import (
"encoding/xml"
"fmt"
"strings"
)
func main() {
data := `<root><!-- 这是注释 --><item>x</item></root>`
dec := xml.NewDecoder(strings.NewReader(data))
for {
tok, err := dec.Token()
if err != nil {
break
}
if c, ok := tok.(xml.Comment); ok {
fmt.Println("注释:", string(c)) // 输出: 注释: 这是注释
}
}
}
生成包含CDATA的XML
Go的结构体标签无法直接标记某个字段为CDATA,但可以通过将字段类型设为string并在序列化前包裹CDATA文本来模拟。更稳妥的做法是使用xml.CharData配合自定义类型。
package main
import (
"encoding/xml"
"fmt"
)
type CData struct {
Value string
}
func (c CData) MarshalXML(e *xml.Encoder, start xml.StartElement) error {
return e.EncodeElement(struct {
string `xml:",cdata"`
}{c.Value}, start)
}
type Doc struct {
XMLName xml.Name `xml:"doc"`
Text CData `xml:"text"`
}
func main() {
d := Doc{Text: CData{Value: "a & b"}}
out, _ := xml.Marshal(d)
fmt.Println(string(out))
}
生成包含注释的XML
要在生成的XML中写入注释,可以使用Encoder的EncodeToken方法手动写入xml.Comment。
package main
import (
"encoding/xml"
"fmt"
"bytes"
)
func main() {
var buf bytes.Buffer
enc := xml.NewEncoder(&buf)
enc.EncodeToken(xml.StartElement{Name: xml.Name{Local: "root"}})
enc.EncodeToken(xml.Comment(" 说明信息 "))
enc.EncodeToken(xml.CharData("content"))
enc.EncodeToken(xml.EndElement{Name: xml.Name{Local: "root"}})
enc.Flush()
fmt.Println(buf.String())
}
注意事项
- 解析注释必须采用token方式,普通结构体绑定无法获得注释。
- CDATA在解析后不再带有特殊标记,仅作为普通文本处理。
- 生成CDATA时注意转义,避免内部文本破坏XML结构。