在XML和HTML文档解析场景中,XPath是常用的节点定位工具,选择所有没有属性的元素是常见的需求,核心是通过XPath的谓词条件来过滤元素节点的属性集合。

XPath选择无属性元素的核心语法
XPath中每个元素节点都有@*属性轴,代表该元素的所有属性节点。要判断元素没有属性,只需要判断该元素的@*轴返回的属性节点数量为0即可,对应的表达式写法为:
//*[count(@*) = 0]
表达式的含义拆解如下:
//*:匹配文档中所有的元素节点count(@*):统计当前元素的所有属性节点数量= 0:筛选属性数量为0的元素,即没有属性的元素
不同场景的使用示例
示例1:解析HTML文档
假设我们有如下HTML片段,需要选出所有没有属性的元素:
<div class="container">
<p>这是没有属性的段落</p>
<span id="test">这是有id属性的span</span>
<ul>
<li>无属性列表项</li>
<li class="item">有class的列表项</li>
</ul>
<div>无属性div</div>
</div>
使用//*[count(@*) = 0]表达式,匹配到的元素为:
<p>这是没有属性的段落</p><li>无属性列表项</li><div>无属性div</div>
示例2:解析XML文档
对于XML文档,同样的语法同样适用,比如如下XML片段:
<root>
<user age="20">张三</user>
<user>李四</user>
<book category="tech">XPath教程</book>
<book>XML基础</book>
</root>
执行//*[count(@*) = 0]后,会匹配到<user>李四</user>和<book>XML基础</book>两个元素。
其他可选写法及对比
除了使用count(@*) = 0的写法,还可以使用not(@*)的谓词条件,表达式如下:
//*[not(@*)]
两种写法的效果完全一致,not(@*)的含义是当前元素不存在任何属性节点,逻辑上和count(@*) = 0等价,开发者可以根据自己的习惯选择使用。
常见注意事项
- 该表达式只会匹配元素节点,不会匹配属性节点、文本节点等其他类型的节点,如果需要匹配其他类型节点需要调整节点测试部分
- 如果元素有默认属性(比如HTML中<input>的type默认属性),部分解析器可能会将其算作属性,需要根据实际使用的解析器特性调整判断逻辑
- 表达式中
@*代表所有属性,不会区分属性的具体名称,只要存在任意属性就会被排除
代码示例:Python中使用XPath选择无属性元素
以下是使用Python的lxml库解析HTML并选择无属性元素的完整示例:
from lxml import etree
# 定义HTML内容
html_content = """
<div class="container">
<p>这是没有属性的段落</p>
<span id="test">这是有id属性的span</span>
<ul>
<li>无属性列表项</li>
<li class="item">有class的列表项</li>
</ul>
<div>无属性div</div>
</div>
"""
# 解析HTML
tree = etree.HTML(html_content)
# 使用XPath选择所有没有属性的元素
no_attr_elements = tree.xpath('//*[count(@*) = 0]')
# 输出匹配到的元素标签和文本
for elem in no_attr_elements:
print(f"标签名:{elem.tag},文本内容:{elem.text}")
运行上述代码后,输出结果如下:
标签名:p,文本内容:这是没有属性的段落 标签名:li,文本内容:无属性列表项 标签名:div,文本内容:无属性div