在C#后端开发中,处理HTML文档的动态操作是常见需求,比如批量修改网页模板内容、解析并调整爬取到的HTML结构、动态生成定制化HTML片段等。Html Agility Pack是一款专为.NET平台设计的HTML解析库,它支持标准的DOM操作接口,能够轻松实现对HTML元素的增删改查,且兼容不规范的HTML文档,非常适合这类场景。

环境准备与基础配置
首先需要在项目中引入Html Agility Pack库,可通过NuGet包管理器直接安装,搜索HtmlAgilityPack选择最新稳定版本安装即可。安装完成后,在代码文件中引入对应的命名空间:
using HtmlAgilityPack;
接下来创建一个基础的HTML文档对象,后续的所有元素操作都将基于这个对象展开:
// 加载HTML字符串
string html = @"<html>
<head><title>测试页面</title></head>
<body>
<div id=""content"">
<p class=""text"">原始段落内容</p>
<ul id=""list"">
<li>列表项1</li>
</ul>
</div>
</body>
</html>";
HtmlDocument doc = new HtmlDocument();
doc.LoadHtml(html);HTML元素的查询与读取
动态操作的第一步通常是定位到目标元素,Html Agility Pack提供了多种查询方式,常用的有通过XPath表达式查询和通过属性筛选查询。
通过XPath查询元素
XPath是XML文档的查询语言,同样适用于HTML文档,使用SelectSingleNode可以查询单个元素,SelectNodes可以查询多个匹配的元素:
// 查询id为content的div元素
HtmlNode contentDiv = doc.DocumentNode.SelectSingleNode("//div[@id='content']");
// 查询所有class为text的p元素
HtmlNodeCollection textNodes = doc.DocumentNode.SelectNodes("//p[@class='text']");
// 读取元素的文本内容
if (textNodes != null && textNodes.Count > 0)
{
string originalText = textNodes[0].InnerText; // 结果为:原始段落内容
}通过属性筛选查询
除了XPath,还可以通过遍历元素集合筛选符合条件的节点:
// 获取所有div元素
HtmlNodeCollection allDivs = doc.DocumentNode.SelectNodes("//div");
if (allDivs != null)
{
foreach (HtmlNode div in allDivs)
{
// 筛选id为list的ul元素的父节点
if (div.Id == "content")
{
HtmlNode listUl = div.SelectSingleNode(".//ul[@id='list']");
}
}
}HTML元素的动态修改
定位到目标元素后,可以对元素的属性、内容、结构进行修改,这是动态操作的核心部分。
修改元素属性与内容
可以直接通过SetAttributeValue方法修改元素属性,通过InnerText或InnerHtml修改元素内容:
// 修改p元素的class属性
HtmlNode textP = doc.DocumentNode.SelectSingleNode("//p[@class='text']");
if (textP != null)
{
textP.SetAttributeValue("class", "new-text"); // 修改class为new-text
textP.InnerText = "修改后的段落内容"; // 修改文本内容
}
// 修改div元素的自定义属性
HtmlNode contentDiv = doc.DocumentNode.SelectSingleNode("//div[@id='content']");
contentDiv.SetAttributeValue("data-custom", "test-value"); // 添加自定义属性添加与删除元素
可以通过AppendChild、PrependChild方法添加子元素,通过Remove方法删除元素:
// 向ul中添加新的列表项
HtmlNode listUl = doc.DocumentNode.SelectSingleNode("//ul[@id='list']");
if (listUl != null)
{
// 创建新的li元素
HtmlNode newLi = doc.CreateElement("li");
newLi.InnerText = "列表项2";
listUl.AppendChild(newLi); // 添加为ul的子元素
}
// 删除指定的p元素
HtmlNode textP = doc.DocumentNode.SelectSingleNode("//p[@class='new-text']");
if (textP != null)
{
textP.Remove(); // 从文档中移除该元素
}替换元素内容
如果需要替换整个元素的内容,可以使用ReplaceChild方法:
// 替换ul元素
HtmlNode oldUl = doc.DocumentNode.SelectSingleNode("//ul[@id='list']");
if (oldUl != null)
{
HtmlNode newUl = doc.CreateElement("ul");
newUl.SetAttributeValue("id", "new-list");
HtmlNode newLi = doc.CreateElement("li");
newLi.InnerText = "新列表项";
newUl.AppendChild(newLi);
oldUl.ParentNode.ReplaceChild(newUl, oldUl); // 替换旧ul为新ul
}操作结果输出与保存
完成所有动态操作后,可以将修改后的HTML文档输出为字符串,或者保存到本地文件:
// 输出修改后的HTML字符串
string modifiedHtml = doc.DocumentNode.OuterHtml;
Console.WriteLine(modifiedHtml);
// 保存到本地文件
doc.Save("modified.html");注意事项
在使用Html Agility Pack进行HTML元素动态操作时,需要注意几个问题:一是如果操作的HTML文档包含不完整或不符合规范的标签,库会自动尝试修复,但可能存在部分结构偏差,建议尽量使用规范的HTML作为输入;二是修改元素属性时,如果属性不存在会自动创建,无需提前判断;三是操作完成后如果需要保留格式,可以通过doc.Save的重载方法指定编码和格式选项。
C#Html_Agility_PackHTML元素操作动态DOM修改修改时间:2026-06-06 00:31:16