在C#开发中,读取PDF文本内容是一项高频需求,很多场景下需要从PDF文件中提取文字信息用于后续处理。PDFBox和PdfiumViewer是两款常用的C# PDF解析工具,二者各有优势,开发者可以根据项目需求选择合适的方案。

PDFBox解析器使用方案
PDFBox是Apache开源的PDF处理库,提供了丰富的PDF操作功能,在C#中可以通过IKVM工具将Java版本的PDFBox转换为.NET可用的程序集,也可以使用社区封装好的.NET版本库。
环境配置
首先需要通过NuGet安装对应的PDFBox包,搜索PDFBox选择适配.NET版本的包安装即可,安装完成后项目会自动引用相关依赖。
核心代码实现
以下是使用PDFBox读取PDF文本的示例代码:
using org.apache.pdfbox.pdmodel;
using org.apache.pdfbox.text;
using System;
using System.IO;
namespace PdfReadDemo
{
class PdfBoxReader
{
public static string ReadPdfText(string filePath)
{
// 初始化PDF文档对象
PDDocument document = PDDocument.load(new FileInfo(filePath));
// 创建PDF文本剥离器对象
PDFTextStripper textStripper = new PDFTextStripper();
// 设置读取的起始页和结束页,默认读取所有页
textStripper.setStartPage(1);
textStripper.setEndPage(document.getNumberOfPages());
// 提取文本内容
string pdfText = textStripper.getText(document);
// 关闭文档释放资源
document.close();
return pdfText;
}
}
}
PdfiumViewer解析器使用方案
PdfiumViewer是基于Google开源PDF引擎Pdfium封装的.NET库,解析速度快,对中文等复杂字符的支持较好,适合对性能要求较高的场景。
环境配置
通过NuGet搜索PdfiumViewer安装对应的包,安装时会自动下载对应平台的Pdfium原生依赖,无需额外配置环境。
核心代码实现
以下是使用PdfiumViewer读取PDF文本的示例代码:
using PdfiumViewer;
using System;
using System.IO;
using System.Text;
namespace PdfReadDemo
{
class PdfiumViewerReader
{
public static string ReadPdfText(string filePath)
{
// 使用using语句自动释放资源
using (var document = PdfDocument.Load(filePath))
{
StringBuilder textBuilder = new StringBuilder();
// 遍历所有页面提取文本
for (int i = 0; i < document.PageCount; i++)
{
string pageText = document.GetPdfText(i);
textBuilder.Append(pageText);
}
return textBuilder.ToString();
}
}
}
}
两种解析器对比
我们可以通过以下维度对比二者的差异,方便选择:
| 对比维度 | PDFBox | PdfiumViewer |
|---|---|---|
| 解析速度 | 中等 | 较快 |
| 中文支持 | 需要额外配置字体映射 | 原生支持较好 |
| 功能丰富度 | 支持PDF创建、编辑、签名等多种操作 | 仅支持PDF渲染和基础文本提取 |
| 依赖体积 | 较大 | 较小 |
使用注意事项
- 读取PDF文本时,如果PDF是扫描件,两种解析器都无法直接提取文字,需要先配合OCR工具识别后再处理。
- 使用PDFBox时如果遇到中文乱码,需要检查是否加载了对应的中文字体文件,配置字体映射规则。
- 两种解析器都需要在使用完成后及时释放文档资源,避免内存泄漏。
- 如果项目只需要读取PDF文本,优先选择PdfiumViewer可以获得更好的性能表现;如果需要更多PDF操作功能,再选择PDFBox。
C#PDFBoxPdfiumViewerPDF文本读取修改时间:2026-07-22 01:24:23