商城首页欢迎来到中国正版软件门户

您的位置: 首页 > 文章列表 > 编程开发 > C#代码实现读取并导出PDF书签

C#代码实现读取并导出PDF书签

  发布于2026-07-18 阅读(0)

扫一扫,手机访问

PDF书签这玩意儿,说白了就是文档的“导航地图”。对于动辄几百页的技术手册或者电子书来说,要是没有书签,想精准定位到某个章节,简直像大海捞针。所以,如果能把这些书签信息提取出来,生成目录、做索引,甚至分析文档结构,就成了很多开发者的刚需。今天咱们就来聊聊,如何用C#配合一个免费的库——Free Spire.PDF for .NET,把PDF里那些多级嵌套的书签,连同标题、显示样式,一股脑儿全导出到文本文件里。

C#代码实现读取并导出PDF书签

1. 环境准备

1.1 安装免费库

先得把工具准备好。在Visual Studio里打开NuGet包管理器,搜索安装Free Spire.PDF就行。命令行敲一句也很快:

Install-Package FreeSpire.PDF

这个免费版本,读取基础书签、页面操作这些常用功能都够用了,不需要额外授权。不过得注意,它对单个PDF文件有10页的页数限制,做原型验证或者小规模处理完全没问题。

1.2 引用命名空间

代码里要引入下面这几个命名空间,缺一不可:

using System;
using System.IO;
using System.Text;
using Spire.Pdf;
using Spire.Pdf.Bookmarks;

2. 核心实现逻辑

整个过程其实可以拆成四个步骤,逻辑很清晰:

  1. 加载目标PDF文档。
  2. 拿到文档的PdfBookmarkCollection书签集合。
  3. 递归遍历每个书签及其子书签,把标题和显示样式抓出来。
  4. 最后把提取到的内容一股脑写入文本文件。

2.1 加载文档并获取书签集合

PdfDocument pdf = new PdfDocument();
pdf.LoadFromFile(@"D:\test.pdf");
PdfBookmarkCollection bookmarks = pdf.Bookmarks;

Bookmarks属性返回的就是顶层书签的集合。如果文档压根没做书签,那Count属性就会是0,后面逻辑里需要处理一下这种情况。

2.2 递归遍历书签树

书签的结构是典型的树形结构——每个书签节点都可能“生”出子书签,子书签还能继续往下长。所以遍历时必须用递归。通常的做法是设计两个方法:

  • GetBookmarks:负责处理顶层书签,创建StringBuilder,然后启动递归。
  • GetChildBookmark:专门递归处理子书签。
public static void GetBookmarks(PdfBookmarkCollection bookmarks, string result)
{
    StringBuilder content = new StringBuilder();
    if (bookmarks.Count > 0)
    {
        content.AppendLine("Pdf bookmarks:");
        foreach (PdfBookmark parentBookmark in bookmarks)
        {
            // 拿到标题
            content.AppendLine(parentBookmark.Title);
            // 拿到显示样式,比如普通、粗体、斜体
            content.AppendLine(parentBookmark.DisplayStyle.ToString());
            // 递归处理子书签
            GetChildBookmark(parentBookmark, content);
        }
    }
    File.WriteAllText(result, content.ToString());
}

递归方法长这样:

public static void GetChildBookmark(PdfBookmark parentBookmark, StringBuilder content)
{
    if (parentBookmark.Count > 0)
    {
        foreach (PdfBookmark childBookmark in parentBookmark)
        {
            content.AppendLine(childBookmark.Title);
            content.AppendLine(childBookmark.DisplayStyle.ToString());
            GetChildBookmark(childBookmark, content);
        }
    }
}

2.3 完整代码示例

下面是一个控制台应用程序的完整代码,运行后会把书签信息输出到GetPdfBookmarks.txt文件里。

using System;
using System.IO;
using System.Text;
using Spire.Pdf;
using Spire.Pdf.Bookmarks;

namespace GetBookmark
{
    internal class Program
    {
        static void Main(string[] args)
        {
            PdfDocument pdf = new PdfDocument();
            pdf.LoadFromFile(@"D:\testp\test.pdf");

            PdfBookmarkCollection bookmarks = pdf.Bookmarks;
            string result = "GetPdfBookmarks.txt";
            GetBookmarks(bookmarks, result);

            Console.WriteLine("书签提取完成,结果已保存至:" + result);
        }

        public static void GetBookmarks(PdfBookmarkCollection bookmarks, string result)
        {
            StringBuilder content = new StringBuilder();
            if (bookmarks.Count > 0)
            {
                content.AppendLine("Pdf bookmarks:");
                foreach (PdfBookmark parentBookmark in bookmarks)
                {
                    content.AppendLine(parentBookmark.Title);
                    content.AppendLine(parentBookmark.DisplayStyle.ToString());
                    GetChildBookmark(parentBookmark, content);
                }
            }
            else
            {
                content.AppendLine("该 PDF 文档不包含任何书签。");
            }
            File.WriteAllText(result, content.ToString());
        }

        public static void GetChildBookmark(PdfBookmark parentBookmark, StringBuilder content)
        {
            if (parentBookmark.Count > 0)
            {
                foreach (PdfBookmark childBookmark in parentBookmark)
                {
                    content.AppendLine(childBookmark.Title);
                    content.AppendLine(childBookmark.DisplayStyle.ToString());
                    GetChildBookmark(childBookmark, content);
                }
            }
        }
    }
}

3. 输出格式说明

生成的文本文件,每两行数据代表一个书签:第一行是标题,第二行是显示样式。举个例子:

Pdf bookmarks:

第1章 简介

Regular

1.1 背景

Bold

1.2 目标

Italic

第2章 实现

Regular

2.1 环境搭建

Regular

DisplayStyle是一个枚举,常见值包括:

  • Regular:普通文本
  • Bold:粗体
  • Italic:斜体

输出结果会根据PDF里实际的书签样式动态变化。

4. 注意事项与扩展

4.1 书签可能为空

如果PDF确实没有书签,代码里已经做了判断,bookmarks.Count为0时会写入提示信息,避免生成一个空文件让开发者摸不着头脑。

4.2 目标页码与动作的获取

上面的示例只获取了标题和样式。如果还想拿到书签跳转的目标页码,可以用PdfBookmark.Action属性,不过需要判断一下动作类型。像这样:

if (parentBookmark.Action is PdfGoToAction goToAction)
{
    int pageIndex = pdf.Pages.IndexOf(goToAction.Destination.Page);
    content.AppendLine($"跳转至第 {pageIndex + 1} 页");
}

Free Spire.PDF对Action的支持还算完整,可以根据实际需求灵活扩展。

4.3 性能考虑

对于那种包含几千个书签的超大PDF,递归遍历一般不会造成性能瓶颈。但如果需要频繁提取,可以考虑把StringBuilder换成StreamWriter流式写入,这样能有效降低内存占用,跑起来更稳。

4.4 编码处理

File.WriteAllText默认使用UTF-8编码。如果要求指定编码,比如GB2312,那改用StreamWriter就行,灵活度更高。

5. 总结

这篇文章展示了一个很实用的场景:如何利用免费的.NET库,把PDF文档里多级嵌套的书签信息完整提取出来。几个关键技术点值得记住:

  • 通过PdfDocument.Bookmarks拿到根书签集合。
  • 递归遍历PdfBookmark节点的Count和索引器。
  • 读取TitleDisplayStyle属性。
  • 把结构化数据写入文本文件保存。

这种方法不依赖Adobe Acrobat或者其他GUI工具,非常适合集成到后台服务或者文档处理管道里。开发者完全可以基于上面的模式继续扩展,比如获取书签的页码、缩放方式,甚至修改书签结构,都是可行的。

本文转载于:https://www.jb51.net/program/3623034fe.htm 如有侵犯,请联系zhengruancom@outlook.com删除。
免责声明:正软商城发布此文仅为传递信息,不代表正软商城认同其观点或证实其描述。

热门关注