PDF补丁丁:免费开源的PDF工具箱,批量处理书签、合并与图片提取
【免费下载链接】PDFPatcherPDF补丁丁——PDF工具箱,可以编辑书签、剪裁旋转页面、解除限制、提取或合并文档,探查文档结构,提取图片、转成图片等等项目地址: https://gitcode.com/GitHub_Trending/pd/PDFPatcher
PDF补丁丁(PDFPatcher)是一款免费开源的PDF工具箱,专治扫描文档无书签、多个PDF难合并、高清图难提取这几类痛点。它基于 .NET Framework 开发,整合了 iText 与 MuPDF 两个开源组件,适合需要批量整理文档的Windows用户和PDF开发者。
它能做什么 🧰
| 你遇到的痛点 | PDF补丁丁的解法 |
|---|---|
| 扫描版电子书没有书签,翻页全靠拖进度条 | 「自动生成书签」分析页面文本尺寸,自动把大标题识别成层级书签;也可用简易文本书签文件导入 |
| 一堆图片或PDF要合成一本,还要保留目录 | 「合并文件」功能把图片和PDF混合导入,按列表顺序生成新文档,并可挂上新书签 |
| 想拿走PDF里的高清插图,复制粘贴全是马赛克 | 「提取图片」功能无损导出图片,支持合并被切碎的拼图、纠正颠倒颜色 |
| 文档禁止复制打印、页面尺寸不统一、页码错乱 | 「处理PDF文档」可解除限制、统一页面尺寸、修改逻辑页码,一次批量处理多个文件 |
| 想搞清楚PDF内部结构,好做二次开发 | 「文档结构探查器」以树视图展示文档节点,可导出XML供分析调试 |
快速上手 ⚡
- 获取程序:下载预编译包解压即可使用;如从源码构建,先克隆仓库
git clone https://gitcode.com/GitHub_Trending/pd/PDFPatcher,用 Visual Studio 2022 安装「.NET 桌面开发」和「C++ 桌面开发」工作负载后编译。 - 确认运行环境:Windows 7 以上系统,已安装 .NET Framework 4.0–4.8;若要用文字识别,还需 Office 2003/2007 的 Document Imaging(MODI)组件。
- 启动程序:PDF补丁丁是便携软件,无需安装,直接运行
PDFPatcher.exe。 - 完成首次处理:点击工具栏「添加文件」加入PDF,在「输出PDF文件」处指定保存位置,点击「生成PDF文件」。
图:PDF补丁丁主界面,上方是菜单与工具栏,中间是源文件列表,底部是信息文件路径、输出路径与「生成PDF文件」按钮
核心功能实战
如何自动生成PDF书签
场景:你有一本影印版电子书,没有任何导航书签,几百页只能靠滚动查看。
操作:
- 点击工具栏「自动生成书签」(识别标题为书签)按钮,在「原始PDF文件」处浏览选中目标文件。
- 在「PDF信息文件」处指定输出位置,调整「标题文本尺寸」,让稍大的标题文字被识别为书签项。
- 点击「导出信息文件」,观察日志窗口里识别出的标题、级别和页码,不满意就调整筛选条件重新导出。
- 转回「处理PDF文档」的独立补丁模式,用生成的信息文件执行补丁,得到带书签的新PDF。
效果:在阅读器中打开新文档,左侧出现与章节对应的书签树,点击即可跳转到对应页。
图:给影印版《黄帝内经》挂上书签后的阅读效果,左侧书签与正文标题一一对应
如何批量合并PDF文件
场景:手头有一批扫描图片加几个旧PDF,想拼成一本可打印的文档。
操作:
- 点击工具栏「合并文件」按钮,打开合并界面。
- 用「添加文件」或「添加文件夹」把 JPEG、PNG、TIFF 图片和PDF文件加入列表;每张图片会成为文档的一页。
- 双击列表中的PDF文件,可指定页码范围(支持「10-1」这类逆序范围),实现拆分或重排。
- 在列表「书签文本」列输入文字为新文档挂书签,指定「输出PDF文件」后点击「生成PDF文件」。
效果:输出一个页面尺寸统一、带导航书签的新PDF;如果希望横图自动转横页,可在「合并文档选项」的页面布局中勾选自动旋转页面。
图:合并文档功能界面,左侧是功能选择,中间文件列表可混合图片与PDF,底部指定输出路径后生成文件
如何无损提取PDF图片
场景:PDF里的插图被切成了碎片、颜色还上下颠倒,想拿到原始质量的图片素材。
操作:
- 选择「提取图片」功能,在「原始PDF文件」处浏览选中目标文档。
- 在「输出位置」处选择保存目录。
- 按需勾选「尝试合并相同页面的图片」(拼回碎片图)、「反转黑白图片的颜色」等提取选项,也可填「页码范围」只提取部分页面。
- 点击「提取图片」按钮,进度可在「输出信息」界面随时终止。
效果:图片按原压缩格式无损导出——JPEG 出.jpg、黑白图出.tif、彩色图出.png,文件名默认按页码编号,掩码可自定义。
一次完整操作演示 🎬
以「编辑后重新导入书签」为例,走通高级补丁功能最完整的一条链路。
第一步:导出信息文件。在「处理PDF文档」的独立补丁模式下添加文件,在「PDF信息文件」处指定XML保存位置,点击「导出信息文件」。目的是把文档属性、书签、页面链接等信息抽成一份可编辑的XML,不动原PDF。
图:高级补丁第一步——添加源文件后指定PDF信息文件路径,点击「导出信息文件」
第二步:修改信息文件。用文本编辑器打开XML,增删书签、调整页码与页面设置;也可以直接放入一份外部制作好的书签文件。目的是完成「想改什么就改什么」的编辑工作。
第三步:导入生成新文件。回到独立补丁模式,指定源PDF与信息文件,在「输出PDF文件」处指定新文件路径,点击「生成PDF文件」。程序将信息文件合并回原PDF,生成携带新设置的文件,原文件保持不变。
图:高级补丁第二步——指定输出PDF文件路径后点击「生成PDF文件」,完成信息文件导入
进阶用户
- 大文件处理:程序支持打开并修改超过 2GB 的PDF文档,批量处理时建议在「添加文件前清空列表」复选框取消勾选后分多次添加,避免误清空已排队文件。
- 关键配置位置:选项类定义集中在 App/Options/,如 MergerOptions.cs(合并选项)、OcrOptions.cs(识别选项);完整参数说明见 doc/使用手册.md。
- 源码结构:界面在 App/Functions/,处理算法在 App/Processor/,数据模型在 App/Model/:
App/ ├── Common/ # 通用工具类 ├── Functions/ # 各功能窗体与控件 ├── Lib/ # 第三方组件(iTextSharp、MuPDFLib等) ├── Model/ # 高级数据模型 ├── Options/ # 选项配置 └── Processor/ # PDF处理核心算法- 扩展入口:新增页面处理逻辑可参考 App/Processor/ContentProcessors/ 下的 IPageProcessor 实现;文档结构解析逻辑在 App/Model/PdfStructInfo.cs。
常见问题
Q:支持哪些操作系统?A:Windows 7 及以上,需 .NET Framework 4.0–4.8。软件为便携版,解压即用,删除目录即完成卸载。
Q:加密的PDF能处理吗?A:可以,但需要提供正确的打开密码,程序会弹出身份验证对话框。它不提供密码破解功能。
Q:文字识别(OCR)功能有什么前提条件?A:需要安装 Microsoft Office 2003 或 2007 的 Document Imaging 组件(MODI),识别引擎依赖该组件。
Q:超过 2GB 的超大PDF能打开吗?A:可以,程序专门优化了大文件处理,支持打开并修改超过 2GB 的文档。
Q:扫描版图片和纯文本PDF都能自动生成书签吗?A:自动生成书签针对的是含可选文本的PDF,原理是分析字体尺寸识别大标题,不做OCR;纯扫描图片建议先用「识别图像文本」转成文字,再配合识别目录页功能生成书签。
Q:如何把识别结果写回PDF?A:可以。「识别图像文本」功能支持将识别出的文字写入PDF文件,让扫描版文档可被搜索和复制。
回到开头那三类痛点:没有书签的扫描书、拼不拢的散页、拿不走的插图,PDF补丁丁都给了直接的操作入口——「自动生成书签」「合并文件」「提取图片」,全部免费、无广告、开源可查。如果你正被PDF整理工作困扰,现在就可以解压运行 PDFPatcher.exe,从合并一批图片开始试起;如果你熟悉 .NET 开发,也可以从 App/Processor/ 入手,为这个工具补上你缺的那块拼图。
【免费下载链接】PDFPatcherPDF补丁丁——PDF工具箱,可以编辑书签、剪裁旋转页面、解除限制、提取或合并文档,探查文档结构,提取图片、转成图片等等项目地址: https://gitcode.com/GitHub_Trending/pd/PDFPatcher
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考