免费合并 PDF、自动加书签、无损抠图,这个叫 PDF 补丁丁的工具箱能干什么
【免费下载链接】PDFPatcherPDF补丁丁——PDF工具箱,可以编辑书签、剪裁旋转页面、解除限制、提取或合并文档,探查文档结构,提取图片、转成图片等等项目地址: https://gitcode.com/GitHub_Trending/pd/PDFPatcher
PDF 补丁丁(PDFPatcher)是个 Windows 上的免费 PDF 工具箱,能合并拆分文档、自动加书签、无损抠图、解除打印/复制限制、把文档结构导成 XML,适合要批量整理扫描 PDF 和电子书的人。它用 C# 和 .NET Framework 写,底层是 iText 加 MuPDF。
先说一个具体场景:你从扫描店拿回一本 200 页的书,转成 PDF 后一个书签都没有,目录还是图片;想把每章做成可点导航,只能手动在书签面板里一项项加,加到天黑。或者公司要把 30 份尺寸不一的报表合订成一份,合并完页面大小乱七八糟没法直接打。这类"不难但极费手"的活,就是它想接住的部分。
主界面:上方是菜单和工具栏,下方按"处理文件 / 合并文件 / 编辑书签 / 识别图像文本 / 提取图片"等功能区分块,点开哪个功能就在下面多开一个选项卡。
解压就能跑,先把手里的 PDF 打开看看
它是绿色便携软件,不用装:把目录解出来双击 PDFPatcher.exe 即可,卸载就是删掉整个目录。运行环境只有两条——Windows 7 以上、装了 .NET Framework 4.0 到 4.8。OCR 那一项额外要求装过 Office 2003/2007 的 Document Imaging 组件(MODI),没有它只能跳过"识别图像文本",其它功能照常。
拿到手后最短的一条路径是:菜单打开一个 PDF → 右侧阅读器把页面渲染出来 → 左侧书签树同步显示。它也能认命令行里传进来的 .pdf 路径,把几个文件路径一起粘进去会逐个丢进书签编辑器。不过这里的"命令行"只是把文件带进来,不是无界面批处理,边界一节再展开。
合并、拆页、抠图:最耗时间的三个动作先做完
上手之后按使用频次排,最常被用的是"处理 / 合并 PDF 文件"这一个入口,里面塞了合并、拆分、补页、统一页面尺寸、去限制、重压缩黑白图这些动作。左侧拖进一批文件或整目录,右侧选"独立补丁"(改属性、去限制、统一尺寸)或"合并文件"(多份拼一份),指定输出路径点"生成 PDF 文件"。合并时给每份文件在"书签文本"列填一句,拼好的文档就自带一层导航;页码范围支持"10-1"这种逆序写法,顺手就能做页面重排。
"处理 PDF 文件"选项卡:源文件列表、独立补丁 / 合并 / 重命名三种模式,以及输出路径设置。
另一个高频动作是抠图。"提取图片"把文档里嵌的图片按原始编码无损导出,不做二次压缩;反过来"提取页面"能把指定页码抠成独立文件。两个动作配合,基本覆盖"从别人的 PDF 里捞素材"这类需求。
给没有书签的大文档,自动补上一套导航
回到开头那本 200 页的书。"自动生成书签"不是 OCR,而是分析页面文本的字号:尺寸大于你设的"标题文本尺寸"的文本被认作标题,再按字号差自动组织成多级书签,输出成一个 XML 信息文件。第一次跑出来的结果通常不干净,回选项里调字号、加忽略规则(正则、忽略纯数字页码、忽略下沉大字)再重跑,直到层级满意。
更省事的做法是跳过自动识别,直接进"编辑书签":打开 PDF 后书签树可直接拖拽、复制粘贴,改颜色、粗体、目标页码、缩放都在这,还支持带正则的查找替换。改完点"补丁",它复制原文件生成一份带新书签的 PDF,原文件不动,效果在阅读器里立刻能验证。
处理后的文档在 Adobe Reader 里的书签树,点击"阴阳应象大论第五"即可跳转到对应章节。
把文档结构导出成 XML,改完再导回去
真正拉开差距的是"信息文件"这一步。在"独立补丁"模式下点"导出信息文件",它把文档属性、书签、页面链接、阅读器设置、页面尺寸写成一个 .xml;你用文本或 XML 工具改里面的内容,再指定这个 xml 点"导入信息文件",程序把源 PDF 与 xml 合并成新 PDF。改页码编号、批量调书签定位坐标、修掉改名后失效的链接,都走这条路。批量时它按文件名一一对应,一堆文档可以一起导、一起导回。
第一步:导出信息文件,把文档属性、书签、页面设置写进 XML。
第二步:导入改好的 XML,与源文件合并生成新文档。
想改得更深,"文档结构探查器"把 PDF 内部节点以树视图摊开,能看能改,也能把节点或整页内容流导成 XML/二进制,给做 PDF 开发的人调试用。相关算法都在 App/Processor/ 里,内容流解析在 App/Processor/ContentProcessors/。
它做不了什么,哪类人别指望它
🚫 说几个实在的:
- 只有 Windows。它是 .NET Framework 的 WinForms 程序,不是跨平台的,macOS、Linux 上跑不了。
- OCR 依赖微软 MODI。没装 Office 2003/2007 文档成像组件,"识别图像文本"这项就是空的。
- 命令行很弱。传 PDF 路径只是把文件带进编辑器,没有 headless 批处理、没有能控制"合并哪些页、书签怎么挂"的脚本参数。想全自动跑一批,它不合适。
- 它不是排版编辑器。你不能像 Word 一样改正文、重排段落;它的"编辑"集中在书签、页面、属性、结构这些元数据和页面级操作。
- 授权基于 AGPL,另附一条"良心授权"说明;对用户就是免费、无广告、无功能墙,拿源码做产品的人动手前先读 README.md。
怎么拿到它,卡住了去哪儿问
要源码,一条命令:
git clone https://gitcode.com/GitHub_Trending/pd/PDFPatcher
要自己编译,用 Visual Studio 2022 及以上,装".NET 桌面开发"和"C++ 桌面开发"两个工作负载(后者给 JBIG2 压缩组件用);老项目可能提示目标框架过时,把目标改成 .NET Framework 4.8 即可。当前版本是 1.2.0.0。操作细节看 doc/使用手册.md,改 XML 前先对照 doc/example.xml 这份信息文件样例。
该用它:你有一批扫描 PDF、论文、电子书要合并、加书签、抠图、去限制,而且愿意为"自动生成的书签"手动微调一两次——回报是省掉大量重复点击。别指望它:你要的是无界面自动化、跨平台,或改正文文字。下一步,拿一份"没书签的大文档"走一遍"自动生成书签 → 导出信息文件 → 改 XML → 导入"这条链路,跑通了你就知道它值不值得留在工具栏里。
【免费下载链接】PDFPatcherPDF补丁丁——PDF工具箱,可以编辑书签、剪裁旋转页面、解除限制、提取或合并文档,探查文档结构,提取图片、转成图片等等项目地址: https://gitcode.com/GitHub_Trending/pd/PDFPatcher
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考