扫描PDF添加OCR文字层:OCRmyPDF 新手功能指南
【免费下载链接】OCRmyPDFOCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched项目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDF
扫描版PDF里搜不到那个词,是不是很烦?OCRmyPDF 是一个 PDF OCR 命令行工具,它给扫描的PDF添加文字层,让文字变得可搜索。装好之后,一条命令就能拿到可检索的文档。
它解决什么、适合谁
很多老档案、合同和论文只以扫描件的形式存在,看上去是文字,其实是图像。Ctrl+F 一无所获,复制粘贴也行不通。OCRmyPDF 先把页面渲染成图像,交给 Tesseract 识别,再把文字层贴回原始PDF,版式保持不变。扫描图像原样保留,文字可以选中、复制。混合了图像和电子文字的文件,已有文字会自动跳过,只识别图像部分。
它适合给老档案做数字化的人,也适合归档发票合同、让扫描论文可引用的人。
| 能力 | 说明 | 边界/注意 |
|---|---|---|
| 添加OCR文字层 | 文字可搜索、可复制 | 不识别手写体 |
| 智能跳过页面 | 已有文字页不重复处理 | 需要重做时加--force-ocr |
| 图像预处理 | 清理、纠偏后再识别 | 外观可能略有变化 |
五分钟上手
安装很轻,一条包解决:
| 操作系统 | 命令 | 备注 |
|---|---|---|
| Ubuntu/Debian | sudo apt install ocrmypdf | 官方仓库 |
| macOS | brew install ocrmypdf | Homebrew |
| Windows | pip install ocrmypdf | 需另装 Tesseract |
最小命令就一行,输入是扫描件,输出是带文字层的新PDF:
ocrmypdf 输入.pdf 输出.pdf中文文档加一个语言参数即可:
ocrmypdf -l chi_sim 中文.pdf 可搜索.pdf进阶玩法(按需选学)
--deskew
ocrmypdf --deskew 输入.pdf 输出.pdf扫描页歪斜、文字行倾斜时用它,先纠偏再识别,准确率更稳。
-j 4
ocrmypdf -j 4 大文档.pdf 输出.pdf页数多的大文档用它,多页并行处理,速度明显更快。
--sidecar
ocrmypdf --sidecar 结果.txt 输入.pdf 输出.pdf除了PDF还想导出识别出的纯文本时用它,方便做索引或后续加工。
一个真实场景走一遍
输入:一份老式打字机排版的菜谱扫描件,整页都是图像,一个字都搜不到。文档是荷兰语,顺带纠偏。
ocrmypdf -l nld --deskew 老菜谱.pdf 可搜索菜谱.pdf结果:输出的扫描图像和原件看起来一样,但文字可以选中、复制了。搜索一个食材,能直接跳到对应页面。输出默认是存档级的 PDF/A 格式,适合长期保存。
换成你的文档,只需改这两处:输入文件名和语言代码。
避坑与自查
- 错字多 → 先加
--clean清理图像,或换更高 DPI 重扫 - 处理慢 → 加
-j 4开启并行 - 阅读器提示 PDF/A 格式告警 → 加
--output-type pdf换成普通PDF
OCRmyPDF 是一个给扫描PDF添加文字层的免费开源工具,适合长期、批量地做档案数字化。先拿一份小文档试跑一遍,跑通了,再处理你那批老档案。
小提示:新手第一件事,是用--pages 1只处理第一页,确认识别质量再处理整个文件。
【免费下载链接】OCRmyPDFOCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched项目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDF
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考