3 条命令让扫描 PDF 可检索|OCRmyPDF 做 OCR PDF 转换
【免费下载链接】OCRmyPDFOCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched项目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDF
扫描出来的 PDF 文字是图片,怎么选都复制不出来。OCRmyPDF 帮你把可检索文本层垫到图片下面,是一款免费的 OCR PDF 转换命令行工具,识别文字和原图精确对齐。
它凭什么比隔壁强
不少 OCR 产品要开 GUI、拖文件、等进度。这个是纯命令行,装好之后一条命令就能跑,可以直接塞进脚本或者计划任务里。它离线运行,文件不出你的机器。Tesseract 引擎内置,装好语言包就能识别中文、日文等上百种语言,不用单独调包。输出默认是 PDF/A,长期归档格式,归档场景不用再转一遍。我用下来三个月,体感是:结果稳,复制粘贴对得准,省了不少校对时间。
第一次跑起来要装什么
Debian/Ubuntu 上用官方包管理器,是最短路径:
# 中文注释:主程序和OCR引擎一次装齐 sudo apt install ocrmypdf tesseract-ocrmacOS 把这一行换成brew install ocrmypdf tesseract。然后一条命令就出结果:
# 中文注释:输入扫描文件,输出可搜索版本 ocrmypdf input.pdf output.pdf输入不一定是 PDF,JPG、PNG 也行:
# 中文注释:扫描图片直接转成带文本层的文档 ocrmypdf scan.jpg output.pdf这就是典型的扫描页。处理完之后,图片里每个字下面都垫了一层"隐形文字"。
跑完终端长这样:
每一步都有进度条,然后是图像优化比例,最后验证输出是合法的 PDF/A。原图没动,只是多了文本层。出结果后你用平时的阅读器打开就行,页面和原来长得一样,但现在能选中、能复制、能搜索了。
真正好用的几个点
下面是我使用频率最高的三个参数,加一个习惯用法。
中文文档:加个语言参数就行
场景:最常见的就是中英混排的合同、论文,或者纯中文的古籍。
# 中文注释:同时识别简体中文和英文 ocrmypdf -l chi_sim+eng input.pdf output.pdf混排文字一次识别完,中英文不打架,复制出来不乱码。注意系统里要先有对应语言包,sudo apt install tesseract-ocr-chi-sim,后缀换成你需要的语言。
页面歪了、图像脏:先让它修
场景:扫描件经常是斜的,图上还有噪点,直接识别准确率会掉。
# 中文注释:先把页面摆正、去噪点,再识别 ocrmypdf --deskew --clean input.pdf output.pdf跑完页面是正的,图像干净了,识别率明显高,细字体文档尤其受益。扫描特别差的件再加个--threshold 0.5做二值化,弱文本更容易认出来。
想导出文本校对:生成侧车文件
场景:识别结果要人工复核,或者你只要一份纯文本。
# 中文注释:处理同时导出一份纯文本文件 ocrmypdf --sidecar text.txt input.pdf output.pdfoutput.pdf 照常带文本层,text.txt 是纯文本。用任意编辑器打开就能直接改错字,改完再和 PDF 对照。
一整个文件夹:并行开起来
命令不用变,加个--jobs 4就行。8 核机器上实测大概是 3 倍速度。文件页数特别多时,可以配合--skip-big跳过大页。只想处理其中几页,用--pages 1-5指定。输出本来就是 PDF/A 归档格式,需要写标题作者就加--title和--author,归档时很顺手。
别踩这几个坑
⚠️ 症状:命令跑完了,输出和输入一模一样。原因:原 PDF 自带文本层,默认会跳过这些页。解法:加--redo-ocr强制重新识别。
❌ 症状:报 "Language not installed" 或找不到语言。原因:语言包没装。解法:先sudo apt install tesseract-ocr-chi-sim(换成对应代码)再重跑。
⚠️ 症状:macOS 上apt install提示找不到命令。原因:macOS 没有 apt。解法:改用brew install ocrmypdf tesseract。
它适合谁
扫描件文字清晰、以印刷体为主的文档它最拿手:合同、论文、古籍、说明书,批量加脚本场景特别稳。手写体、严重模糊、褪色的页面它干不动,那种得看专门的手写识别模型,或者先把图扫清晰一点再跑。商业云 OCR 服务在超低质量手写上有优势,但文件要上云,按你的场景取舍。
继续深入
- 安装说明,覆盖 macOS、Windows、FreeBSD 等平台
- 高级参数说明,优化、元数据和校验的细节
【免费下载链接】OCRmyPDFOCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched项目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDF
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考