news 2026/8/24 4:34:51

3 条命令让扫描 PDF 可检索|OCRmyPDF 做 OCR PDF 转换

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
3 条命令让扫描 PDF 可检索|OCRmyPDF 做 OCR PDF 转换

3 条命令让扫描 PDF 可检索|OCRmyPDF 做 OCR PDF 转换

【免费下载链接】OCRmyPDFOCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched项目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDF

扫描出来的 PDF 文字是图片,怎么选都复制不出来。OCRmyPDF 帮你把可检索文本层垫到图片下面,是一款免费的 OCR PDF 转换命令行工具,识别文字和原图精确对齐。

它凭什么比隔壁强

不少 OCR 产品要开 GUI、拖文件、等进度。这个是纯命令行,装好之后一条命令就能跑,可以直接塞进脚本或者计划任务里。它离线运行,文件不出你的机器。Tesseract 引擎内置,装好语言包就能识别中文、日文等上百种语言,不用单独调包。输出默认是 PDF/A,长期归档格式,归档场景不用再转一遍。我用下来三个月,体感是:结果稳,复制粘贴对得准,省了不少校对时间。

第一次跑起来要装什么

Debian/Ubuntu 上用官方包管理器,是最短路径:

# 中文注释:主程序和OCR引擎一次装齐 sudo apt install ocrmypdf tesseract-ocr

macOS 把这一行换成brew install ocrmypdf tesseract。然后一条命令就出结果:

# 中文注释:输入扫描文件,输出可搜索版本 ocrmypdf input.pdf output.pdf

输入不一定是 PDF,JPG、PNG 也行:

# 中文注释:扫描图片直接转成带文本层的文档 ocrmypdf scan.jpg output.pdf

这就是典型的扫描页。处理完之后,图片里每个字下面都垫了一层"隐形文字"。

跑完终端长这样:

每一步都有进度条,然后是图像优化比例,最后验证输出是合法的 PDF/A。原图没动,只是多了文本层。出结果后你用平时的阅读器打开就行,页面和原来长得一样,但现在能选中、能复制、能搜索了。

真正好用的几个点

下面是我使用频率最高的三个参数,加一个习惯用法。

中文文档:加个语言参数就行

场景:最常见的就是中英混排的合同、论文,或者纯中文的古籍。

# 中文注释:同时识别简体中文和英文 ocrmypdf -l chi_sim+eng input.pdf output.pdf

混排文字一次识别完,中英文不打架,复制出来不乱码。注意系统里要先有对应语言包,sudo apt install tesseract-ocr-chi-sim,后缀换成你需要的语言。

页面歪了、图像脏:先让它修

场景:扫描件经常是斜的,图上还有噪点,直接识别准确率会掉。

# 中文注释:先把页面摆正、去噪点,再识别 ocrmypdf --deskew --clean input.pdf output.pdf

跑完页面是正的,图像干净了,识别率明显高,细字体文档尤其受益。扫描特别差的件再加个--threshold 0.5做二值化,弱文本更容易认出来。

想导出文本校对:生成侧车文件

场景:识别结果要人工复核,或者你只要一份纯文本。

# 中文注释:处理同时导出一份纯文本文件 ocrmypdf --sidecar text.txt input.pdf output.pdf

output.pdf 照常带文本层,text.txt 是纯文本。用任意编辑器打开就能直接改错字,改完再和 PDF 对照。

一整个文件夹:并行开起来

命令不用变,加个--jobs 4就行。8 核机器上实测大概是 3 倍速度。文件页数特别多时,可以配合--skip-big跳过大页。只想处理其中几页,用--pages 1-5指定。输出本来就是 PDF/A 归档格式,需要写标题作者就加--title--author,归档时很顺手。

别踩这几个坑

⚠️ 症状:命令跑完了,输出和输入一模一样。原因:原 PDF 自带文本层,默认会跳过这些页。解法:加--redo-ocr强制重新识别。

❌ 症状:报 "Language not installed" 或找不到语言。原因:语言包没装。解法:先sudo apt install tesseract-ocr-chi-sim(换成对应代码)再重跑。

⚠️ 症状:macOS 上apt install提示找不到命令。原因:macOS 没有 apt。解法:改用brew install ocrmypdf tesseract

它适合谁

扫描件文字清晰、以印刷体为主的文档它最拿手:合同、论文、古籍、说明书,批量加脚本场景特别稳。手写体、严重模糊、褪色的页面它干不动,那种得看专门的手写识别模型,或者先把图扫清晰一点再跑。商业云 OCR 服务在超低质量手写上有优势,但文件要上云,按你的场景取舍。

继续深入

  • 安装说明,覆盖 macOS、Windows、FreeBSD 等平台
  • 高级参数说明,优化、元数据和校验的细节

【免费下载链接】OCRmyPDFOCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched项目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDF

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/24 4:34:51

AI编程工具快速迭代下的开发文化:从Cursor到Bot的工程实践

如果你是一名开发者,最近可能被一个现象刷屏了:AI 编程工具正在以前所未有的速度迭代和发布新功能。昨天还在讨论某个模型的能力边界,今天它可能就推出了一个颠覆性的新特性。这种“日新月异”的背后,究竟是一种怎样的开发文化在驱…

作者头像 李华
网站建设 2026/8/24 4:33:56

LTX2.5开源视频生成模型:从零部署到ComfyUI工作流实战

这次我们来看一个近期关注度很高的开源视频生成项目——LTX2.5。这是一个基于扩散模型的AI视频生成工具,能够实现从文本或图像生成动态视频,并且支持通过“首尾帧”控制视频的起始和结束画面,为视频创作提供了更强的可控性。对于想要在本地尝…

作者头像 李华
网站建设 2026/8/24 4:33:54

ESP系列芯片开发实战:从Arduino到ESP-IDF的物联网开发指南

1. 从“乐鑫”到“万物互联”:Esp系列芯片的崛起之路如果你最近几年玩过智能家居、物联网小玩意儿,或者自己动手做过一些电子项目,那么“Esp”这个词对你来说一定不陌生。它可能出现在一块小小的蓝色开发板上,也可能藏在你家智能灯…

作者头像 李华
网站建设 2026/8/24 4:33:26

从特斯拉Optimus看人形机器人核心技术:开发者实践指南

如果你是一名开发者,最近可能被各种“AI机器人即将颠覆世界”的标题刷屏了。从工厂流水线到家庭服务,从物流搬运到精密手术,似乎每个领域都在被重新定义。但抛开这些宏大的叙事,一个更实际的问题是:这些技术突破&#…

作者头像 李华
网站建设 2026/8/24 4:32:37

非三星电脑装三星笔记:注册表伪装成 Galaxy Book 的 4 种玩法

非三星电脑装三星笔记:注册表伪装成 Galaxy Book 的 4 种玩法 【免费下载链接】galaxybook_mask Samsung Notes is now supported on any Windows device already!! This script will allow you to mimic your windows pc as a Galaxy Book laptop, this is usually…

作者头像 李华