news 2026/9/1 8:33:41

扫描PDF添加OCR文字层:OCRmyPDF 新手功能指南

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
扫描PDF添加OCR文字层:OCRmyPDF 新手功能指南

扫描PDF添加OCR文字层:OCRmyPDF 新手功能指南

【免费下载链接】OCRmyPDFOCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched项目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDF

扫描版PDF里搜不到那个词,是不是很烦?OCRmyPDF 是一个 PDF OCR 命令行工具,它给扫描的PDF添加文字层,让文字变得可搜索。装好之后,一条命令就能拿到可检索的文档。

它解决什么、适合谁

很多老档案、合同和论文只以扫描件的形式存在,看上去是文字,其实是图像。Ctrl+F 一无所获,复制粘贴也行不通。OCRmyPDF 先把页面渲染成图像,交给 Tesseract 识别,再把文字层贴回原始PDF,版式保持不变。扫描图像原样保留,文字可以选中、复制。混合了图像和电子文字的文件,已有文字会自动跳过,只识别图像部分。

它适合给老档案做数字化的人,也适合归档发票合同、让扫描论文可引用的人。

能力说明边界/注意
添加OCR文字层文字可搜索、可复制不识别手写体
智能跳过页面已有文字页不重复处理需要重做时加--force-ocr
图像预处理清理、纠偏后再识别外观可能略有变化

五分钟上手

安装很轻,一条包解决:

操作系统命令备注
Ubuntu/Debiansudo apt install ocrmypdf官方仓库
macOSbrew install ocrmypdfHomebrew
Windowspip install ocrmypdf需另装 Tesseract

最小命令就一行,输入是扫描件,输出是带文字层的新PDF:

ocrmypdf 输入.pdf 输出.pdf

中文文档加一个语言参数即可:

ocrmypdf -l chi_sim 中文.pdf 可搜索.pdf

进阶玩法(按需选学)

--deskew

ocrmypdf --deskew 输入.pdf 输出.pdf

扫描页歪斜、文字行倾斜时用它,先纠偏再识别,准确率更稳。

-j 4

ocrmypdf -j 4 大文档.pdf 输出.pdf

页数多的大文档用它,多页并行处理,速度明显更快。

--sidecar

ocrmypdf --sidecar 结果.txt 输入.pdf 输出.pdf

除了PDF还想导出识别出的纯文本时用它,方便做索引或后续加工。

一个真实场景走一遍

输入:一份老式打字机排版的菜谱扫描件,整页都是图像,一个字都搜不到。文档是荷兰语,顺带纠偏。

ocrmypdf -l nld --deskew 老菜谱.pdf 可搜索菜谱.pdf

结果:输出的扫描图像和原件看起来一样,但文字可以选中、复制了。搜索一个食材,能直接跳到对应页面。输出默认是存档级的 PDF/A 格式,适合长期保存。

换成你的文档,只需改这两处:输入文件名和语言代码。

避坑与自查

  • 错字多 → 先加--clean清理图像,或换更高 DPI 重扫
  • 处理慢 → 加-j 4开启并行
  • 阅读器提示 PDF/A 格式告警 → 加--output-type pdf换成普通PDF

OCRmyPDF 是一个给扫描PDF添加文字层的免费开源工具,适合长期、批量地做档案数字化。先拿一份小文档试跑一遍,跑通了,再处理你那批老档案。

小提示:新手第一件事,是用--pages 1只处理第一页,确认识别质量再处理整个文件。

【免费下载链接】OCRmyPDFOCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched项目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDF

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/1 8:33:11

Krea 3与Krea Agents:从AI生成器到自动化创作工作台

Krea 是一个以实时生成和视觉增强见长的 AI 创作平台,早期被很多设计师拿来画概念图、做视觉探索,后来逐步加入风格训练、品牌素材生成和视频相关能力。这次 Krea 3 与 Krea Agents 两个更新同时出现,最值得关注的不是某个新滤镜或模型打榜&a…

作者头像 李华
网站建设 2026/9/1 8:32:02

腾讯音乐数据分析岗笔试全解析:题型拆解与实战答题思路

2023年腾讯音乐春招数据分析岗第一批笔试,说实话,这场笔试过去这么久了,但直到现在还有不少学弟学妹问我里面的门道。网上关于这场笔试的讨论也不少,但大多只是零散地回忆几道题,很少有完整把题型、考点、答题思路串起…

作者头像 李华
网站建设 2026/9/1 8:31:32

9月1日John Ternus接任苹果CEO,面临AI挑战、人才流失等多重压力!

9月1日,John Ternus正式接任苹果CEO,成为第三位执掌苹果的人。他面临带领苹果在AI时代确立优势的核心挑战,上任就迎来关键考验。AI落后:紧迫危机待解苹果在生成式AI领域布局滞后,首版软件表现不佳,重大收购…

作者头像 李华
网站建设 2026/9/1 8:31:19

从CR400BF-A到G1802:解码高铁摄影背后的信息记录术

一列 CR400BF-A-5058 担当的 G1802 次列车减速滑入常州北站 2 站台时,站台上的拍摄者需要在十几秒内完成对焦、构图、连拍和车辆确认。这张照片的价值不在于“拍到一列高铁”,而在于拍摄者是否清楚自己拍的是哪一列、什么车型、为什么在这个时间出现在这…

作者头像 李华
网站建设 2026/9/1 8:31:05

宋锦‑辽金‑两宋缂丝逆向工程解析—— 重纬织锦与通经断纬织造的工程约束、分工体系与礼制消费范式

摘要 宋锦与缂丝是宋辽金时期两种技术路径完全分野的顶级丝织体系:宋锦属于多梭通梭重纬提花织造,适合规模化产出高档面料;缂丝为通经断纬分区挖织,偏向单件艺术品生产。本文沿用四维闭环祛魅体系,以出土实物、织物显…

作者头像 李华
网站建设 2026/9/1 8:29:17

开题季别让AI瞎编文献,我实测两年的论文工具选型心得

又到开题季,后台被问最多的一句话是:“到底用哪个AI写论文最靠谱?” 先泼盆冷水:我同门去年用某顶流大模型直接生成开题报告,12篇参考文献导师随手一查——7篇压根搜不到,剩下5篇里3篇作者年份对不上&#…

作者头像 李华