news 2026/8/31 9:22:49

500页扫描PDF一夜跑完:Umi-OCR离线OCR跑完实录

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
500页扫描PDF一夜跑完:Umi-OCR离线OCR跑完实录

500页扫描PDF一夜跑完:Umi-OCR离线OCR跑完实录

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

先说结论:如果你要处理的是电脑里的截图、成堆的照片和扫描版PDF,又不想把文件发到任何服务器上,Umi-OCR值得花十分钟试一次。它是一款开源、免费、完全离线的OCR软件,识别引擎和多种语言模型库都内置在发布包里,拔网线照样识别。

免费OCR真能完全离线吗?三条可自证的理由

用免费工具做文字识别,最怕两件事:偷偷上传数据、后期收钱。我用了两周,靠三点给自己交了底。

第一,代码全部开源,不放心可以直接拉下来翻:git clone https://gitcode.com/GitHub_Trending/um/Umi-OCR。第二,我专门断过一次网:关闭网卡后截图识别、批量任务全部正常跑完,识别结果和联网时没有任何差别。第三,中文、英文、日文、繁体的识别库都随包内置,切换语言不需要联网下模型。

缺点当然也有。离线引擎对手写体和低清老照片的识别率,确实比不了云端服务。但对我这种"资料见不得光"的用户来说,离线是刚需,牺牲一点极限准确率完全可以接受。

既然离线立住了,那它怎么装起来、第一下截图识别要几秒?

从解压到第一次截图识别文字,实测要多久

发布包提供.7z压缩包和.7z.exe自解压包两种,后者没装压缩软件也能直接双击。解压完进入文件夹,双击Umi-OCR.exe即启动,没有安装向导。首次打开界面会跟随系统语言自动显示。

截图OCR的完整流程,我按这个顺序走:

  1. 点开"截图OCR"标签页,按默认快捷键在屏幕上拉出取景框(快捷键可在设置里改);
  2. 框住目标文字松手,约1秒后右侧记录栏出结果,单页300字左右的教程页,每段置信度基本在0.90以上;
  3. 在"OCR文本后处理"里把"排版解析方案"改成单栏-保留缩进——识别代码截图时首行缩进和行内空格原样保留,粘进编辑器不用重排;读多栏论文则换多栏-按自然段换行,左右栏不会交叉错乱;
  4. 识别结果不满意不用重截,左侧预览栏可以鼠标划选某块文字直接复制,右侧记录栏还支持划选多条记录一次性复制。

我的习惯是先把右上角的锁点上,锁定标签页,日常操作就不会手滑关掉工作页。截图这条路跑通了,可文件夹里几百张照片一张张截不现实。

批量图片文字识别怎么一次跑完?

场景很典型:相册里300多张书页照片,要变成可检索的文字。批量OCR页的操作链路是:

  1. 点开"批量OCR"标签页,把文件夹里的图片全选拖进任务列表,jpg、png、webp、bmp、tif都认,数量没有上限;
  2. 在右栏设置里进"忽略区域"编辑器,按住右键把水印可能出现的位置框起来——我的照片右上角总有拍摄时间水印,不画框的话结果里会混进一堆"2024-05-12";
  3. 点"开始任务",进度条走完;
  4. 选择导出格式,txt、jsonl、md、csv(Excel)四种,我给同事整理资料时导过一次Excel,省掉一步人工录入。

实测一次13张测试图的任务,进度条1.4秒跑到3/13,按这个速度300多张照片就是几分钟的量,比我预想的快。

图片批量搞定了,最硬的还是那种没有文字层的扫描版PDF。

扫描版PDF文字提取:双层PDF怎么输出

我手上有一本500多页的扫描书,翻页等于看照片。做法不复杂:

  1. 点开"文档识别"标签页,选择文件——支持pdf、xps、epub、mobi、fb2、cbz;
  2. 同样先在忽略区域里把每页的页眉页脚框掉,不然正文会被书名和页码大量污染;
  3. 输出方式选"双层可搜索PDF",原图在底、透明文字浮在上面,点开始;
  4. 几个大文件可以排队处理,配合"任务完成后自动关机",睡前挂上,早上起来就完事了。

成品比原书强在两点:像原书一样翻页看,又能全文搜索。我把一个生僻术语丢进搜索框,几秒内相关段落全部跳出来,划词也能直接复制,比一页页翻省太多。

踩坑与限制:三个常见问题和对应设置

两周里反复遇到的坑,集中放这里,都是"现象→原因→改哪里"的结构。

**坑一:超长截图或大图的后半段文字丢失。**原因是识别前图片会按"限制图像边长"缩放。解决办法:页面设置→文字识别→限制图像边长→调高数值,再重新识别。

**坑二:忽略区域画了框却没生效。**这个功能只忽略"整个落在框内的文本块",不是按单个字符忽略,框太小时水印旁边的正文会被一并留下来。把矩形画大一些,完全包裹水印可能出现的位置即可。

**坑三:命令行/HTTP接口不响应。**Umi-OCR依赖本地HTTP服务跨进程通信,需要在全局设置里确认HTTP服务已允许(默认开启),主机选"仅本地"就行——通信只走本机环回,不经过物理网卡。

另外,个别机器截图时出现闪烁、界面错位,去全局设置→界面和外观→渲染器,换一个渲染方案或关闭硬件加速就好了。

彩蛋:命令行接口和多语言界面🎁

想把它嵌进自己的自动化流程,主程序本身就是CLI入口,三条最小命令直接复制:

umi-ocr --screenshot umi-ocr --path "D:/你的文件夹" umi-ocr --qrcode_create "文本内容" "D:/输出.png"

第一行截屏识别,第二行把整个文件夹里的图片批量跑完,第三行生成二维码。更细的参数和HTTP接口用法,命令行手册与HTTP接口手册里都有。

界面本地化也挺省心:简体中文、繁体中文、英文、日文随系统自动切换,不顺手就在全局设置→语言里手动改,常看英文资料的人一键切过去。

写在最后:适合谁,十分钟怎么上手✍️

三句总结:

  • 完全离线,资料不出本机
  • 解压即用,无安装步骤
  • 图片、PDF批量都扎实

适合谁:有隐私顾虑、需要断网环境干活、手头压着批量截图/照片/扫描件PDF的人。不适合谁:追求手写体、低清老照片极限识别率的——那种场景还是云端的天花板更高,Umi-OCR的离线引擎换准确率保离线。

上手路径,10分钟内:下载发布包→双击自解压→运行Umi-OCR.exe→打开截图OCR标签页按快捷键框一块屏幕。当右侧面板跳出第一段文字时,你就已经跑通了。

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/31 9:22:28

重力星球GSK1PRO赛博暗影款评测:75配列三模Gasket热插拔机械键盘

先给结论:如果你想要一把 75 配列、三模连接、热插拔轴体、带 Gasket 结构并且颜值在线的量产机械键盘,重力星球 GSK1PRO 赛博暗影款是可以直接放进考虑清单的选项。它的重点不是堆料堆得夸张,而是把客制化键盘里最常用的几个玩法——换轴、换…

作者头像 李华
网站建设 2026/8/31 9:22:17

2026年8GB内存笔记本够用吗?选购建议与升级成本分析

当你准备在2026年入手一台笔记本,打开电商页面或在实体店挑选样机时,大概率会看到一批搭载8GB内存的“低价位”型号。它们的价格确实诱人,尤其配合“办公本”“学习本”的定位,线下导购还会强调“日常够用”。但作为经常要跑代码、…

作者头像 李华
网站建设 2026/8/31 9:21:27

上手Bruno API测试:搜索中文关键词与用Git管理集合

上手Bruno API测试:搜索中文关键词与用Git管理集合 【免费下载链接】bruno Opensource IDE For Exploring and Testing APIs (lightweight alternative to Postman/Insomnia) 项目地址: https://gitcode.com/GitHub_Trending/br/bruno 团队的API集合涨到几百…

作者头像 李华
网站建设 2026/8/31 9:21:14

HyperMesh 前处理建模实战:从几何清理到网格质量与单位设置

这次我们来看一个经常出现在结构仿真工作流里、但很容易被新手误解的建模工具:Altair HyperMesh。它不是 AI 工具,也不是开源项目,而是老牌商业 CAE 前处理软件,属于 Altair HyperWorks 套件的一部分。简单来说,HyperM…

作者头像 李华
网站建设 2026/8/31 9:18:23

2 位量化也能可靠推理吗?DwarfStar 如何保证 IQ2_XXS 模型的质量

2 位量化也能可靠推理吗?DwarfStar 如何保证 IQ2_XXS 模型的质量 【免费下载链接】ds4 DeepSeek 4 Flash and PRO local inference engine for Metal, CUDA and ROCm 项目地址: https://gitcode.com/GitHub_Trending/ds4/ds4 DwarfStar 是一个面向 DeepSeek …

作者头像 李华
网站建设 2026/8/31 9:18:17

DBeaver 数据比较结果太杂?3 步结果过滤,只看你关心的差异

DBeaver 数据比较结果太杂?3 步结果过滤,只看你关心的差异 【免费下载链接】dbeaver Free universal database tool and SQL client 项目地址: https://gitcode.com/GitHub_Trending/db/dbeaver 一次 DBeaver 数据比较跑出来几千行差异&#xff0…

作者头像 李华