Umi-OCR 离线OCR实操指南:5个技巧搞定扫描件
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
扫描版合同的图片、身份证照片、还没公开的论文初稿,这些你不敢传到在线识别网站的"图里有字的文件",偏偏在屏幕上选不中、复制不了。Umi-OCR 就是为这类场景准备的离线 OCR 软件:识别全程在电脑本地完成,图片不离开你的硬盘。一句话定位:Umi-OCR 像一个住进你电脑的"速记员"——屏幕上的、图片里的、扫描件上的字,它离线转写,材料不出你的桌子。
形态上它是绿色桌面程序,解压即用、无需安装,功能分组成可切换的标签页;上手门槛很低,从下载到第一次识别成功只要三分钟。
三分钟离线安装:下载、解压、双击启动
- 下载:从项目发布页取
.7z压缩包;电脑没装压缩软件就选.7z.exe自解压包。 - 解压:解压到纯英文路径,例如
D:/Tools/Umi-OCR,路径里不要带中文和空格,能省掉一堆莫名其妙的兼容问题。 - 启动:Windows 双击
Umi-OCR.exe,Linux 运行umi-ocr.sh。
⚠️ 注意:首次启动前,把软件目录加入杀毒白名单——包里自带本地 OCR 引擎和运行库,容易被部分杀软误报,这是"启动即闪退"的头号原因。
首次启动时界面会跟随系统语言自动切换,想改随时去全局设置 → 语言,简体中文、繁体中文、英文、日文、俄文等界面语言都内置,社区译者还在持续添加。
划重点:界面语言只是"壳",引擎认什么字是识别语言库,两样分开选——界面用中文、识别日文图书,完全没问题。
能力分三档:从一张截图到整本PDF
别看功能多,按任务轻重分三档就好:
| 档位 | 适合场景 | 一句话操作 |
|---|---|---|
| 第一档:截图OCR | 一张图,想随手取字 | 快捷键截屏,或粘贴别处复制的图 |
| 第二档:批量OCR | 一文件夹的图片 | 拖图进窗口,点开始任务 |
| 第三档:文档识别 | 一整本扫描版PDF/电子书 | 选中文档,输出双层可搜索PDF |
第一档:截图OCR,日常最高频。打开该标签页,用快捷键唤起截图框划出区域,结果立刻出现在右侧记录栏。三个省事的细节:别处复制的图(比如聊天窗口里的)可直接粘贴进来识别;记录栏文字可直接改错,还能划选多条记录一次复制;横排、竖排文字由排版解析自动处理。顺带一提,二维码、条形码的扫码和生成也内置在这类轻任务里。
第二档:批量OCR。几十上百张图片一张张截太亏,整文件夹拖进来就行,jpg、png、webp、bmp、tif等格式都认,数量没有上限。任务跑完可按需导出txt、jsonl、md、csv(Excel 直接打开);还能设置任务完成后自动关机或待机,睡前丢进去、醒来收结果;v2.1.2 起支持中途暂停任务,软件不退出,唤醒后接着跑。
这一档有个内置的"降噪器":忽略区域。图片角落的水印、LOGO、页眉页脚总会混进识别结果——在右栏设置里进入忽略区域编辑器,按住右键画出多个矩形框,识别时框内文字自动排除。💡 记住一个机制:只有整个文本块完整落在框内才会被忽略,而不是单个字符;画框宁大勿小,把水印可能出现的位置全包进去。
第三档:文档识别,最重的一档:整本扫描版 PDF。支持pdf、xps、epub、mobi、fb2、cbz六种格式。内部先把文档拆成"已有文本层"和"扫描图片层":文本层直接提取,快且零误差;扫描页才交给本地 OCR 逐页处理。最终输出的双层可搜索 PDF是"底层原图、上层透明文字"——外观和扫描件一样,但文字能搜索、复制、划线,历史合同归档、论文数字化直接顶得上。也可以整页强制 OCR,或输出单层纯文本 PDF(体积小、好编辑);页眉页脚用忽略区域排除(可按页码范围),任务结束可设自动关机。
识别之后文字怎么"排座位",由排版解析方案决定:"多栏-按自然段换行"覆盖大多数两栏三栏的论文书籍;识别代码截图切到"单栏-保留缩进",缩进和行中空格基本保住;要引擎原始输出就选"不做处理"。
划重点:拿不准就先用"多栏-按自然段换行",遇到特殊排版再逐个对比切换。
五个常见症状,识别翻车先对号入座
- 长图、大图识别缺胳膊少腿→ 默认的限制图像边长限了像素来平衡速度和内存;去该标签页的文字识别设置把数值调高。别手动放大原图——放大只会加噪声、降准确率。
- 忽略区域画了没效果→ 框不够大,只有整块文本完全在框内才会被忽略;把框画大包住水印所有可能位置,并确认配置已保存。
- 截图时界面闪烁、错位→ 显卡渲染兼容问题;去全局设置 → 界面和外观 →渲染器,换一种渲染方案或关闭硬件加速。
- 命令行指令没反应→ 命令行依赖本地 HTTP 服务(默认开启,只监听本地环回,不经过物理网卡,数据不外泄);先确认它开着,并确认调用的是主程序
Umi-OCR.exe,备用启动器可能不支持指令。 - 识别不准或报错→ 先换引擎:内置Rapid-OCR(兼容性好)与PaddleOCR(速度稍快),全局设置里随时切换;PaddleOCR 自 v2.1.4 起默认内存占用不超过系统内存的一半。
划重点:出问题时按"引擎 → 参数 → 渲染器"的顺序查,八成用不着等新版本。
超出图形界面:用脚本调用 Umi-OCR
日常用界面足够,想嵌进自动化流程时,有两条程序化通道:
- 命令行:入口就是主程序本身,指令支持简写(
--screenshot可写成--sc)。比如截屏后把结果直接进剪贴板,或识别整个文件夹、结果追加进文件:
umi-ocr --screenshot --clip umi-ocr --path "D:/scans" --output result.txt再配合快捷键工具,能实现"按一个键自动截取屏幕固定区域并识别"。细节见命令行手册:docs/README_CLI.md。
- HTTP 接口:软件启动后本地服务提供 OCR、文档识别、二维码三组接口,传图片、回 JSON,几十行代码就能封装成局域网小工具。接口文档见:docs/http/api_doc.md。
项目还维护着独立插件库,可以接入更多 OCR 引擎。各版本演进——v2.1.0 加入文档识别、v2.1.2 支持任务暂停、v2.1.3 登陆 Linux 并支持 Docker、v2.1.5 修复 PDF 页面旋转导致的文本错位——见更新日志:CHANGE_LOG.md。
划重点:手上有旋转过方向的扫描件,先升到最新版再识别。
三句话记住,日常够用
- Umi-OCR 免费、开源、完全离线,解压即用;
- 三档能力由轻到重:一张截图、一堆图片、整本PDF,覆盖绝大多数日常场景;
- 识别结果不理想时,查排版方案、查忽略区域、查渲染器。
下次再收到扫描版合同的图片,你不用再对着屏幕逐字敲,也不用把它传到某个云端网站——解压、双击,速记员已经开工,材料始终没出你的桌子。
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考