Umi-OCR完整攻略:免费离线识别,截图、批量图片与扫描PDF一站搞定
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
同事甩过来一份扫描版PDF合同,说"帮我看看第三页那条款"。你全选、复制,屏幕却只回你一句"无法从此PDF复制文字"。转头想找在线识别网站,要么文件超了大小限制、要么免费额度早被用完,更要命的是——这份合同得先传到别人的服务器上。这种"看得到却摸不到"的憋屈,正是今天的主角存在的理由。
Umi-OCR是一款免费、开源、完全离线的OCR软件,它把文字识别引擎整个塞进你的电脑里,解压即用、不用联网,截图识别、批量图片识别、PDF扫描件识别三大场景一把抓,你的图片和文档全程不离开本机硬盘。这篇文章就按真实的使用旅程,从"跑起来"讲到"玩得转",让你读完就能上手。
第一章 解压即用:三分钟把离线OCR请进门
先说清楚一个概念:为什么能"离线"?因为Umi-OCR把识别引擎直接打包进了软件本体,图像解析、文字提取全部在你的电脑上本地完成,不需要把图片发到任何服务器。这对处理合同、病历、证件这类敏感材料的人来说,几乎是刚需。
上手过程简单到不像话,三步:
- 从项目发布页下载
.7z压缩包,或者.7z.exe自解压包(电脑没装压缩软件就选它)。 - 解压到任意目录,比如
D:/Tools/Umi-OCR。路径里尽量避免中文和空格,能少碰很多莫名其妙的兼容问题。 - 双击
Umi-OCR.exe(Linux 下运行umi-ocr.sh)启动。
软件本体由多个标签页组成——截图OCR、批量OCR、文档识别、二维码、全局设置——像浏览器的标签栏一样,想用哪个点哪个,还能锁定常用标签防止误关。第一次启动会自动跟随系统语言,想手动改,随时去全局设置里换。
一个小提醒:如果电脑装了杀毒软件,建议先把软件目录加进白名单。因为它内置了本地OCR引擎和运行库,部分杀软会误报,提前加白能省掉后续很多"为什么闪退"的烦恼。
第二章 截图OCR:屏幕上的字,随抓随用
日常最高频的场景,就是看到一段文字想立刻复制。打开"截图OCR"标签页,按下快捷键唤起截图框,划出目标区域,识别结果马上出现在右侧记录栏里。
几个实测好用的小习惯:
- 不需要截图也能识别:在聊天窗口里复制一张图片,回到Umi-OCR直接粘贴,它照认不误。
- 结果可以二次编辑:右侧记录栏里的文字能直接改错、划选多条一起复制,识别完顺手就能整理成你要的格式。
- 竖排文字自动处理:排版解析会自动识别横排和从右到左的竖排文本(前提是OCR引擎本身支持竖排)。
排版方案:给识别结果"排好队"再输出
OCR引擎吐出来的文字往往是"散装"的,谁先谁后、怎么换行,全靠排版解析来安排。在设置里可以切换多种预设方案,我帮你划一下重点:
| 方案 | 适用场景 |
|---|---|
| 多栏-按自然段换行 | 两栏/三栏的论文、书籍,自动按段落断行,大多数场景选它就对 |
| 多栏-总是换行 | 每句独立成行,方便后续按行处理 |
| 多栏-无换行 | 强制整段合并成一行 |
| 单栏-保留缩进 | 代码截图专用,保留行首缩进和行中空格 |
| 不做处理 | OCR引擎的原始输出 |
其中"单栏-保留缩进"值得单独表扬:把代码截图扔进去,缩进结构基本能保住,配合截图OCR简直是程序员的日常福利。下面的预览对比图就来自项目文档,左侧是原截图,右侧是排版解析后的文本,用来校对代码非常直观。
截图识别是开胃菜,真正体现效率的在后面。
第三章 批量图片OCR:几百张图一夜跑完,水印自动隐身
遇到几十上百张截图、扫描件、相册照片,一张张截屏识别就太亏了。切到"批量OCR"标签页,把图片拖进窗口,支持jpg、png、webp、bmp、tif、tiff等常见格式,一次拖几百张也没有数量上限。
点下"开始任务",右侧会逐张显示文件耗时、置信度和识别结果。任务跑完,可以按需导出成txt、jsonl、md、csv四种格式,其中csv可以直接用Excel打开。它还支持任务完成后自动关机或待机——睡前扔进去几百张图,醒来直接拿结果。
忽略区域:让水印、页眉页脚自动"隐身"
批量识别有个高频痛点:图片角落的水印、LOGO、页眉页脚,每次都会混进识别结果里,得人工手动删。Umi-OCR的忽略区域功能就是为这个设计的。
在批量识别页的右侧设置里进入忽略区域编辑器,按住右键在图片上绘制矩形框,把水印可能出现的位置全部框住,识别时这些区域内的文字就会被自动排除。做学术论文批量转换时,把统一的页眉页脚一次框掉,输出会干净很多。
这里有个必须记住的机制:只有完全处于矩形框内部的整个文本块才会被忽略,而不是单个字符。所以画框时宁可大一点,把水印所有可能出现的位置都包住,否则漏框一次,结果里就混进一行杂音。
如果你的图片特别长、特别大,识别结果缺行漏字,可以去"文字识别"设置里调高限制图像边长。别盲目放大原图——过度放大会增加噪声,反而降低准确率。
第四章 文档识别:扫描版PDF从此"可搜索"
如果说前面是热身,文档识别就是压轴。它支持pdf、xps、epub、mobi、fb2、cbz六种格式,其中PDF扫描件是最典型的应用场景。
底层逻辑可以概括成三步:解析 → 识别 → 重组。PDF先被拆开,区分出"本来就有的文本层"和"需要OCR的扫描图片层";扫描图片交给本地OCR引擎逐页识别;最后按阅读顺序重新拼装,输出成你指定的格式。有两个亮点值得展开:
- 双层可搜索PDF:对扫描版PDF做OCR后,输出"底层是原图、上层是透明文字"的双层PDF。外观和原扫描件一模一样,但里面的文字可以搜索、复制、划线。给公司做合同归档、给学校做论文数字化,这个功能都能直接顶上去。
- 灵活的提取模式:Umi-OCR会优先提取PDF自带的文本层(速度快、零误差),只有遇到纯扫描页才自动切到OCR。你也可以主动选择整页强制OCR,或反过来只提取原文本。v2.1.2起还支持输出单层纯文本PDF,想要体积小、好编辑的文件就选它。
文档识别同样支持忽略区域,还能按页码范围设置,用来排除扫描件的页眉页脚;也支持任务完成后的自动关机。如果你手头有一堆扫描版书要转成可搜索存档,这个标签页能帮你省下大量人工。顺带一提,如果你见过PDF页面旋转后文本错位的bug,请务必用v2.1.5以上版本,这个问题已修复。
微调两个旋钮,再开一条进阶通道
界面语言和识别语言库,是两回事
Umi-OCR的界面支持中文、繁体中文、英文、日文、俄语、葡萄牙语等多种语言,由社区译者协作维护。
但要注意:界面语言管按钮菜单长什么样,识别语言库管OCR引擎认哪种文字。识别语言可以在各标签页的"文字识别"设置里单独选择或下载。比如你的界面用中文、日常却识别日文书籍,二者完全可以搭配使用,互不干扰。
截屏闪烁、界面错位?换渲染器
如果截图时界面闪烁或者错位,多半是显卡渲染兼容问题。去全局设置 → 界面和外观 → 渲染器,切换不同渲染方案,或者直接关闭硬件加速,通常就能解决。
进阶通道:命令行与HTTP接口
对普通用户来说,图形界面已经够用;但想把它嵌进自己的工作流,Umi-OCR还提供两条"程序化通道"。命令行入口就是主程序本身:
# 截屏识别,结果直接进剪贴板 umi-ocr --screenshot --clip # 识别指定图片,结果输出到文件 umi-ocr --path "D:/扫描件.png" --output result.txt # 识别整个文件夹(含子目录) umi-ocr --path "D:/scans" "-->" all_result.txt # 生成二维码 umi-ocr --qrcode_create "你好,Umi-OCR" "D:/qrcode.png" 256指令的具体参数和简写规则见 docs/README_CLI.md 命令行手册。软件启动后还会在本地开启HTTP服务,提供OCR、文档识别、二维码等接口,开发者可以用几十行代码封装成自动化流程,实现"上传图片 → 返回JSON识别结果",接口文档在 docs/http/README.md。程序默认内置Rapid-OCR(兼容性好)和PaddleOCR(速度稍快)两套引擎,随时可以切换。
结尾:现在就差你动手了
把整篇压缩成三句话:Umi-OCR是一款免费、开源、离线运行的OCR工具,装好就能用;截图、批量、文档识别覆盖了从日常摘抄到批量归档的绝大多数场景;遇到问题别慌,忽略区域、排版方案、渲染器这几个旋钮能解决大部分麻烦。
下一步建议很简单:下载最新版,先打开"截图OCR"试一次快捷键截图——感受一下"屏幕上的字随抓随用"是什么体验。然后再把一份扫描版PDF丢进"文档识别"生成双层PDF,你大概率会回来把这篇文章转发给同样被PDF折磨的同事。项目的历史版本演进都记录在CHANGE_LOG.md里,想了解每个版本改了什么、适合谁,翻它准没错。
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考