Umi-OCR离线OCR五分鐘上手:截图、批量、二维码的免费文字提取
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
Umi-OCR 是一款免费、开源的离线 OCR 工具:完全本地运行,数据不上传,免安装绿色便携,覆盖截图提取文字、批量 OCR 处理、二维码识别与生成三类核心任务。本文带你 5 分钟跑通从上手到自动化。
先看懂这个免费OCR工具能干什么
一句话定位:开源、免费、完全离线。识别全部跑在你自己的 CPU 上,文件不出本机——对涉密文档、内部资料来说,OCR 隐私安全是它的底线。
| 你要做的事 | 它的做法 |
|---|---|
| 截图提取文字 | Ctrl+Shift+A 框选屏幕区域,几秒出结果,右键即可复制 |
| 批量 OCR 处理 | 拖入图片文件夹或 PDF,一次性产出 TXT / JSONL / CSV |
| 二维码 | 识别图片中的二维码,也能把文本生成二维码图片 |
| 排版解析 | 多栏按自然段换行、单栏保留缩进、多栏总是换行三套方案可选 |
对应的典型用途:学术文献整理时,把两栏排版的 PDF 重组成通顺段落;企业档案数字化时,把扫描纸质件批量转成可检索文本;开发者则常用单栏保留缩进方案,把截图里的代码片段原样搬进编辑器。
免安装启动 Umi-OCR 📦
获取有两条路:下载预编译压缩包解压,或直接从仓库克隆:
git clone https://gitcode.com/GitHub_Trending/um/Umi-OCR解压后直接运行Umi-OCR.exe,没有安装程序,整个目录可以塞进 U 盘带走。主界面就三个区域:
- 截图OCR:最常用,随时抓屏上的任何内容
- 批量OCR:处理成批的文件
- 全局设置:语言、主题、识别参数都在这里
多语言界面不用操心:首次启动按系统语言自动切换;想要别的语言,到全局设置页的"界面和外观"里手动改,保存即生效。
完成第一次识别:切到"截图OCR"页签,按默认快捷键Ctrl+Shift+A框选屏幕区域,两三秒后文字出现在右侧记录区。选中文字右键可复制(Ctrl+C),也可以配置成识别完直接进剪贴板。
截图OCR的三套排版方案怎么选
识别出的是一行行文字碎片,Umi-OCR 需要把它们重组可读。排版方案决定输出形态:
- 多栏-按自然段换行:默认方案,论文、报告这类两栏排版用它,栏间断行会被合并成完整段落
- 单栏-保留缩进:为代码和表格数据准备,保留缩进与空格,贴进编辑器就能用
- 多栏-总是换行:一行一断,适合报纸杂志这类复杂版面
拿不准就先默认方案,提取代码前记得切到单栏保留缩进。
批量识别扫描件的正确姿势 ⚡
批量 OCR 页签负责重活,流程不复杂:
- 点"选择图片",拖入图片文件夹或勾选多个文件
- 在设置区选输出格式与保存位置
- 点"开始任务",列表里能看到每张的耗时和置信度
- 完成后在右侧记录区直接查看结果
常见图片格式之外还支持 PDF 文档,多文件并行识别,输出可选 TXT、JSONL、CSV 等格式。
三条来自实战的建议:
- 分批处理:几百个文件时拆成每批一百左右,内存平稳,中断了也好续
- 忽略区域:页眉、页脚、水印用这个功能框掉,精度立刻上来
- 线程与引擎:线程数别超过 CPU 物理核心数;默认引擎应付日常足够,追求高精度再换更重的引擎试比
进阶:命令行、HTTP API 与扩展 🔌
界面用腻之后,自动化有两条现成的路:
- 命令行:主程序本身就是 CLI 入口。批量识别整个文件夹(含子文件夹)并写入文件:
umi-ocr --path "D:/scans" --output "result.txt"完整参数、截图指令、二维码指令都在 命令行手册 里。
- HTTP API:全局设置页勾选"允许HTTP服务"(默认开启)后,本机其他程序可以把图片转成 Base64,走 RESTful 接口请求识别,PDF、二维码各有独立接口,细节见 HTTP接口手册。
扩展机制也留了口:基于页面模板系统,熟练用户可以添加自定义功能标签页;识别参数都存在UmiOCR-data/.settings配置文件里,手改后用--reload指令即可热加载,不用重启。
三类常见问题怎么排查 🔧
- 启动闪退:先补装 VC++ 运行库;解压路径避开中文和特殊字符;再不行看
UmiOCR-data/logs/下的日志找具体原因 - 识别不准:源图尽量清晰(扫描件 300dpi 以上),语言库选对,用忽略区域框掉水印页眉;仍不理想就换引擎对比一遍
- 速度偏慢:线程数对齐核心数、大文件集拆批、清掉抢资源的后台程序;另外后端并发能力有限,API 调用别同时打多个请求
延伸阅读
需要深入时按图索骥:项目说明看 README,功能变动看 更新日志,命令行与 HTTP 两份手册在上一节已给出入口。
读完不必急着全试一遍,先拿一段代码截图走一遍"框选—识别—复制",后面的批量、自动化都是这个动作的放大版。
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考