Umi-OCR:3 分钟跑通的离线 OCR,把截图里的文字变出来
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
小林晚上赶实验报告,屏幕上的关键代码全是图片,复制不出来。用 Umi-OCR 这个离线 OCR 工具,几秒钟就能把图里的字变成可复制的文本。
三句话看懂:这套离线 OCR 工具是什么
Umi-OCR 是一款开源、免费的离线 OCR 软件,解压即用、无需联网,识别过程全部在本地电脑完成。它和在线 OCR 服务最关键的区别是:图片不上传、无需注册、不收费用。适合处理敏感资料,以及有大量截图、扫描件要转文字的用户。
| Umi-OCR | 在线 OCR 服务 | |
|---|---|---|
| 数据去向 | 只留在本地 | 上传云端 |
| 费用 | 免费(开源) | 多需注册或付费 |
| 网络要求 | 离线可用 | 必须联网 |
3 分钟跑通第一次识别
下载发行版压缩包(仓库根目录就有Umi-OCR_Rapid_v2.1.5.7z,也可去发布页拿最新版),解压后跟着做:
- 双击包里的
Umi-OCR.exe,界面语言首次启动会跟随系统自动切换 - 打开顶部的「截图OCR」标签页,默认排版方案「多栏-按自然段换行」适用大多数场景
- 按
Ctrl+Shift+A,用鼠标框选屏幕上的文字区域 - 约 2 秒后右侧「记录」栏出现识别结果,划选即可 Ctrl+C 复制
- 界面语言不合适时,去「全局设置 → 语言/Language」切换
跑一次截图 OCR:从框选到剪贴板
在「截图OCR」标签页里,除了快捷键,还能把别处复制的图片直接粘贴进来识别。识别完成后,左侧预览栏支持直接划选复制局部文字,右侧记录栏可以编辑、划选多条记录一次复制。
默认方案适合普通文章:它自动识别栏布局,把文字按阅读顺序整理好——把扫描页想成一堆散落的纸片,排版解析就是按阅读顺序把它们重新码齐。如果识别的是代码截图,把方案换成「单栏-保留缩进」,行首空格会被保留下来,粘贴进编辑器就能直接运行。
做一批图片识别:拖入文件夹,按格式导出
「批量OCR」标签页点「选择图片」,可一次添加几百张 jpg、png、webp、bmp、tiff,没有数量上限。选好输出格式(txt / jsonl / md / csv)和保存位置,点「开始任务」,能看到进度条、每张文件的耗时与状态,识别结果按文件逐条滚出在右侧记录栏。
图片带水印或页眉页脚时,在右侧设置进入「忽略区域」编辑器,按住右键画几个矩形框,任务会跳过框内文字;整夜挂机批量跑,还能开启「任务完成后自动关机/待机」。
走完整链路:一次搞定 12 页扫描讲义
前端开发小舟手头是 12 页扫描版讲义的 png 图片,每页角落都有个小水印,他想转成 Markdown 放进博客。
过程是这样的:他打开「批量OCR」标签页,一键加入讲义文件夹,进「忽略区域」编辑器按住右键在角落画了个矩形框,输出格式选 md,然后点「开始任务」。进度条跑了约 30 秒,12 个文件全部标记成功,输出目录里多出 12 个 md 文件。抽查一页,文字顺序正确,水印内容没有出现——他直接把文件粘进了博客草稿,还能全文搜索到代码片段。
往深处走:用命令行驱动 Umi-OCR
命令行入口就是主程序Umi-OCR.exe。只要全局设置里的「HTTP 服务」处于开启状态(默认开启,主机选「仅本地」即可),外部就能给它下指令:
umi-ocr --screenshot # 唤起截图识别 umi-ocr --path "D:/img1.png" "D:/docs" # 识别单图或整个文件夹 umi-ocr --output "D:/result.txt" # 把结果写入文件--path支持多个路径,文件夹会连子目录一起扫描;指令支持前缀缩写,比如--sc等价于--screenshot。想从脚本或别的程序调用它,看docs/http/下的 HTTP 接口手册;更多指令与输出方式见docs/下的命令行手册。
先读这几条踩坑备忘
- 启动闪退或打不开 → 确认装了 VC++ 运行库,且解压路径不含中文或特殊字符
- 识别结果和图片语言对不上 → 把识别语言库切换成图片内容的语言
- 长图、大图被截断 → 在页面设置里调高「限制图像边长」的数值
- 识别乱码、缺字 → 重新拍摄提高分辨率,或先调整图片对比度与亮度
- 界面闪烁、UI 错位 → 全局设置 → 界面和外观 → 切换渲染器,或关闭硬件加速
- 命令行指令没反应 → 确认全局设置里「HTTP 服务」已开启,主机为「仅本地」
- 识别完还弹出主窗口 → 在「截图OCR」标签页关闭「弹出主窗口」选项
- 大批量图片耗时太长 → 分批次执行,或开启任务完成后自动关机/待机
从截图到批量导出,全程离线、数据不出本地,这就是 Umi-OCR 的价值所在。下一步可以翻开 CLI 手册 和 HTTP 接口手册 把重复任务自动化,并跟着 更新日志 了解新特性。
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考