Umi-OCR 离线文字识别指南:15 分钟跑通截图、批量、PDF 三大任务
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
在线 OCR 网站弹出"免费额度已用完",而手里的文件又是不能上传到任何第三方平台的敏感资料,怎么办?Umi-OCR 就是一台免费、开源的离线文字识别工具:截图识别、批量图片、PDF 扫描件,全在本地完成,文件不出你的电脑。
先花 30 秒定位:它是什么、不是什么
读完这一节,你能一句话向同事讲清楚 Umi-OCR 的边界。它是本地运行的文字识别软件:内置离线 OCR 引擎和多语言识别库,截图、图片、文档里的文字都能转成可复制文本,中日韩英等语言随系统识别库切换。
三条"它不是",帮你建立准确预期:
- 它不是在线服务:没有账号、没有额度,图片全程不上传
- 它不是安装程序:没有安装向导、不装依赖,解压后双击
Umi-OCR.exe就跑 - 它不只是截图工具:批量图片、PDF 文档识别、二维码识别与生成都在标签页里
三种常见替代方案怎么选
这一节把 Umi-OCR 和另外两种主流做法并排放,30 秒看懂它的取舍:
| 对比维度 | Umi-OCR | 在线免费 OCR 网站 | 付费商用 OCR |
|---|---|---|---|
| 费用 | 完全免费 | 限次,超量要付费 | 订阅或按量计费 |
| 联网要求 | 全程离线 | 图片必须上传服务器 | 一般需联网 |
| 隐私 | 文件只留在本地 | 敏感内容可能被上传 | 视服务商而定 |
| 安装门槛 | 解压即用 | 浏览器打开 | 安装 + 授权 |
| 场景覆盖 | 截图/批量/PDF/二维码/公式 | 多为单张图片 | 功能全但贵 |
对合同、论文、代码截图这类不能出网的内容,"离线"一行就值回票价。
从零开始:截图 OCR 四步跑通
按下面四步做完,你会拿到第一份可复制的识别结果:
- 下载发行版并解压。发布包是
.7z压缩包或.7z.exe自解压包,后者无需装压缩软件。- 这一步你会看到:解压出一个包含
Umi-OCR.exe的文件夹,没有任何安装步骤。
- 这一步你会看到:解压出一个包含
- 双击
Umi-OCR.exe启动。- 这一步你会看到:主窗口出现,界面语言自动跟随系统设置,中文用户零配置。
- 切到"截图 OCR"标签页,按全局快捷键唤起截图,框选屏幕上的文字区域后松手。
- 这一步你会看到:屏幕出现截图框;松手后自动开始识别。
- 在右侧记录面板取结果。
- 这一步你会看到:识别文本逐条出现在右侧记录区,鼠标划选即可复制,或
Ctrl+C带走。
- 这一步你会看到:识别文本逐条出现在右侧记录区,鼠标划选即可复制,或
这一页也支持在别处复制图片后直接粘贴进来识别,不一定要截图。
批量识别文件夹里的图片
读完这一节,你能把一个文件夹里的图片一次性转成文本文件。
怎么操作:切到"批量 OCR"标签页,选中图片拖入列表(支持jpg, png, webp, bmp, tif等格式),在右侧选保存格式——txt, jsonl, md, csv(Excel)任选——点"开始任务"。没有数量上限,几百张可以一次导入。
输出长什么样:每张图在右侧记录区按顺序生成一条识别结果,任务跑完按所选格式保存;选csv可以直接丢进 Excel 核对。
小贴士:长时间挂机跑图,可提前设置任务完成后自动关机/待机,第二天直接收结果。
PDF 扫描件怎么变成可搜索文本
读完这一节,你能把扫描版 PDF 变成"全文可搜、可复制"的文档。
怎么操作:切到"文档识别"标签页,把pdf, xps, epub, mobi, fb2, cbz格式的文件拖进去开始任务。有原生文字层的页面直接抽取文本,扫描图像页走 OCR。
输出长什么样:可输出双层可搜索 PDF——原页面不动,上面盖一层隐形文字层。旧扫描合同从此能全文检索、划选复制,这就是它的"第二次生命"。
小贴士:配合忽略区域用——按住右键在页眉、页脚、水印上画矩形框,区域内的文字不进结果。注意忽略单位是整个文本块而非单字,框要画得稍大、完全包住。
代码和多栏文字怎么不乱序
读完这一节,你能让识别结果的阅读顺序和排版跟原图一致。
怎么操作:在截图 OCR 或批量 OCR 页的设置里,找到"OCR 文本后处理 - 排版解析方案"。代码截图选单栏-保留缩进,双栏论文选多栏-按自然段换行,其余场景按需选对应方案。
输出长什么样:右侧识别结果保留代码的原始缩进与换行;多栏文本按自然段规则重排,不再左栏读一半跳右栏。
小贴士:所有预设方案都自动处理横排和竖排(从右到左)排版;顺序仍不满意就换个方案重识别,不必重新截图。
进阶:用命令行和 HTTP 接口调用 OCR 引擎
会写一点代码的话,这一节能把 Umi-OCR 变成脚本里随叫随到的本地 OCR 引擎。命令行入口就是主程序Umi-OCR.exe:
# 批量识别文件夹内所有图片,结果写入 result.txt umi-ocr --path "D:/scans" --output "D:/result.txt" # 截图识别并复制到剪贴板 umi-ocr --screenshot --clip程序间调用更适合走 HTTP 接口:图片 OCR、文档识别、二维码都有现成端点,完整参数与流程见 docs/http/README.md。需要改源码可以克隆仓库:
git clone https://gitcode.com/GitHub_Trending/um/Umi-OCR排障速查:症状 → 诊断 → 修复
这 4 个高频问题覆盖了大部分会卡住你的情况,对号入座即可:
- 长图识别丢字→ 大图被"限制图像边长"压过了 → 批量页"设置→文字识别"里调高该数值
- 水印页码混进结果→ 干扰区域没排除 → 用忽略区域把水印框住,框画大一点
- 双栏论文顺序错乱→ 默认方案不识别多栏 → 换"多栏-按自然段换行"重识别
- PDF 复制不出文字→ 纯扫描件没有文字层 → 走文档识别,输出双层可搜索 PDF
收尾:三个动作跑完全流程
回到开头那个卡壳瞬间:额度用完、文件不能出网——现在这两件事都有了本地解法,解压即跑,全程不断网。
按顺序做这三件事:
- 下载发行版解压,运行
Umi-OCR.exe,完成一次截图识别 - 拖一个图片文件夹或一份 PDF,分别体验批量识别与双层 PDF 输出
- 给截图 OCR 设一个顺手的全局快捷键,用一次就离不开了
延伸阅读:
- 命令行手册
- HTTP 接口手册
- 更新日志
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考