Umi-OCR完整上手指南:离线OCR截图与批量识别安装教程
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
Umi-OCR是什么:免费离线文字识别软件
Umi-OCR 是一款免费、开源的离线 OCR(Optical Character Recognition,光学字符识别)软件,能把图片、截图、PDF 里的文字转成可编辑文本,还支持二维码的读取与生成。它适合需要经常做文字识别、又不想把图片上传到网络的办公和学习场景,解决在线 OCR 服务依赖联网、按量计费、隐私不可控的问题。读完这篇指南,你能在 Windows 或 Linux 上三分钟装好 Umi-OCR,完成第一次截图识别,并掌握批量图片、PDF 文档识别等高频操作。
值不值得用:这套离线 OCR 方案适合你吗
Umi-OCR 的四个核心卖点:完全免费开源;绿色便携,解压即用,不写注册表、不装运行时;全程离线运行,图片不出本机;自带 Rapid-OCR、Paddle-OCR 等离线识别引擎插件,内置多语言识别库。相比在线 OCR 服务,它不需要注册、不上传图片,也没有调用次数限制,是免费离线识别的直接替代方案。
| 你的情况 | 是否适合 |
|---|---|
| 在无网络或内网环境做文字识别 | 适合,离线识别,不依赖网络 |
| 一次要处理几十上百张图片、PDF | 适合,批量识别无数量上限 |
| 不想用带广告、按次计费的在线 OCR | 适合,免费开源,功能完整 |
| 只是偶尔用手机拍一张字 | 可以暂缓,移动端不是它的目标平台 |
三分钟跑起来:Umi-OCR 安装教程
Windows 7/10/11 启动
环境要求:Windows 7 x64 及以上版本,无需任何安装步骤。下载发行版压缩包(.7z格式,或.7z.exe自解压包,后者在没有压缩软件的电脑上也能直接双击解压),解压到一个不含中文的路径,然后运行主程序:
双击运行 Umi-OCR.exe如果你习惯用 Scoop 包管理器,也可以在 PowerShell 中执行:
scoop install extras/umi-ocrLinux 启动(macOS 暂不支持)
环境要求:Linux x64 系统,Ubuntu 20.04+、Debian 11+ 等主流发行版开箱可用。解压后进入目录,给启动脚本加执行权限并运行:
chmod +x umi-ocr.sh ./umi-ocr.shmacOS 目前还在开发计划中,暂不可用。两个平台启动后,看到带「截图OCR」「批量OCR」「全局设置」标签页的主界面,就说明成功了。
完成一次截图 OCR 识别
这是使用率最高的功能:框选屏幕任意区域,秒级转成文字。以「把屏幕上一段代码识别出来」为目标,跟着做四步:
- 打开「截图OCR」标签页,点击工具栏左侧的截图按钮(也可在页面设置里绑定快捷键)。
- 按住鼠标拖出一个矩形框,圈住要识别的内容。
- 松开鼠标后自动开始识别,左侧图片预览区会用方框标出识别到的文本块。
- 在右侧「记录」标签页查看结果,右键点击某条记录,选择「复制」即可粘贴到任意文档。
预期结果:右侧记录区显示可编辑的文本,并带有置信度与耗时信息;记录支持划选多条一起复制、按记录编辑后保存。除了框选,把别处复制的图片直接粘贴进页面也能识别。
三个高频场景:批量图片、PDF 取文、二维码
批量图片识别:一次处理上百张图
手头有一批截图或扫描件要提取文字时,用「批量OCR」标签页。操作如下:
- 打开「批量OCR」标签页,点击「选择图片」添加文件,或直接拖入。
- 在右侧「设置」中选择结果保存格式(txt、csv、md 等),也可设置任务完成后自动关机。
- 点击「开始任务」,进度条实时显示,完成后在「记录」区查看每张图的结果。
💡 坑:像素超大的长图或大图识别不全时,先进入页面的「设置→文字识别→限制图像边长」,把数值调高再跑任务。
| 类型 | 支持的格式 |
|---|---|
| 图片输入 | jpg、jpe、jpeg、jfif、png、webp、bmp、tif、tiff |
| 文档输入 | pdf、xps、epub、mobi、fb2、cbz |
| 结果输出 | txt、jsonl、md、csv(可用 Excel 打开) |
PDF 文档识别:扫描件提取文字
需要检索或复制扫描版 PDF 里的文字时用「文档识别」标签页:
- 通过标签栏「+」打开「文档识别」页面,添加 pdf、epub、mobi 等文档。
- 支持设定忽略区域,可提前排除页眉、页脚的文字干扰。
- 启动任务,对扫描件执行 OCR,或直接提取文档原有文本。
- 输出为双层可搜索 PDF:原扫描图不变,上面盖一层可搜索、可复制的隐藏文本。
💡 增效技巧:任务完成后设置「自动关机/休眠」,晚上排队处理一整夜文档。
二维码识别与生成
要读取图片里的二维码、条形码,或反过来生成二维码时用「二维码」标签页:
- 截图、粘贴或拖入含二维码的图片,自动读取,一张图里多个码也能全部识别。
- 识别结果直接显示在记录区,支持复制。
- 切换到生成模式,输入文本即可生成二维码图片。
💡 支持 QRCode、EAN13、PDF417 等 19 种码制,生成时可调整纠错等级和图片尺寸。
个性化设置:全局设置里要动的三组选项
所有全局参数都在「全局设置」标签页,日常最常用的就三组。
快捷方式组:桌面快捷方式、开始菜单快捷方式、开机自启,各有一个开关。想让截图快捷键随时可用,建议打开「开机自启」,配合截图功能常驻后台。
界面和外观组:语言(Language)默认跟随系统,支持简体中文、繁体中文、英语、日语等,中文用户无需改动;主题(Theme)提供多个亮/暗色方案;字体和界面大小比例可按屏幕调整。
OCR 插件与高级组:OCR 插件下拉框用于切换识别引擎(Rapid-OCR 兼容性好,Paddle-OCR 速度稍快);「高级」里默认开启 HTTP 服务,这是命令行调用和网络接口的依赖,保持「仅本地」即可。若遇到截屏闪烁、界面错位,把「渲染器」切换成其他方案或关闭硬件加速。
进阶与扩展:命令行、HTTP 接口与插件系统
命令行调用:把识别写进脚本
命令行入口就是主程序Umi-OCR.exe,适合把截图识别嵌进自动化脚本,例如框选后立即把结果复制到剪贴板:
umi-ocr --screenshot --clip指令也支持--path指定图片文件、--output写文件、--qrcode_read读二维码等,完整参数说明见 docs/README_CLI.md。注意:前提是全局设置里允许了 HTTP 服务(默认开启),指令通过本地回环通信,不经过外网。
HTTP 接口与插件系统
docs/http/ 提供了图片识别、文档识别、二维码读写、命令行转发的 HTTP 接口手册,供程序化调用。插件则存放在UmiOCR-data/plugins目录:发行版已内置 Rapid-OCR 引擎,从插件库下载 Paddle-OCR 等其他引擎插件放入该目录,重启后在「全局设置→OCR 插件」里切换即可,无需改任何代码。
常见问题快答
识别结果换行混乱、读不通顺?
现象:多栏排版被识别成一整行,或一段话被切碎。方案:在截图或批量页的「文本后处理→排版解析方案」中切换预设,多数情况选「多栏-按自然段换行」即可,代码截图则选「单栏-保留缩进」。
结果里混进了水印、页眉页脚?
现象:批量图片角落的水印文字反复出现在结果里。方案:进入批量识别页右栏的「忽略区域」编辑器,按住右键绘制矩形框包住水印位置,框内整块文本会被跳过。
命令行或 HTTP 接口不生效?
现象:执行umi-ocr指令无反应。方案:检查「全局设置→高级」中 HTTP 服务是否勾选(默认开启),主机保持「仅本地」。
界面闪烁、截图错位?
现象:截图时画面闪动或 UI 元素错位。方案:在「全局设置→界面和外观→渲染器」切换到其他渲染方案,或关闭硬件加速后重启软件。
收尾与下一步
- 核心能力回顾:截图 OCR、批量图片、PDF 双层文档、二维码读写,全部离线完成。
- 自动化扩展:命令行手册见 docs/README_CLI.md,HTTP 接口手册见 docs/http/。
- 版本变动与开发计划:查 CHANGE_LOG.md。
- 界面翻译文件位于 dev-tools/i18n/,欢迎参与补充语言;遇到问题时优先翻一遍上面的「常见问题快答」。
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考