Umi-OCR 免费离线OCR完全教程:Win7老电脑3步装好,截图、批量识别全支持
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
如果你还有一台装着 Windows 7 的旧台式机,想让屏幕里的文字一键变成可复制的文本,不妨试试Umi-OCR——这是一款完全免费、开源于 GitHub 的离线OCR文字识别工具,断网状态下也能把截图、成批的图片甚至扫描版 PDF 里的字"抠"出来,识别结果直接落到剪贴板或文件里,不经过任何第三方服务器。
下面这篇教程按"准备环境 → 装好软件 → 跑通功能 → 解决毛病"的顺序走一遍,全程不堆参数,只讲你实际要点的按钮和要看的现象。
为什么这台免费离线OCR值得装到老电脑上
它到底是什么:Umi-OCR 把 OCR(Optical Character Recognition,光学字符识别,即"看图识字")引擎整个打包进了一个绿色程序里,解压即用,全程不需要联网。官方明确标注支持Windows 7 x64及更新的系统,也提供 Linux x64 版本。
三个核心亮点,对应三类常见需求:
- 截图即识别:框选一下屏幕,文字就出现在识别记录里,适合从视频、网页、软件界面里"抠字";
- 批量处理:一次拖入几百张图片,可以排除水印和页眉页脚区域,结果按 txt、csv(Excel)、jsonl 等格式落盘,适合票据、文档扫描件整理;
- 识别语言内置:中文、繁体、英文、日文等多国语言库随包附带,界面本身也支持多语言,首次启动会跟随系统语言自动切换,不用单独下载语言包。
适用场景:偶尔提取屏幕文字、批量整理扫描图片、给 PDF 加可搜索文本层、顺带扫一下二维码/生成二维码——这些是它最趁手的活。
不太合适的场景:你的系统是32 位Windows 7(运行环境已转向 64 位,不再兼容 32 位)、你用的是 macOS、或者你需要云端级别的超大并发识别能力。这三种情况请另选工具。
动手前:把环境准备清单过一遍
| 项目 | 要求 | 说明 |
|---|---|---|
| 操作系统 | Windows 7SP1 64 位及以上 / Linux x64 | 先按winver确认系统版本和位数,32 位系统无法运行 |
| 运行库 | Visual C++ 2015-2022 可再发行组件包(x64) | 老系统常见缺失项,提前装好可少走弯路 |
| 系统更新 | Windows 7 建议补齐 SP1 及后续安全更新 | 部分底层 API 依赖较新的系统组件 |
| 磁盘空间 | 预留约 1GB 空闲 | 程序本体 + OCR 引擎模型文件 |
| 硬件 | 双核 CPU、4GB 内存以上体验更佳 | 低配机器可用,只是批量任务会慢一些 |
获取方式(二选一):
- 下载发行版(推荐普通用户):从项目的发布页下载
.7z压缩包;如果目标电脑没装压缩软件,选.7z.exe自解压包,双击就能解压。包名类似Umi-OCR_Rapid_v2.1.5.7z,其中Rapid表示内置 RapidOCR 引擎,兼容性优先。 - 克隆源码仓库(适合想研究或参与开发的人):执行下面的命令拉取一个稳定的发布分支:
git clone --single-branch --branch release/2.1.4 https://gitcode.com/GitHub_Trending/um/Umi-OCR4步装好:从下载到第一次识别成功
第 1 步:把压缩包放到一个"干净"的路径
把下载的 7z 包放到不含中文和空格的目录,例如D:\Tools\。这是为了避免个别运行库组件在奇怪路径下出怪问题。
验证:文件管理器里能看到这个压缩包,且路径全是英文字符。
第 2 步:解压,认准主程序
用 7-Zip 或自解压包解压。解压完成后,目录里应能看到主程序Umi-OCR.exe和一个叫UmiOCR-data的文件夹(里面是引擎、插件和界面资源)。
验证:
Umi-OCR.exe与UmiOCR-data两个都存在,才算解压完整。
第 3 步:双击启动,看语言对不对
双击Umi-OCR.exe。首次启动程序会自动生成默认配置(保存在UmiOCR-data/.settings)。检查界面是否按你的系统语言显示成中文;如果不是,去全局设置 → 语言/Language手动切换一下。
验证:主窗口正常打开,标签栏出现"截图OCR / 批量OCR / 文档识别"等标签页,文字无乱码。
第 4 步:跑一次冒烟测试
在"截图OCR"标签页按默认快捷键唤起截图,框选屏幕上任意一段文字,松开鼠标。
验证:右侧识别记录栏里出现了你框选的文字,点一下复制按钮就能粘贴到别处——做到这一步,安装就算成功了。
三个高频场景:把截图OCR和批量识别用顺手
截图OCR怎么设置:一键框选屏幕文字
- 入口:打开"截图OCR"标签页。
- 操作:按快捷键唤起截图遮罩,用鼠标框选目标区域;也可以在别处复制一张图片,直接粘贴进来识别。左侧是图片预览(带文字框标注),右侧是可编辑的识别记录,支持跨多条记录划选复制。
- 预期效果:松开鼠标后一两秒内,文字出现在记录栏;点复制,粘贴到 Word 或聊天框即是纯文本。
文字顺序乱?打开"排版解析":引擎的原始输出是按文字块给出的,多栏文章、代码截图容易"串行"。在截图OCR页的设置里找到文本后处理 - 排版解析方案,选多栏-按自然段换行适合绝大多数文章场景;识别代码截图则选单栏-保留缩进。改完再识别一次,段落顺序会明显变顺。
如何开启批量图片识别:一次处理几百张图
- 入口:打开"批量OCR"标签页。
- 操作:把图片(支持 jpg、png、webp、bmp、tiff 等)或整个文件夹直接拖进列表。若图片上带固定位置的水印或页眉,点右栏设置进入忽略区域编辑器,按住右键把水印位置框成大矩形——框内的文字会在任务中被整体跳过。然后选择输出格式(txt / csv(Excel) / jsonl / md),点开始任务;还可以勾选"任务完成后自动关机",适合下班前挂一批图,回家收结果。
- 预期效果:任务条逐张推进,完成后在输出目录得到与图片同名的结果文件;水印处的文字不再混入结果。
小提示:要识别特别长的长图时,先到页面设置 → 文字识别 → 限制图像边长把数值调大,否则超长图会被截断处理。
文档识别和二维码:顺手的隐藏技能
- 文档识别:在"文档识别"标签页拖入
pdf(也支持 epub、mobi 等),可以提取 PDF 原有文本,或对扫描件做 OCR 并输出双层可搜索 PDF(上面是原文图层、下面藏着可检索的文字层);页眉页脚同样可以用忽略区域排除。 - 二维码:"二维码"标签页既能扫(截图、粘贴或拖入图片,支持一图多码、19 种编码协议),也能反向操作——输入文本生成二维码图片。
避坑指南:常见症状速查表
| 症状 | 可能原因 | 解法 |
|---|---|---|
双击Umi-OCR.exe报错提示缺少 DLL / 运行库错误 | 系统缺少 VC++ 可再发行组件包 | 安装Visual C++ 2015-2022(x64);Win7 用户同时确认 SP1 已装好、安全更新已补齐 |
| 截图时屏幕闪烁、界面错位、控件重叠 | 老显卡与默认硬件加速渲染不兼容 | 进全局设置 → 界面和外观 → 渲染器,换一种渲染方案或直接关闭硬件加速,改完重启软件观察 |
| Win7 下文档识别打不开或报错 | 旧版对 Win7 + 低配 CPU 的文档模块兼容问题 | 升级到 v2.1.1 及以上版本,该问题已修复(见更新日志) |
| 识别结果顺序混乱、段落串位 | 使用了引擎原始输出,未做排版整理 | 在设置中启用排版解析,多栏文章选"多栏-按自然段换行" |
| 水印、LOGO 文字混进批量结果 | 没设忽略区域 | 在批量OCR页右栏打开忽略区域编辑器,把水印位置框大、框全再跑任务 |
| 超长图识别结果不全 | 图像边长超出默认限制 | 调高限制图像边长数值 |
| 第一次识别很慢,之后正常 | 引擎首次启动要加载模型文件 | 属正常现象,等待即可;程序闲置约半分钟后会自动释放引擎内存,不必担心占用 |
| 命令行输入了指令却收不到结果 | 主程序未运行,或 HTTP 服务未开启 | 保持 Umi-OCR 在后台运行,确认全局设置中 HTTP 服务已允许(默认开启,主机选"仅本地"即可) |
如果还想更进一步:命令行党可以用Umi-OCR.exe --help查看所有指令(如--screenshot、--path批量喂图),进阶用户还能通过 HTTP 接口把它接进自己的自动化脚本,详细用法看 命令行手册 和 HTTP接口手册。
写在最后:更新与进阶资料去哪看
Umi-OCR 的思路其实很朴素:把"看图识字"这件事彻底搬进本地,免费、断网可用、老电脑也能跑——对 Win7 64 位用户来说,它至今仍是一台被持续维护的离线OCR工具。日常使用记住三件事就够了:装对运行库、遇到界面异常就切渲染器、批量任务先画忽略区域。
后续想要新功能动态或排错依据,可以常翻三处资料:项目说明见 README,历次改动记录见 更新日志,需要外部调用则参考 docs/http/README.md。版本发布节奏不快但稳定,隔几个月回来检查一次更新日志,通常都能收获一批兼容性修复。
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考