Umi-OCR:免费离线 OCR 软件,截图识别与批量处理完整指南
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
Umi-OCR 是一款开源、免费、完全离线运行的文字识别(OCR)软件,面向需要从截图、扫描文档和 PDF 中提取文字的普通用户。所有识别过程在本地机器上完成,图片不会离开你的电脑,断网状态下也能使用。支持 Windows 7 x64 与 Linux x64,解压后即可运行。
📥 第一次识别:从解压到出文字的 4 步
- 获取项目:
git clone https://gitcode.com/GitHub_Trending/um/Umi-OCR,或从仓库发布页下载最新.7z包并解压。 - 启动:Windows 双击
Umi-OCR.exe;Linux 运行umi-ocr.sh,没有安装环节。 - 检查设置:首次启动界面语言跟随系统,可在“全局设置”标签页的语言下拉框中切换。
- 试一次:打开“截图OCR”标签页,按截图快捷键(可在“设置”面板里自定义)框选屏幕区域,右侧记录栏即出现识别文字。
系统要求:
- 系统:Windows 7 x64 及以上,或 Linux x64
- 无需联网,离线引擎与多国语言识别库已打包在发布包内
全局设置标签页:可切换界面语言与主题,设置快捷键、开机启动与开机自启
🧩 四个主要标签页:截图、批量、文档、二维码
截图 OCR:框选区域,得到有顺序的文字
对屏幕框选区域识别,也可以把别处复制的图片直接粘贴进窗口。右侧记录栏支持编辑文字、划选多条记录一起复制。差异来自“OCR文本后处理”的排版解析方案:它会按文档版式重排识别结果,其中“单栏-保留缩进”能保住代码截图的行首缩进。开启方式:在截图OCR标签页顶部的后处理下拉框中选择方案,默认为“多栏-按自然段换行”。
截图OCR标签页:左侧图片预览可直接划选文字,右侧记录栏显示识别结果、置信度与耗时,右键可复制
批量 OCR:一次处理几百张图片
批量导入本地图片,支持 jpg、png、bmp、tif、webp 等格式,数量没有上限,列表里逐张显示耗时与置信度。结果可保存为 txt、jsonl、md、csv 四种格式。“忽略区域”编辑器允许按住右键在水印或页眉页脚位置画矩形框,框内整块文字在任务中被跳过;任务结束还能设置电脑自动关机或休眠。开启方式:在批量OCR标签页点“选择图片”或拖入图片,选好输出格式与保存位置,点“开始任务”。
批量OCR标签页:任务列表显示每张图的耗时与置信度,进度条给出总体进度,右侧逐条输出识别文字
文档识别:把 PDF 变成可搜索的文本
支持 pdf、xps、epub、mobi、fb2、cbz 格式。对扫描件逐页 OCR,对带文本层的文档直接提取原文。可输出“双层可搜索 PDF”——外观排版不变,但文字能选中、能搜索;同样支持设置忽略区域,排除页眉页脚。开启方式:在文档识别标签页选择文件并选定输出方式。
多语言界面与两套 OCR 引擎
界面支持简中、繁中、英、日等语言,首次打开自动跟随系统语言。识别引擎提供 Rapid-OCR 与 Paddle-OCR 两套(Rapid 兼容性更稳,Paddle 速度稍快),设置面板的“语言/模型库”用于选择目标识别语言。开启方式:在全局设置的 OCR 插件部分切换引擎。
同一套软件在繁中、日语、英语界面下的样子,设置面板可见引擎语言选择与保存格式选项
实战场景:三个可以照做的任务
数字化带水印的扫描合同
背景:扫描件上有公司 Logo 水印和页脚页码,直接识别会把水印文字带进结果。
- 在批量OCR标签页点“选择图片”,加入合同全部页面图。
- 在右侧设置进入“忽略区域”编辑器,按住右键分别画一个能盖住 Logo 和页码位置的矩形框,框要比水印略大。
- 保存格式选 txt,选定保存目录,点“开始任务”。
结果:每页文字按顺序存成文件,结果里没有水印与页码文字。
从教程截图里提取代码
背景:教程是代码截图,手敲一遍费时且容易敲错。
- 打开截图OCR标签页,在“OCR文本后处理”选“单栏-保留缩进”。
- 按截图快捷键框选代码区域。
- 在右侧记录栏右键选“复制”,粘贴到编辑器。
结果:行首缩进与行内空格保留,粘贴后代码结构不变。
截图OCR标签页识别 Python 代码截图,右侧识别结果保留了缩进与换行
从扫描论文里提取文本
背景:PDF 是纯扫描件,想引用、检索其中的段落和参考文献。
- 打开文档识别标签页,选中该 PDF。
- 输出方式选“双层可搜索 PDF”,开始任务。
结果:得到一份排版不变的 PDF,可以直接在其中搜索和选中文字,无需逐页重新识别。
进阶用法与常见坑
命令行入口就是主程序本身,HTTP 服务默认开启,通信走本地环回,不经过物理网卡:
umi-ocr --path "D:/图片文件夹"这条命令识别指定文件夹里的所有图片,也可以传单个文件路径;再加--clip把结果复制到剪贴板,或--output "file.txt"写入文件。umi-ocr --screenshot触发截屏识别,--clipboard识别剪贴板里的图片。完整参数见 docs/README_CLI.md,HTTP 接口手册在 docs/http/。
常见坑:
- 超长图、大图识别不全:页面设置 → 文字识别 → 限制图像边长,把数值调高。
- 忽略区域是按“文本块”跳过而不是单个字符,框画得太大或太小都可能漏掉水印。
- 屏幕闪烁、界面错位:在全局设置 → 界面和外观里更换渲染器或关闭硬件加速。
- 命令行多图任务耗时长,等上一条命令结束再输入下一条。
常见问题:
- 断网能用吗?能,识别全部在本地完成,引擎与语言库随发布包提供。
- 兼容 Windows 7 吗?x64 版本支持。
- 有 macOS 版吗?目前官方只发布 Windows 7 x64 与 Linux x64 版本。
- 引擎怎么选?发布包默认 Rapid-OCR,兼容性更稳;追求速度可换 Paddle-OCR。
- 能识别日文等语言吗?在“语言/模型库”选择对应模型库即可,界面语言也支持切换。
谁适合用,谁不适合
频繁处理扫描件、合同,需要从 PDF 提取文字,想用命令行或 HTTP 接口做自动化,或者不想把文档上传到任何服务器的人,都适合用它。需要 macOS 支持、或要做高并发服务端调用(官方说明其并发支持有限)的场景则不合适。与在线 OCR 服务相比,它的图片全程留在本地,代价是识别效果受本地引擎限制;与 PaddleOCR 这类开发者框架相比,它是不写代码的现成图形应用。
Umi-OCR 是一个即解压即用的离线文字识别工具,单次截图、批量图片、PDF 双层输出都能在没有网络的环境下完成。官方文档在 docs/ 目录,更新日志见 CHANGE_LOG.md。
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考