Umi-OCR:免费离线 OCR 工具,批量识别截图、图片与 PDF 扫描件
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
Umi-OCR 是一款免费开源的离线 OCR 软件,识别全程在本地完成,文件不需要上传。它覆盖截图识别、批量图片转文字、PDF 扫描件转可编辑文本、二维码扫描与生成等场景。本文从解压后首次启动讲起,说明三条主操作路径怎么走,以及哪些设置真正影响识别结果。
它替谁解决了什么事
处理敏感文档,不想上传云端
合同、证件这类文档里有敏感信息,多数在线 OCR 服务要求把图片传上去,内容存放在别人的服务器上。Umi-OCR 完全离线运行,图片自始至终不离开本机,适合处理这类文件。
一次把几百张图片转成文字
扫描的讲义、产品详情页,往往不是一两张。逐张转换太慢,手动录入更慢。批量页没有数量上限,可一次性导入几百张图片,结果按 txt、jsonl、md、csv 导出。
让 PDF 扫描件里的文字可搜索
PDF 扫描件本质上是一堆图片,搜不到也选不中,不处理就只能重新录入。文档识别可以输出双层可搜索 PDF,页面外观保持不变,同时支持全文搜索和划选文字。
部署与首次启动
- 获取发布包。包为 .7z 压缩包或 .7z.exe 自解压包,后者在没有压缩软件的电脑上也能直接用。
- 解压到任意目录,双击
Umi-OCR.exe启动。绿色免安装设计,不写系统注册表,整个文件夹拷到别的电脑即可用。 - 最低系统要求:Windows7 x64 或 Linux x64。
- 首次启动时界面语言跟随系统设置自动切换,无需手动操作;想换语言去"全局设置"→"语言"里改。
三条主操作路径
截图识别:框选屏幕任意区域取文字
打开"截图OCR"标签页,用快捷键唤起截图,框选要识别的区域;也可以在其他地方复制一张图片,直接粘贴进软件。左侧是图片预览栏,右侧是识别记录栏,记录可编辑,支持划选多条记录一起复制到剪贴板。这是使用频率最高的入口,适合随手提取一两段文字。
批量图片转文字:拖入图片并选择输出格式
打开"批量OCR"标签页,把本地图片(jpg、png、webp、bmp、tif 等)拖进界面,选择输出格式(txt、jsonl、md、csv)和保存目录,开始任务。没有数量上限,可一次性导入几百张图片;还可以勾选任务完成后自动关机/待机,适合晚间挂机跑完。图片上有水印时,先进右栏设置的"忽略区域"编辑器,按住右键画矩形框,框内的文本块会在任务中被跳过。
PDF 扫描件转可搜索文本
打开"文档识别"标签页,拖入 pdf、xps、epub、mobi、fb2、cbz 文件,选择"对扫描件进行 OCR"或"提取原有文本",输出双层可搜索 PDF。新文件落在选定的输出目录,版式与原文件一致,但能搜索、能划选。另有"二维码"标签页:可识别 19 种码制协议的二维码、条形码(支持一图多码),或输入文本生成二维码图片。
真正影响结果的配置项
以下参数位于"全局设置"和各页设置中,都是直接作用于识别质量或速度的。
- OCR 引擎:RapidOCR 与 PaddleOCR 可切换。RapidOCR 兼容性好,PaddleOCR 速度稍快。日常使用默认即可;老电脑遇到兼容问题时,优先选 RapidOCR。
- 纠正文本方向:仅 PaddleOCR 支持。默认关闭,正立的常规文档够用;遇到倾斜或倒置的扫描件时开启,代价是速度变慢。
- 限制图像边长:仅 PaddleOCR 支持,默认 960。常规尺寸图片够用;超大长图出现字小、识别不准时,调到 2880 或 4320。
- 排版解析方案:默认"多栏-按自然段换行"对大多数文档够用;解析代码截图选"单栏-保留缩进"。
- 忽略区域:默认未设置。图片上有水印、页眉页脚时,在编辑器里画矩形框,只有完整落在框内的文本块会被忽略,框外文字保留。
两个完整工作流
学生:一学期的扫描讲义图片
手头是一个文件夹、约 200 张讲义图片。打开批量页,一次性拖入全部图片,排版解析选"多栏-按自然段换行",输出格式设 md,开始任务。跑完后每张图片对应一个 md 文件,用任意编辑器打开,搜索"考试范围"能直接定位到是哪一页讲义里的内容。
公司职员:120 页扫描合同归档
手头是一份 120 页的扫描 PDF,文字选不中。打开文档识别页,拖入 PDF,选"对扫描件进行 OCR",输出双层 PDF。任务结束后,新文件外观与原文件一致,但支持关键词检索,查条款不用逐页翻。
出问题时先查这几处
- 识别结果换行混乱、多段被并成一行 → 排版解析方案与实际版式不符 → 在"排版解析"里换方案,多栏/单栏、是否换行按需选。
- 超大长图识别慢、字认不准 → 默认边长限制 960 压缩了大图 → 把"限制图像边长"调到 2880 或更高。
- 结果里混入水印、页眉文字 → 没设忽略区域 → 批量页右栏进入忽略区域编辑器,右键画框盖住水印位置,框尽量画大些。
- 界面截屏闪烁、UI 错位 → 显卡加速渲染与个别显卡冲突 → 全局设置"界面和外观"→"渲染器",换渲染方案或关闭硬件加速。
- 命令行、HTTP 接口调不通 → HTTP 服务未开启 → 在全局页检查服务开关,服务默认开启。
项目入口
官方文档:README.md;更新日志:CHANGE_LOG.md;HTTP 接口手册:docs/http/api_doc.md;命令行手册:docs/README_CLI.md。
下一步可以打开截图页,框选屏幕上的一段文字试一次识别,对照原文看看准确率是否够用。
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考