news 2026/8/31 7:41:50

Umi-OCR完整上手指南:离线OCR截图与批量识别安装教程

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Umi-OCR完整上手指南:离线OCR截图与批量识别安装教程

Umi-OCR完整上手指南:离线OCR截图与批量识别安装教程

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

Umi-OCR是什么:免费离线文字识别软件

Umi-OCR 是一款免费、开源的离线 OCR(Optical Character Recognition,光学字符识别)软件,能把图片、截图、PDF 里的文字转成可编辑文本,还支持二维码的读取与生成。它适合需要经常做文字识别、又不想把图片上传到网络的办公和学习场景,解决在线 OCR 服务依赖联网、按量计费、隐私不可控的问题。读完这篇指南,你能在 Windows 或 Linux 上三分钟装好 Umi-OCR,完成第一次截图识别,并掌握批量图片、PDF 文档识别等高频操作。

值不值得用:这套离线 OCR 方案适合你吗

Umi-OCR 的四个核心卖点:完全免费开源;绿色便携,解压即用,不写注册表、不装运行时;全程离线运行,图片不出本机;自带 Rapid-OCR、Paddle-OCR 等离线识别引擎插件,内置多语言识别库。相比在线 OCR 服务,它不需要注册、不上传图片,也没有调用次数限制,是免费离线识别的直接替代方案。

你的情况是否适合
在无网络或内网环境做文字识别适合,离线识别,不依赖网络
一次要处理几十上百张图片、PDF适合,批量识别无数量上限
不想用带广告、按次计费的在线 OCR适合,免费开源,功能完整
只是偶尔用手机拍一张字可以暂缓,移动端不是它的目标平台

三分钟跑起来:Umi-OCR 安装教程

Windows 7/10/11 启动

环境要求:Windows 7 x64 及以上版本,无需任何安装步骤。下载发行版压缩包(.7z格式,或.7z.exe自解压包,后者在没有压缩软件的电脑上也能直接双击解压),解压到一个不含中文的路径,然后运行主程序:

双击运行 Umi-OCR.exe

如果你习惯用 Scoop 包管理器,也可以在 PowerShell 中执行:

scoop install extras/umi-ocr

Linux 启动(macOS 暂不支持)

环境要求:Linux x64 系统,Ubuntu 20.04+、Debian 11+ 等主流发行版开箱可用。解压后进入目录,给启动脚本加执行权限并运行:

chmod +x umi-ocr.sh ./umi-ocr.sh

macOS 目前还在开发计划中,暂不可用。两个平台启动后,看到带「截图OCR」「批量OCR」「全局设置」标签页的主界面,就说明成功了。

完成一次截图 OCR 识别

这是使用率最高的功能:框选屏幕任意区域,秒级转成文字。以「把屏幕上一段代码识别出来」为目标,跟着做四步:

  1. 打开「截图OCR」标签页,点击工具栏左侧的截图按钮(也可在页面设置里绑定快捷键)。
  2. 按住鼠标拖出一个矩形框,圈住要识别的内容。
  3. 松开鼠标后自动开始识别,左侧图片预览区会用方框标出识别到的文本块。
  4. 在右侧「记录」标签页查看结果,右键点击某条记录,选择「复制」即可粘贴到任意文档。

预期结果:右侧记录区显示可编辑的文本,并带有置信度与耗时信息;记录支持划选多条一起复制、按记录编辑后保存。除了框选,把别处复制的图片直接粘贴进页面也能识别。

三个高频场景:批量图片、PDF 取文、二维码

批量图片识别:一次处理上百张图

手头有一批截图或扫描件要提取文字时,用「批量OCR」标签页。操作如下:

  1. 打开「批量OCR」标签页,点击「选择图片」添加文件,或直接拖入。
  2. 在右侧「设置」中选择结果保存格式(txt、csv、md 等),也可设置任务完成后自动关机。
  3. 点击「开始任务」,进度条实时显示,完成后在「记录」区查看每张图的结果。

💡 坑:像素超大的长图或大图识别不全时,先进入页面的「设置→文字识别→限制图像边长」,把数值调高再跑任务。

类型支持的格式
图片输入jpg、jpe、jpeg、jfif、png、webp、bmp、tif、tiff
文档输入pdf、xps、epub、mobi、fb2、cbz
结果输出txt、jsonl、md、csv(可用 Excel 打开)

PDF 文档识别:扫描件提取文字

需要检索或复制扫描版 PDF 里的文字时用「文档识别」标签页:

  1. 通过标签栏「+」打开「文档识别」页面,添加 pdf、epub、mobi 等文档。
  2. 支持设定忽略区域,可提前排除页眉、页脚的文字干扰。
  3. 启动任务,对扫描件执行 OCR,或直接提取文档原有文本。
  4. 输出为双层可搜索 PDF:原扫描图不变,上面盖一层可搜索、可复制的隐藏文本。

💡 增效技巧:任务完成后设置「自动关机/休眠」,晚上排队处理一整夜文档。

二维码识别与生成

要读取图片里的二维码、条形码,或反过来生成二维码时用「二维码」标签页:

  1. 截图、粘贴或拖入含二维码的图片,自动读取,一张图里多个码也能全部识别。
  2. 识别结果直接显示在记录区,支持复制。
  3. 切换到生成模式,输入文本即可生成二维码图片。

💡 支持 QRCode、EAN13、PDF417 等 19 种码制,生成时可调整纠错等级和图片尺寸。

个性化设置:全局设置里要动的三组选项

所有全局参数都在「全局设置」标签页,日常最常用的就三组。

快捷方式组:桌面快捷方式、开始菜单快捷方式、开机自启,各有一个开关。想让截图快捷键随时可用,建议打开「开机自启」,配合截图功能常驻后台。

界面和外观组:语言(Language)默认跟随系统,支持简体中文、繁体中文、英语、日语等,中文用户无需改动;主题(Theme)提供多个亮/暗色方案;字体和界面大小比例可按屏幕调整。

OCR 插件与高级组:OCR 插件下拉框用于切换识别引擎(Rapid-OCR 兼容性好,Paddle-OCR 速度稍快);「高级」里默认开启 HTTP 服务,这是命令行调用和网络接口的依赖,保持「仅本地」即可。若遇到截屏闪烁、界面错位,把「渲染器」切换成其他方案或关闭硬件加速。

进阶与扩展:命令行、HTTP 接口与插件系统

命令行调用:把识别写进脚本

命令行入口就是主程序Umi-OCR.exe,适合把截图识别嵌进自动化脚本,例如框选后立即把结果复制到剪贴板:

umi-ocr --screenshot --clip

指令也支持--path指定图片文件、--output写文件、--qrcode_read读二维码等,完整参数说明见 docs/README_CLI.md。注意:前提是全局设置里允许了 HTTP 服务(默认开启),指令通过本地回环通信,不经过外网。

HTTP 接口与插件系统

docs/http/ 提供了图片识别、文档识别、二维码读写、命令行转发的 HTTP 接口手册,供程序化调用。插件则存放在UmiOCR-data/plugins目录:发行版已内置 Rapid-OCR 引擎,从插件库下载 Paddle-OCR 等其他引擎插件放入该目录,重启后在「全局设置→OCR 插件」里切换即可,无需改任何代码。

常见问题快答

识别结果换行混乱、读不通顺?

现象:多栏排版被识别成一整行,或一段话被切碎。方案:在截图或批量页的「文本后处理→排版解析方案」中切换预设,多数情况选「多栏-按自然段换行」即可,代码截图则选「单栏-保留缩进」。

结果里混进了水印、页眉页脚?

现象:批量图片角落的水印文字反复出现在结果里。方案:进入批量识别页右栏的「忽略区域」编辑器,按住右键绘制矩形框包住水印位置,框内整块文本会被跳过。

命令行或 HTTP 接口不生效?

现象:执行umi-ocr指令无反应。方案:检查「全局设置→高级」中 HTTP 服务是否勾选(默认开启),主机保持「仅本地」。

界面闪烁、截图错位?

现象:截图时画面闪动或 UI 元素错位。方案:在「全局设置→界面和外观→渲染器」切换到其他渲染方案,或关闭硬件加速后重启软件。

收尾与下一步

  • 核心能力回顾:截图 OCR、批量图片、PDF 双层文档、二维码读写,全部离线完成。
  • 自动化扩展:命令行手册见 docs/README_CLI.md,HTTP 接口手册见 docs/http/。
  • 版本变动与开发计划:查 CHANGE_LOG.md。
  • 界面翻译文件位于 dev-tools/i18n/,欢迎参与补充语言;遇到问题时优先翻一遍上面的「常见问题快答」。

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/31 7:37:52

电机产线检测:PWM调速、转速测量与NVH分析实战

在电机产线检测中,PWM 信号、转速测量、NVH 声学分析这三件事经常被放在同一个工位完成。生产一台直流电机,从装配完成到下线,通常要验证它在给定 PWM 占空比下能否达到目标转速,同时监听它在运行过程中的振动和噪声是否超标。难点…

作者头像 李华
网站建设 2026/8/31 7:28:01

牛客模考一模实战解析:程序员笔试避坑与提分策略

每年到了春招和秋招的节点,牛客网上的模考活动就成了程序员求职者的“练兵场”。我自己经历了两次校招、又帮团队做过几次笔试题筛选,对“牛客模考(一模)”这类线上模拟笔试的含金量还是比较认可的。它最大的价值不是押中原题&…

作者头像 李华
网站建设 2026/8/31 7:27:16

B站2019秋招笔试编程题解析:字符串与动态规划实战指南

1. 2019秋招笔试全景:题型分布与考察逻辑先交代一下背景。2019年那会儿,B站的秋招笔试还远没有现在这么卷,但已经能看出这家公司的出题口味和一般互联网大厂不太一样。我当时完整刷过那一批题目,也帮学弟学妹做过复盘,…

作者头像 李华
网站建设 2026/8/31 7:22:10

用PyTorch从零实现Transformer:字符级语言模型实战

Transformer 是当前大语言模型和许多深度学习任务的核心架构,但很多人学它时卡在“概念听懂了、代码写不出来”这一步。网上讲解自注意力、QKV、位置编码的文章很多,真正能让人从 Token 开始一步步把模型写出来、跑起来、看到损失下降的材料却不多。这篇…

作者头像 李华
网站建设 2026/8/31 7:18:28

从零写一个思源笔记插件:6步完成你的第一个Petals

从零写一个思源笔记插件:6步完成你的第一个Petals 【免费下载链接】siyuan An open-source, privacy-first, self-hosted knowledge workspace where humans and AI agents work together 开源、隐私优先、自托管的知识工作空间,让人与智能体在此协作 …

作者头像 李华
网站建设 2026/8/31 7:14:36

基于JSP+Servlet+MySQL的校园活动管理系统设计与实现

简介:本资源是一套完整的校园活动管理系统毕业设计实现方案,面向计算机相关专业本科生及Web开发初学者,聚焦高校第二课堂管理场景,解决活动申报、审批、发布、报名与数据统计等核心业务流程的数字化落地问题。压缩包共2011个文件&…

作者头像 李华