news 2026/9/6 16:11:17

Umi-OCR:3 分钟跑通的离线 OCR,把截图里的文字变出来

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Umi-OCR:3 分钟跑通的离线 OCR,把截图里的文字变出来

Umi-OCR:3 分钟跑通的离线 OCR,把截图里的文字变出来

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

小林晚上赶实验报告,屏幕上的关键代码全是图片,复制不出来。用 Umi-OCR 这个离线 OCR 工具,几秒钟就能把图里的字变成可复制的文本。

三句话看懂:这套离线 OCR 工具是什么

Umi-OCR 是一款开源、免费的离线 OCR 软件,解压即用、无需联网,识别过程全部在本地电脑完成。它和在线 OCR 服务最关键的区别是:图片不上传、无需注册、不收费用。适合处理敏感资料,以及有大量截图、扫描件要转文字的用户。

Umi-OCR在线 OCR 服务
数据去向只留在本地上传云端
费用免费(开源)多需注册或付费
网络要求离线可用必须联网

3 分钟跑通第一次识别

下载发行版压缩包(仓库根目录就有Umi-OCR_Rapid_v2.1.5.7z,也可去发布页拿最新版),解压后跟着做:

  1. 双击包里的Umi-OCR.exe,界面语言首次启动会跟随系统自动切换
  2. 打开顶部的「截图OCR」标签页,默认排版方案「多栏-按自然段换行」适用大多数场景
  3. Ctrl+Shift+A,用鼠标框选屏幕上的文字区域
  4. 约 2 秒后右侧「记录」栏出现识别结果,划选即可 Ctrl+C 复制
  5. 界面语言不合适时,去「全局设置 → 语言/Language」切换

跑一次截图 OCR:从框选到剪贴板

在「截图OCR」标签页里,除了快捷键,还能把别处复制的图片直接粘贴进来识别。识别完成后,左侧预览栏支持直接划选复制局部文字,右侧记录栏可以编辑、划选多条记录一次复制。

默认方案适合普通文章:它自动识别栏布局,把文字按阅读顺序整理好——把扫描页想成一堆散落的纸片,排版解析就是按阅读顺序把它们重新码齐。如果识别的是代码截图,把方案换成「单栏-保留缩进」,行首空格会被保留下来,粘贴进编辑器就能直接运行。

做一批图片识别:拖入文件夹,按格式导出

「批量OCR」标签页点「选择图片」,可一次添加几百张 jpg、png、webp、bmp、tiff,没有数量上限。选好输出格式(txt / jsonl / md / csv)和保存位置,点「开始任务」,能看到进度条、每张文件的耗时与状态,识别结果按文件逐条滚出在右侧记录栏。

图片带水印或页眉页脚时,在右侧设置进入「忽略区域」编辑器,按住右键画几个矩形框,任务会跳过框内文字;整夜挂机批量跑,还能开启「任务完成后自动关机/待机」。

走完整链路:一次搞定 12 页扫描讲义

前端开发小舟手头是 12 页扫描版讲义的 png 图片,每页角落都有个小水印,他想转成 Markdown 放进博客。

过程是这样的:他打开「批量OCR」标签页,一键加入讲义文件夹,进「忽略区域」编辑器按住右键在角落画了个矩形框,输出格式选 md,然后点「开始任务」。进度条跑了约 30 秒,12 个文件全部标记成功,输出目录里多出 12 个 md 文件。抽查一页,文字顺序正确,水印内容没有出现——他直接把文件粘进了博客草稿,还能全文搜索到代码片段。

往深处走:用命令行驱动 Umi-OCR

命令行入口就是主程序Umi-OCR.exe。只要全局设置里的「HTTP 服务」处于开启状态(默认开启,主机选「仅本地」即可),外部就能给它下指令:

umi-ocr --screenshot # 唤起截图识别 umi-ocr --path "D:/img1.png" "D:/docs" # 识别单图或整个文件夹 umi-ocr --output "D:/result.txt" # 把结果写入文件

--path支持多个路径,文件夹会连子目录一起扫描;指令支持前缀缩写,比如--sc等价于--screenshot。想从脚本或别的程序调用它,看docs/http/下的 HTTP 接口手册;更多指令与输出方式见docs/下的命令行手册。

先读这几条踩坑备忘

  • 启动闪退或打不开 → 确认装了 VC++ 运行库,且解压路径不含中文或特殊字符
  • 识别结果和图片语言对不上 → 把识别语言库切换成图片内容的语言
  • 长图、大图被截断 → 在页面设置里调高「限制图像边长」的数值
  • 识别乱码、缺字 → 重新拍摄提高分辨率,或先调整图片对比度与亮度
  • 界面闪烁、UI 错位 → 全局设置 → 界面和外观 → 切换渲染器,或关闭硬件加速
  • 命令行指令没反应 → 确认全局设置里「HTTP 服务」已开启,主机为「仅本地」
  • 识别完还弹出主窗口 → 在「截图OCR」标签页关闭「弹出主窗口」选项
  • 大批量图片耗时太长 → 分批次执行,或开启任务完成后自动关机/待机

从截图到批量导出,全程离线、数据不出本地,这就是 Umi-OCR 的价值所在。下一步可以翻开 CLI 手册 和 HTTP 接口手册 把重复任务自动化,并跟着 更新日志 了解新特性。

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/6 16:11:13

3 分钟把微信聊天记录备份下来:WeChatMsg 上手指南

3 分钟把微信聊天记录备份下来:WeChatMsg 上手指南 【免费下载链接】WeChatMsg 提取微信聊天记录,将其导出成HTML、Word、CSV文档永久保存,对聊天记录进行分析生成年度聊天报告 项目地址: https://gitcode.com/GitHub_Trending/we/WeChatMs…

作者头像 李华
网站建设 2026/9/6 16:07:53

React Router 6.4 架构决策:如何把 Remix 分层到 React Router 6.4 之上

React Router 6.4 架构决策:如何把 Remix 分层到 React Router 6.4 之上 【免费下载链接】react-router Declarative routing for React 项目地址: https://gitcode.com/GitHub_Trending/re/react-router 本篇基于 React Router 仓库中的架构决策记录 0007-r…

作者头像 李华
网站建设 2026/9/6 16:06:22

计算机网络实验报告高分攻略:抓包、路由与Socket编程实战

简介:这份实验报告来自广东工业大学计算机学院,完整覆盖计算机网络课程中两个基础实验模块:Windows 下常用网络命令(Ping、IPconfig、Netsh、Tracert、Netstat、Arp、Nslookup)和协议分析软件基础(Wireshar…

作者头像 李华
网站建设 2026/9/6 15:59:38

WavLM 完整使用指南:加载模型、提取特征到语音任务全流程

WavLM 完整使用指南:加载模型、提取特征到语音任务全流程 【免费下载链接】unilm Large-scale Self-supervised Pre-training Across Tasks, Languages, and Modalities 项目地址: https://gitcode.com/GitHub_Trending/un/unilm 如果你需要把一段 16kHz 的语…

作者头像 李华