news 2026/9/19 2:01:41

Umi-OCR 离线文字识别指南:15 分钟跑通截图、批量、PDF 三大任务

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Umi-OCR 离线文字识别指南:15 分钟跑通截图、批量、PDF 三大任务

Umi-OCR 离线文字识别指南:15 分钟跑通截图、批量、PDF 三大任务

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

在线 OCR 网站弹出"免费额度已用完",而手里的文件又是不能上传到任何第三方平台的敏感资料,怎么办?Umi-OCR 就是一台免费、开源的离线文字识别工具:截图识别、批量图片、PDF 扫描件,全在本地完成,文件不出你的电脑。

先花 30 秒定位:它是什么、不是什么

读完这一节,你能一句话向同事讲清楚 Umi-OCR 的边界。它是本地运行的文字识别软件:内置离线 OCR 引擎和多语言识别库,截图、图片、文档里的文字都能转成可复制文本,中日韩英等语言随系统识别库切换。

三条"它不是",帮你建立准确预期:

  • 它不是在线服务:没有账号、没有额度,图片全程不上传
  • 它不是安装程序:没有安装向导、不装依赖,解压后双击Umi-OCR.exe就跑
  • 它不只是截图工具:批量图片、PDF 文档识别、二维码识别与生成都在标签页里

三种常见替代方案怎么选

这一节把 Umi-OCR 和另外两种主流做法并排放,30 秒看懂它的取舍:

对比维度Umi-OCR在线免费 OCR 网站付费商用 OCR
费用完全免费限次,超量要付费订阅或按量计费
联网要求全程离线图片必须上传服务器一般需联网
隐私文件只留在本地敏感内容可能被上传视服务商而定
安装门槛解压即用浏览器打开安装 + 授权
场景覆盖截图/批量/PDF/二维码/公式多为单张图片功能全但贵

对合同、论文、代码截图这类不能出网的内容,"离线"一行就值回票价。

从零开始:截图 OCR 四步跑通

按下面四步做完,你会拿到第一份可复制的识别结果:

  1. 下载发行版并解压。发布包是.7z压缩包或.7z.exe自解压包,后者无需装压缩软件。
    • 这一步你会看到:解压出一个包含Umi-OCR.exe的文件夹,没有任何安装步骤。
  2. 双击Umi-OCR.exe启动
    • 这一步你会看到:主窗口出现,界面语言自动跟随系统设置,中文用户零配置。
  3. 切到"截图 OCR"标签页,按全局快捷键唤起截图,框选屏幕上的文字区域后松手
    • 这一步你会看到:屏幕出现截图框;松手后自动开始识别。
  4. 在右侧记录面板取结果
    • 这一步你会看到:识别文本逐条出现在右侧记录区,鼠标划选即可复制,或Ctrl+C带走。

这一页也支持在别处复制图片后直接粘贴进来识别,不一定要截图。

批量识别文件夹里的图片

读完这一节,你能把一个文件夹里的图片一次性转成文本文件。

怎么操作:切到"批量 OCR"标签页,选中图片拖入列表(支持jpg, png, webp, bmp, tif等格式),在右侧选保存格式——txt, jsonl, md, csv(Excel)任选——点"开始任务"。没有数量上限,几百张可以一次导入。

输出长什么样:每张图在右侧记录区按顺序生成一条识别结果,任务跑完按所选格式保存;选csv可以直接丢进 Excel 核对。

小贴士:长时间挂机跑图,可提前设置任务完成后自动关机/待机,第二天直接收结果。

PDF 扫描件怎么变成可搜索文本

读完这一节,你能把扫描版 PDF 变成"全文可搜、可复制"的文档。

怎么操作:切到"文档识别"标签页,把pdf, xps, epub, mobi, fb2, cbz格式的文件拖进去开始任务。有原生文字层的页面直接抽取文本,扫描图像页走 OCR。

输出长什么样:可输出双层可搜索 PDF——原页面不动,上面盖一层隐形文字层。旧扫描合同从此能全文检索、划选复制,这就是它的"第二次生命"。

小贴士:配合忽略区域用——按住右键在页眉、页脚、水印上画矩形框,区域内的文字不进结果。注意忽略单位是整个文本块而非单字,框要画得稍大、完全包住。

代码和多栏文字怎么不乱序

读完这一节,你能让识别结果的阅读顺序和排版跟原图一致。

怎么操作:在截图 OCR 或批量 OCR 页的设置里,找到"OCR 文本后处理 - 排版解析方案"。代码截图选单栏-保留缩进,双栏论文选多栏-按自然段换行,其余场景按需选对应方案。

输出长什么样:右侧识别结果保留代码的原始缩进与换行;多栏文本按自然段规则重排,不再左栏读一半跳右栏。

小贴士:所有预设方案都自动处理横排和竖排(从右到左)排版;顺序仍不满意就换个方案重识别,不必重新截图。

进阶:用命令行和 HTTP 接口调用 OCR 引擎

会写一点代码的话,这一节能把 Umi-OCR 变成脚本里随叫随到的本地 OCR 引擎。命令行入口就是主程序Umi-OCR.exe

# 批量识别文件夹内所有图片,结果写入 result.txt umi-ocr --path "D:/scans" --output "D:/result.txt" # 截图识别并复制到剪贴板 umi-ocr --screenshot --clip

程序间调用更适合走 HTTP 接口:图片 OCR、文档识别、二维码都有现成端点,完整参数与流程见 docs/http/README.md。需要改源码可以克隆仓库:

git clone https://gitcode.com/GitHub_Trending/um/Umi-OCR

排障速查:症状 → 诊断 → 修复

这 4 个高频问题覆盖了大部分会卡住你的情况,对号入座即可:

  • 长图识别丢字→ 大图被"限制图像边长"压过了 → 批量页"设置→文字识别"里调高该数值
  • 水印页码混进结果→ 干扰区域没排除 → 用忽略区域把水印框住,框画大一点
  • 双栏论文顺序错乱→ 默认方案不识别多栏 → 换"多栏-按自然段换行"重识别
  • PDF 复制不出文字→ 纯扫描件没有文字层 → 走文档识别,输出双层可搜索 PDF

收尾:三个动作跑完全流程

回到开头那个卡壳瞬间:额度用完、文件不能出网——现在这两件事都有了本地解法,解压即跑,全程不断网。

按顺序做这三件事:

  • 下载发行版解压,运行Umi-OCR.exe,完成一次截图识别
  • 拖一个图片文件夹或一份 PDF,分别体验批量识别与双层 PDF 输出
  • 给截图 OCR 设一个顺手的全局快捷键,用一次就离不开了

延伸阅读:

  • 命令行手册
  • HTTP 接口手册
  • 更新日志

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/19 2:01:36

从 M2 Mac 切到 M4 Mac,TaoToken Key 还能复用

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/19 1:59:42

插件崩了要扶,OpenClaw 的 TaoToken 请求如何自检?

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/19 1:54:43

STM32 LWIP HTTPD服务器搭建实战:5步避坑指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/19 1:52:47

OrCAD原理图库从零构建:电阻电容LED符号与封装绑定实战

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/19 1:51:48

VC++ 6.0从零建C语言工程:工作区、编译调试与迁移指南

1. 为什么现在还值得聊 VC 6.0 建工程这件事先把结论摆在最前面:Microsoft Visual C 6.0 是一个 1998 年发布的集成开发环境,放到今天来看,它的编译器标准、调试器能力、代码提示水平都已经严重落后。但我依然认为,对刚接触 C 语言…

作者头像 李华
网站建设 2026/9/19 1:50:43

VoxCPM:面向阅读场景的无音素语音生成协议栈

1. VoxCPM不是又一个TTS模型,它是语音生成范式的拆解与重建VoxCPM这个词最近在语音合成圈子里突然冒出来,没官网、没论文链接、没GitHub仓库,连Hugging Face上都搜不到官方模型卡——但它已经出现在不少技术讨论帖里,被和Coqui TT…

作者头像 李华