news 2026/9/17 20:26:25

Umi-OCR:免费离线文字识别,扫描件一键变可搜索文档

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Umi-OCR:免费离线文字识别,扫描件一键变可搜索文档

Umi-OCR:免费离线文字识别,扫描件一键变可搜索文档

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

Umi-OCR 是一款免费开源的离线 OCR(文字识别)软件,适合不想把文件传上云的办公人员、学生和档案整理者。所有识别都在本机完成,不联网、不上传,解压完就能用。

3 分钟上手 🚀

  1. 从项目的下载入口拿到对应系统的发行包,.7z压缩包或.7z.exe自解压包两种形态,后者连压缩工具都不用装。
  2. 把包释放到任意目录即可,全程没有安装向导。
  3. Windows 双击Umi-OCR.exe、Linux 运行umi-ocr.sh,首次打开时界面语言会自动跟随系统。

软件自带简中、繁中、英、日、俄等多套界面语言,还有亮/暗两套主题,都在「全局设置」里切换,不用折腾配置文件。

它能解决什么问题 🎯

  • 当你右键选不中屏幕上的文字(某些阅读器、受保护界面)时,它可以快捷键框选该区域,转成可编辑文本。
  • 当你有一整文件夹的发票、合同图片要变文字时,它可以整批识别,导出 txt、md、csv。
  • 当你的 PDF 是扫描版、搜不到字也选不中时,它可以把它转成双层可搜索 PDF。
  • 当你手头码类图片多、或想生成二维码时,它可以一次读出 19 种协议的码,也支持反向生成码图。

场景实操 🔧

屏幕上的字,右键选不中

  1. 打开「截图OCR」标签页,按快捷键框住屏幕上的文字区域。
  2. 识别完成后,文字进入右侧记录栏,划选复制,也可以直接改个别错字。
  3. 如果剪贴板里已经有图片(别处复制来的),直接粘贴进来识别即可,不必重新截图。

无论截图还是粘贴来的图,结果都能编辑、能整段带走。 避坑:识别总差几个字时,先检查图片清晰度和识别语言设置,再换一套内置引擎重跑一遍。

一堆图片文件,想一次性转成文字

  1. 打开「批量OCR」页,把图片文件夹整个拖进去。
  2. 任务运行期间,列表会记录每张图的耗时与完成状态。
  3. 结束后勾选导出格式:txt、jsonl、md、csv 都行,csv 能直接导进表格软件。

jpg、png、webp、bmp、tif 等常见格式都收,单批几百张没有数量上限,排队跑就行。 避坑:每张图的固定位置都带水印或 LOGO 时,先用「忽略区域」画几个矩形盖住那几处,结果里就不会再出现这些文字。

扫描版PDF,怎么搜都搜不到

  1. 打开「文档识别」标签页,把 PDF 拖进去,XPS、EPUB、MOBI 等格式也收。
  2. 若每页都有固定的页眉页脚,先用忽略区域把那几个位置框掉。
  3. 任务完成后导出结果文件。

拿到的双层可搜索 PDF 里,Ctrl+F 能定位术语所在页,段落能整块划走复制,原始扫描图原样保留。 避坑:个别 PDF 报无法处理时,把它逐页转成图片再走批量OCR页,通常能绕过去。

原理浅析 🔍

双层 PDF 的关键是"叠加":原始扫描图仍作为图像层,版式不动;引擎把识别出的字符逐条对齐、以透明文字的形式压在图上方。页面看起来还是扫描件,但搜索和划选实际命中的是那一层字符。识别本身由内置的两套离线引擎 PaddleOCR 与 RapidOCR 完成,语言模型全部本地加载,过程不依赖网络。输出前还有一步排版解析,把多栏排版、代码块这类乱序的文本块重排成正常阅读顺序。

进阶用法 ⚙️

不想开界面的话,命令行入口就是主程序本体。把某个文件夹里所有图片的文字收进一个文件,只需一行:

umi-ocr --path "D:/images" --output "D:/result.txt"

从别的程序调用则走内置 HTTP 接口:图片识别、文档识别、二维码读写都能请求,通信只走本机环回,不经外部网卡。注意它对并发不友好,脚本里建议串行请求。参数细节见命令行手册与HTTP接口手册。

什么时候别用它 ⚠️

  • 识别精度取决于图片质量,艺术字、潦草手写这类输入有天花板,调参有限。
  • 超长图、大文件吃内存,机器内存偏小时,减少单批图片数量或调低「限制图像边长」数值。
  • HTTP 接口并发能力有限,脚本逐条调用,别同时发一堆请求。
  • 目前只覆盖 Windows x64 与 Linux x64,没有 macOS 版本,Mac 用户暂时用不了。

Umi-OCR 把截图取字、批量识别、扫描件转换、二维码读写四件事,装进了一个免费离线的小工具里,更多细节见README。使用中遇到问题,去项目社区提 Issue 是最快的解决路径。

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/17 20:24:41

Lex与Yacc实战:从词法分析到语法分析,打造你的第一个计算器

如果你正在上编译原理这门课,那“Lex与Yacc”这六个字你大概率躲不开。翻开实验指导书,要么让你用Lex写一个词法分析器,要么让你用Yacc搭一个语法分析器,再狠一点的直接让这两个工具配合着做一个可用的计算器或小型语言前端。不少…

作者头像 李华
网站建设 2026/9/17 20:24:35

Whisper与wav2vec 2.0:Maths, CS AI Compendium自监督ASR架构解析

Whisper与wav2vec 2.0:Maths, CS & AI Compendium自监督ASR架构解析 【免费下载链接】maths-cs-ai-compendium Become a cracked AI/ML researcher/engineer with this unconventional textbook covering maths, computing, and ML with intuition. 项目地址:…

作者头像 李华
网站建设 2026/9/17 20:23:01

Java线程(七):锁策略,锁优化策略,CAS解析

前言 hello hello💕,这里是洋不写bug~😄,欢迎大家点赞👍👍,关注😍😍,收藏🌹🌹 这篇博客会深度解析锁内部实现的规则,这些内…

作者头像 李华
网站建设 2026/9/17 20:22:31

RDMA为什么快?协议选型、队列模型与编程实践全解析

简介:这是一份面向网络工程师、高性能计算与分布式存储开发者的RDMA技术调研PDF文档。文档从传统网络协议栈的痛点切入,系统梳理了RDMA零拷贝、内核旁路、CPU卸载三大核心优势,并对比Infiniband、RoCE、iWARP三种协议的演进脉络与适用场景&am…

作者头像 李华
网站建设 2026/9/17 20:19:26

Rivet RunnersApi 完全指南:使用 Rust SDK 列出与管理 Runner 状态

Rivet RunnersApi 完全指南:使用 Rust SDK 列出与管理 Runner 状态 【免费下载链接】actors Rivet Actors are the primitive for stateful workloads. Built for AI agents, collaborative apps, and durable execution. 项目地址: https://gitcode.com/GitHub_T…

作者头像 李华
网站建设 2026/9/17 20:17:24

管理后台功能需求文档模板v1.1:docx结构化编写与权限管理实践

简介:这是针对个人消费贷款申请管理后台的功能需求文档模板,面向产品经理、运营人员和开发技术人员,用于统一各方对后台功能与审批流程的认知,减少开发与沟通返工。模板以贷款申请到放款为主线,定义了贷款用户、业务员…

作者头像 李华