Umi-OCR:免费离线文字识别,扫描件一键变可搜索文档
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
Umi-OCR 是一款免费开源的离线 OCR(文字识别)软件,适合不想把文件传上云的办公人员、学生和档案整理者。所有识别都在本机完成,不联网、不上传,解压完就能用。
3 分钟上手 🚀
- 从项目的下载入口拿到对应系统的发行包,
.7z压缩包或.7z.exe自解压包两种形态,后者连压缩工具都不用装。 - 把包释放到任意目录即可,全程没有安装向导。
- Windows 双击
Umi-OCR.exe、Linux 运行umi-ocr.sh,首次打开时界面语言会自动跟随系统。
软件自带简中、繁中、英、日、俄等多套界面语言,还有亮/暗两套主题,都在「全局设置」里切换,不用折腾配置文件。
它能解决什么问题 🎯
- 当你右键选不中屏幕上的文字(某些阅读器、受保护界面)时,它可以快捷键框选该区域,转成可编辑文本。
- 当你有一整文件夹的发票、合同图片要变文字时,它可以整批识别,导出 txt、md、csv。
- 当你的 PDF 是扫描版、搜不到字也选不中时,它可以把它转成双层可搜索 PDF。
- 当你手头码类图片多、或想生成二维码时,它可以一次读出 19 种协议的码,也支持反向生成码图。
场景实操 🔧
屏幕上的字,右键选不中
- 打开「截图OCR」标签页,按快捷键框住屏幕上的文字区域。
- 识别完成后,文字进入右侧记录栏,划选复制,也可以直接改个别错字。
- 如果剪贴板里已经有图片(别处复制来的),直接粘贴进来识别即可,不必重新截图。
无论截图还是粘贴来的图,结果都能编辑、能整段带走。 避坑:识别总差几个字时,先检查图片清晰度和识别语言设置,再换一套内置引擎重跑一遍。
一堆图片文件,想一次性转成文字
- 打开「批量OCR」页,把图片文件夹整个拖进去。
- 任务运行期间,列表会记录每张图的耗时与完成状态。
- 结束后勾选导出格式:txt、jsonl、md、csv 都行,csv 能直接导进表格软件。
jpg、png、webp、bmp、tif 等常见格式都收,单批几百张没有数量上限,排队跑就行。 避坑:每张图的固定位置都带水印或 LOGO 时,先用「忽略区域」画几个矩形盖住那几处,结果里就不会再出现这些文字。
扫描版PDF,怎么搜都搜不到
- 打开「文档识别」标签页,把 PDF 拖进去,XPS、EPUB、MOBI 等格式也收。
- 若每页都有固定的页眉页脚,先用忽略区域把那几个位置框掉。
- 任务完成后导出结果文件。
拿到的双层可搜索 PDF 里,Ctrl+F 能定位术语所在页,段落能整块划走复制,原始扫描图原样保留。 避坑:个别 PDF 报无法处理时,把它逐页转成图片再走批量OCR页,通常能绕过去。
原理浅析 🔍
双层 PDF 的关键是"叠加":原始扫描图仍作为图像层,版式不动;引擎把识别出的字符逐条对齐、以透明文字的形式压在图上方。页面看起来还是扫描件,但搜索和划选实际命中的是那一层字符。识别本身由内置的两套离线引擎 PaddleOCR 与 RapidOCR 完成,语言模型全部本地加载,过程不依赖网络。输出前还有一步排版解析,把多栏排版、代码块这类乱序的文本块重排成正常阅读顺序。
进阶用法 ⚙️
不想开界面的话,命令行入口就是主程序本体。把某个文件夹里所有图片的文字收进一个文件,只需一行:
umi-ocr --path "D:/images" --output "D:/result.txt"从别的程序调用则走内置 HTTP 接口:图片识别、文档识别、二维码读写都能请求,通信只走本机环回,不经外部网卡。注意它对并发不友好,脚本里建议串行请求。参数细节见命令行手册与HTTP接口手册。
什么时候别用它 ⚠️
- 识别精度取决于图片质量,艺术字、潦草手写这类输入有天花板,调参有限。
- 超长图、大文件吃内存,机器内存偏小时,减少单批图片数量或调低「限制图像边长」数值。
- HTTP 接口并发能力有限,脚本逐条调用,别同时发一堆请求。
- 目前只覆盖 Windows x64 与 Linux x64,没有 macOS 版本,Mac 用户暂时用不了。
Umi-OCR 把截图取字、批量识别、扫描件转换、二维码读写四件事,装进了一个免费离线的小工具里,更多细节见README。使用中遇到问题,去项目社区提 Issue 是最快的解决路径。
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考