Umi-OCR 插件选型与安装完整指南:7 个 OCR 引擎一次配好
【免费下载链接】Umi-OCR_pluginsUmi-OCR 插件库项目地址: https://gitcode.com/gh_mirrors/um/Umi-OCR_plugins
Umi-OCR 插件库是配套 Umi-OCR 识别软件的一组 OCR 引擎扩展,把插件文件夹放进指定目录即可在 7 个离线与云端识别引擎间切换。本文先按你的机器配置和使用场景帮你选定插件,再给出 Windows 与 Linux 的最短安装路径、参数配置和常见故障排查,读完即可跑通第一次识别。
先选后装:按场景挑一个 OCR 引擎
装之前先把引擎定下来,能少走很多回头路。7 个插件的定位各不相同,下面按"你遇到什么情况"来对号入座。
🧭场景速配
- 高配机器、要最好的离线识别效果 → PaddleOCR-json。支持 mkldnn 数学库加速,能吃满 CPU 性能,是目前唯一同时支持 Windows 7 x64 与 Linux x64 的插件。
- 老机器、内存紧张 → RapidOCR-json。相当于 PaddleOCR 的轻量版,CPU 兼容性好、内存占用低,代价是速度稍慢。
- 要识别数学公式、论文排版 → Pix2Text。支持中英文、数学公式与混合排版,插件体积大、加载较慢,但识别速度快。
- 多国语言、复杂文档排版 → TesseractOCR_umi_plugin。老牌开源模型,可导入多个小语种库,自带排版识别模型;启用它时把 Umi 标签页里的"排版解析方案"设为"不做处理"。
- 只认中文 → chineseocr_umi_plugin。ChineseOCR 的轻量模型,专注中英文,仍在接入适配中。
- 想调用微信 OCR 能力 → WechatOCR_umi_plugin。离线调用微信 OCR,支持中英日文。
- 依赖云端、要一次覆盖多语言 → Mistral AI OCR 插件。基于 Mistral AI OCR API,计算在云端,跨平台。
一张决策表:7 个插件横向对比
| 插件 | 计算方式 / 平台 | 语言支持 | 识别速度 | 内存占用 | 识别准确率 | 适用场景 |
|---|---|---|---|---|---|---|
| PaddleOCR-json | 本地 CPU / Win7 x64、Linux x64 | 简、繁、英、日、韩、俄 | 高 | 中 | 高 | 高配机器、离线高质量识别 |
| RapidOCR-json | 本地 CPU / Win7 以上 64 位 | 简、繁、英、日、韩、俄 | 中 | 低 | 中 | 老机器、内存有限 |
| Pix2Text | 本地 CPU / Win7 以上 64 位 | 中英文、数学公式 | 高 | 中 | 高 | 学术论文、公式文档 |
| TesseractOCR | 本地 CPU / Win7 以上 64 位 | 简、繁、英、日、公式,可扩展小语种 | 高 | 中 | 中(英文优、中文稍弱) | 多语言、复杂排版 |
| ChineseOCR | 本地 CPU / Win7 以上 64 位 | 中英文 | 中 | 低 | 中 | 纯中文文档 |
| WechatOCR | 本地 CPU / Win7 以上 64 位 | 中英日 | 中 | 低 | 中 | 需要微信 OCR 能力 |
| Mistral AI OCR | 云端 API / 跨平台 | 多语言 | 高 | 低(本地开销小) | 高 | 云端 AI 识别 |
Umi-OCR 插件安装:Windows 与 Linux 最短路径
注意:请从插件仓库的发布页(Releases)下载预编译的插件包,不要直接下载仓库源代码来用。
Windows:把插件放进 plugins 目录
- 到发布页下载对应插件的预编译压缩包,例如
win7_x64_PaddleOCR-json_xxx.7z。 - 解压,得到一个独立的插件文件夹。
- 把这个文件夹整体放进
UmiOCR-data/plugins目录。 - 启动 Umi-OCR,插件会自动被加载,无需重启以外的操作。
Linux:下载加解压两步
# 进入插件目录(没有就先建一个) cd UmiOCR-data/plugins # 下载你选定的 Linux 插件包(以 PaddleOCR 为例) wget [插件下载链接] # 解压 tar -v -xf [插件压缩包名称].tar.xz解压完成后启动 Umi-OCR 即可测试。插件名需与目录一致,且文件夹名不要与 Python 已有模块重名,也不要包含空格或特殊字符。
Umi-OCR 插件配置:全局与标签页级分工
每个插件都有两类配置项,分清归属就能少踩坑。
- 全局配置:所有标签页共用、不该随场景变化的项。比如在线 API 的密钥、超时时间,本地引擎的线程数、是否启用硬件加速。
- 局部配置:每个标签页可独立设置的项。比如识别语言、识别模式。
一句话理解:全局管"引擎怎么跑",局部管"这一次认什么"。
按 CPU 核心数设置线程
线程数不必拍脑袋。PaddleOCR 插件会先按物理核与逻辑核自动估算一个合理值(上限 16 线程),你再按需覆盖即可:
- 没有超线程的机器,一般取逻辑核心数。
- 有大小核的机器,优先落在大核上,避免任务被调度到小核拖慢速度。
- 老机器手动压到 1~2 线程,反而更稳。
三类典型用户的参数组合
| 用户类型 | 首选插件 | 线程数 | 其他建议 |
|---|---|---|---|
| 高配机器 | PaddleOCR-json | 物理核数的一半到大核线程数 | 开启硬件加速;按需加载多语言库 |
| 低配 / 老机器 | RapidOCR-json | 1~2 | 内存上限设低一些;只留需要的语言 |
| 公式 / 学术用户 | Pix2Text | 按 CPU 核数 | 关闭用不到的排版解析;中英文混排 |
排障:四类常见问题的现象、原因与处理
🔧 下面按"现象 → 原因 → 处理"来写,方便你对照定位。
插件未加载
- 现象:启动后全局设置里看不到该插件。
- 原因:文件夹没放进
UmiOCR-data/plugins;或文件夹名含空格、特殊字符;或文件夹名与 Python 已有模块重名。 - 处理:核对目录与命名,改为纯 ASCII 且唯一的名称,再重启软件;仍不行就看日志里的具体报错。
识别慢
- 现象:同一批图明显变慢,排队时间长。
- 原因:分辨率过高、线程数与核心数不匹配、开了用不到的排版或公式功能,或机器本身吃不动所选引擎。
- 处理:识别前先降分辨率;按 CPU 核心数回调线程;关掉不需要的解析项;老机器直接换 RapidOCR-json。
准确率低
- 现象:错字多、漏行、排版乱。
- 原因:图片有噪点或对比度差;语言库没覆盖目标语言;选错了引擎。
- 处理:先做预处理(提对比度、去噪);确认语言库包含目标语言;必要时换引擎对比同一张图的效果。
内存占用过高
- 现象:软件越跑越占内存,影响其他程序。
- 原因:用了重引擎、同时处理图片过多、后台程序抢占。
- 处理:换 RapidOCR-json 等轻量插件;减少并发图片数;定期清理缓存;关掉无关后台。
Umi-OCR 插件开发:从 demo 到部署
想接一个自己的 OCR 组件,可以从仓库里的最小示例demo_AbaOCR起步。
最小插件目录结构
demo_AbaOCR/ ├── __init__.py # 插件入口,声明 PluginInfo ├── aba_ocr.py # OCR 接口实现 ├── aba_ocr_config.py # 全局 / 局部配置定义 └── i18n.csv # 多语言翻译表四步开发流程
- 定义配置项:在
aba_ocr_config.py里写全局配置(globalOptions)与局部配置(localOptions),需要翻译的字符串放进i18n.csv。 - 实现 OCR 接口:在
aba_ocr.py里实现接口类,提供start、stop以及runPath、runBytes、runBase64三种输入方式,按约定返回识别结果。 - 组装插件入口:在
__init__.py里声明PluginInfo,把插件组别、全局配置、局部配置和接口类填进去。 - 放置并验证:把整个插件文件夹放进
UmiOCR-data/plugins,启动 Umi-OCR,在全局设置里切到该插件即可。
需要完整源码可参考仓库:
git clone https://gitcode.com/gh_mirrors/um/Umi-OCR_plugins官方资源
- 插件源码与全部 7 个引擎:
plugins/目录。 - 插件开发文档与最小示例:
demo_AbaOCR/目录,含aba_ocr.py、aba_ocr_config.py、i18n.csv。 - PaddleOCR 双平台部署细节:
win_linux_PaddleOCR-json/README.md。 - 引擎切换入口:Umi-OCR 全局设置最底部。
📌 7 个插件可以并存,你在全局设置里随时切换引擎,挑一个匹配硬件与场景的,识别体验就顺了。
【免费下载链接】Umi-OCR_pluginsUmi-OCR 插件库项目地址: https://gitcode.com/gh_mirrors/um/Umi-OCR_plugins
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考