Umi-OCR 完整指南:如何在 Linux 上配置离线文字识别
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
刚截了一张带字的图,想直接把它变成可编辑的文本?或者手头有一整个文件夹的扫描图片,想一次性全部转出文字?Umi-OCR 就是为这类需求准备的开源、免费的 Linux 离线文字识别工具:解压即用、不依赖网络,截图识别、批量 OCR、PDF 文档识别、二维码扫描与生成全部在本地完成。适合对数据隐私有要求,或者单纯不想把图片传到云端的你。
一、完成环境准备:从压缩包到桌面快捷方式
这一节做完,以后点一下图标就能启动,不用再打开终端敲命令。
- 下载发行版压缩包(
.7z格式),解压到一个不含中文路径的目录,建议/opt/Umi-OCR。软件是绿色便携的,解压即完成部署,无需安装。 - 给启动脚本加执行权限,并在终端首次运行,确认界面正常弹出:
chmod +x /opt/Umi-OCR/umi-ocr.sh /opt/Umi-OCR/umi-ocr.sh- Linux 版要求 glibc 2.31 及以上,Debian 11、Ubuntu 20.04 之后的主流发行版都能直接跑。
- 首次启动会按系统语言自动选择界面语言;如果界面没弹出来,直接在终端运行脚本就能看到报错,v2.1.5 以上版本还会把日志写到
UmiOCR-data/logs目录,方便排查。
软件主界面是标签页布局,截图 OCR、批量 OCR、文档识别、二维码等功能按需开页,互不干扰:
创建桌面快捷方式
新建文件~/.local/share/applications/umi-ocr.desktop,写入以下内容,再执行update-desktop-database ~/.local/share/applications刷新,Umi-OCR 就会出现在应用菜单里:
[Desktop Entry] Type=Application Name=Umi-OCR Comment=开源离线OCR文字识别工具 Exec=/opt/Umi-OCR/umi-ocr.sh Terminal=false Categories=Utility;Office;Graphics;想固定到桌面的话,把同样的文件存到桌面目录即可。另外全局设置标签页的“快捷方式”区域也能管理桌面、开始菜单、开机自启这几项开关。
二、截图识别实战:一张图快速拿到文字
这是使用频率最高的功能:打开“截图OCR”标签页,用快捷键唤起截图、划选区域,右侧就能得到识别结果。
- 打开截图OCR标签页,点左侧工具栏的截图按钮开始划选,按
Esc可随时取消。 - 识别完成后,在左侧图片预览区直接鼠标划选文字块复制;右侧“记录”栏保留历史结果,可以编辑、跨记录多选复制。
- 在浏览器、即时聊天工具里复制的图片,也可以直接粘贴进软件识别,效果等同于命令行的
--clipboard指令。
为代码和表格选择排版解析方案
原始 OCR 输出常常语序混乱。“文本后处理”里的排版解析方案就是干这个的,按内容类型选一个即可:
多栏-按自然段换行:适合大多数文章,自动识别多栏布局、按自然段换行。单栏-保留缩进:适合代码截图,保留行首缩进和行内空格,代码结构原样保留。不做处理:输出引擎原始结果,留给需要自行微调的场景。
比如一张 Python 代码块的截图,选“单栏-保留缩进”后,识别结果会保持缩进和换行,粘贴进编辑器就能直接用;横排、竖排(从右到左)的排版顺序也都由方案自动整理。
三、批量 OCR:把整批图片导出为 txt 和 Markdown
几十上百张图片要处理时,切到“批量OCR”标签页:
- 点击“选择图片”或直接拖入文件夹,支持
jpg、jpeg、png、webp、bmp、tiff等格式,图片数量没有上限。 - 在右侧设置里选择保存目录和文件类型,可选
txt、jsonl、md(Markdown)、csv(Excel 可直接打开)。 - 点击“开始任务”,进度条、每张图耗时和置信度都会实时显示,完成后每张图对应一份识别结果文件。
两个实用细节:
- 识别超大图或长图之前,先到“页面设置 → 文字识别 → 限制图像边长”调高数值,否则大图会被压缩处理,影响识别效果。
- 图片上有固定水印或页眉页脚时,进入“忽略区域”编辑器,按住右键拖出多个矩形框,完全位于框内的文本块会被跳过,水印就不会污染结果。任务跑完还能设置自动关机/待机,适合挂机批量。
四、个性化与效率增强:语言切换、别名和自动化
切换界面语言
软件内置多国语言库(简中、繁中、英语、日语、俄语、葡萄牙语等)。首次启动跟随系统语言,之后随时在“全局设置 → 语言/Language”里手动切换,重启软件生效:
给终端设置识别别名
经常待在终端的话,往~/.bashrc或~/.zshrc里加两行别名,一行命令就能发起识别:
alias ocr="/opt/Umi-OCR/umi-ocr.sh" alias ocr-clip="/opt/Umi-OCR/umi-ocr.sh --screenshot --clip"source生效后,ocr-clip就是“截图并直接把结果放进剪贴板”。指令集远不止这些,范围截屏、二维码识别/生成都有对应参数,完整清单见 命令行手册;如果想从脚本或本地服务里发起识别,HTTP 接口手册 里也给出了 Base64 调用的方式。
一行命令跑完整个文件夹
批量自动化其实不需要自己写循环:--path参数直接传文件夹路径,软件会自动搜索其中所有图片(含子文件夹)并输出识别结果:
/opt/Umi-OCR/umi-ocr.sh --path "/path/to/images" --output "/path/to/result.txt"如果要求每张图单独存一个文件,用批量OCR标签页勾选 txt/Markdown 格式导出更省事。
五、性能调优与常见故障排查
性能建议
- 大批量识别大图最耗资源,建议分批导入,或调高“限制图像边长”控制单张处理量。
- 界面默认走显卡加速渲染,若出现截屏闪烁、UI 错位,到“界面和外观 → 渲染器”切换渲染方案或关闭硬件加速。
- 软件内置 RapidOCR、PaddleOCR 两类离线引擎插件,速度和准确率各有取舍,可在全局设置里按文档类型切换。
- 只保留当前要用的标签页,每个页面都持有独立的工作状态。
常见故障
- 点图标没反应:确认
umi-ocr.sh有执行权限,在终端手动运行一次看报错;v2.1.5 起可查UmiOCR-data/logs里的日志定位问题。 - 识别准确率不理想:换一版 OCR 引擎试试;代码、表格、多栏文档记得选对应排版解析方案;固定水印用忽略区域排除。
- 批量任务太慢:减少单批图片数量,检查“限制图像边长”是否设得过高,保证内存充足。
备份与迁移配置
你的所有设置(主题、语言、快捷键、识别参数等)都保存在安装目录下的UmiOCR-data/.settings文件里,是 ini 格式。升级或换机器前,把整个Umi-OCR目录(含UmiOCR-data子目录)拷走即可;手动改过配置文件后,还可以用--reload指令热加载,不必重启软件。
Umi-OCR 把截图、图片批量、文档扫描这三类识别场景收进一个界面,全部离线完成,配置也能整目录带走。对办公、学习、档案数字化场景,以及想搭本地自动化识别流水线的用户来说,它是目前 Linux 上很少见的全能型离线 OCR 选择——按上面的步骤配好一次,之后每次识别都只需要一个快捷键。
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考