news 2026/9/12 17:23:02

Umi-OCR 完整指南:如何在 Linux 上配置离线文字识别

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Umi-OCR 完整指南:如何在 Linux 上配置离线文字识别

Umi-OCR 完整指南:如何在 Linux 上配置离线文字识别

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

刚截了一张带字的图,想直接把它变成可编辑的文本?或者手头有一整个文件夹的扫描图片,想一次性全部转出文字?Umi-OCR 就是为这类需求准备的开源、免费的 Linux 离线文字识别工具:解压即用、不依赖网络,截图识别、批量 OCR、PDF 文档识别、二维码扫描与生成全部在本地完成。适合对数据隐私有要求,或者单纯不想把图片传到云端的你。

一、完成环境准备:从压缩包到桌面快捷方式

这一节做完,以后点一下图标就能启动,不用再打开终端敲命令。

  1. 下载发行版压缩包(.7z格式),解压到一个不含中文路径的目录,建议/opt/Umi-OCR。软件是绿色便携的,解压即完成部署,无需安装。
  2. 给启动脚本加执行权限,并在终端首次运行,确认界面正常弹出:
chmod +x /opt/Umi-OCR/umi-ocr.sh /opt/Umi-OCR/umi-ocr.sh
  1. Linux 版要求 glibc 2.31 及以上,Debian 11、Ubuntu 20.04 之后的主流发行版都能直接跑。
  2. 首次启动会按系统语言自动选择界面语言;如果界面没弹出来,直接在终端运行脚本就能看到报错,v2.1.5 以上版本还会把日志写到UmiOCR-data/logs目录,方便排查。

软件主界面是标签页布局,截图 OCR、批量 OCR、文档识别、二维码等功能按需开页,互不干扰:

创建桌面快捷方式

新建文件~/.local/share/applications/umi-ocr.desktop,写入以下内容,再执行update-desktop-database ~/.local/share/applications刷新,Umi-OCR 就会出现在应用菜单里:

[Desktop Entry] Type=Application Name=Umi-OCR Comment=开源离线OCR文字识别工具 Exec=/opt/Umi-OCR/umi-ocr.sh Terminal=false Categories=Utility;Office;Graphics;

想固定到桌面的话,把同样的文件存到桌面目录即可。另外全局设置标签页的“快捷方式”区域也能管理桌面、开始菜单、开机自启这几项开关。

二、截图识别实战:一张图快速拿到文字

这是使用频率最高的功能:打开“截图OCR”标签页,用快捷键唤起截图、划选区域,右侧就能得到识别结果。

  1. 打开截图OCR标签页,点左侧工具栏的截图按钮开始划选,按Esc可随时取消。
  2. 识别完成后,在左侧图片预览区直接鼠标划选文字块复制;右侧“记录”栏保留历史结果,可以编辑、跨记录多选复制。
  3. 在浏览器、即时聊天工具里复制的图片,也可以直接粘贴进软件识别,效果等同于命令行的--clipboard指令。

为代码和表格选择排版解析方案

原始 OCR 输出常常语序混乱。“文本后处理”里的排版解析方案就是干这个的,按内容类型选一个即可:

  • 多栏-按自然段换行:适合大多数文章,自动识别多栏布局、按自然段换行。
  • 单栏-保留缩进:适合代码截图,保留行首缩进和行内空格,代码结构原样保留。
  • 不做处理:输出引擎原始结果,留给需要自行微调的场景。

比如一张 Python 代码块的截图,选“单栏-保留缩进”后,识别结果会保持缩进和换行,粘贴进编辑器就能直接用;横排、竖排(从右到左)的排版顺序也都由方案自动整理。

三、批量 OCR:把整批图片导出为 txt 和 Markdown

几十上百张图片要处理时,切到“批量OCR”标签页:

  1. 点击“选择图片”或直接拖入文件夹,支持jpg、jpeg、png、webp、bmp、tiff等格式,图片数量没有上限。
  2. 在右侧设置里选择保存目录和文件类型,可选txtjsonlmd(Markdown)、csv(Excel 可直接打开)。
  3. 点击“开始任务”,进度条、每张图耗时和置信度都会实时显示,完成后每张图对应一份识别结果文件。

两个实用细节:

  • 识别超大图或长图之前,先到“页面设置 → 文字识别 → 限制图像边长”调高数值,否则大图会被压缩处理,影响识别效果。
  • 图片上有固定水印或页眉页脚时,进入“忽略区域”编辑器,按住右键拖出多个矩形框,完全位于框内的文本块会被跳过,水印就不会污染结果。任务跑完还能设置自动关机/待机,适合挂机批量。

四、个性化与效率增强:语言切换、别名和自动化

切换界面语言

软件内置多国语言库(简中、繁中、英语、日语、俄语、葡萄牙语等)。首次启动跟随系统语言,之后随时在“全局设置 → 语言/Language”里手动切换,重启软件生效:

给终端设置识别别名

经常待在终端的话,往~/.bashrc~/.zshrc里加两行别名,一行命令就能发起识别:

alias ocr="/opt/Umi-OCR/umi-ocr.sh" alias ocr-clip="/opt/Umi-OCR/umi-ocr.sh --screenshot --clip"

source生效后,ocr-clip就是“截图并直接把结果放进剪贴板”。指令集远不止这些,范围截屏、二维码识别/生成都有对应参数,完整清单见 命令行手册;如果想从脚本或本地服务里发起识别,HTTP 接口手册 里也给出了 Base64 调用的方式。

一行命令跑完整个文件夹

批量自动化其实不需要自己写循环:--path参数直接传文件夹路径,软件会自动搜索其中所有图片(含子文件夹)并输出识别结果:

/opt/Umi-OCR/umi-ocr.sh --path "/path/to/images" --output "/path/to/result.txt"

如果要求每张图单独存一个文件,用批量OCR标签页勾选 txt/Markdown 格式导出更省事。

五、性能调优与常见故障排查

性能建议

  • 大批量识别大图最耗资源,建议分批导入,或调高“限制图像边长”控制单张处理量。
  • 界面默认走显卡加速渲染,若出现截屏闪烁、UI 错位,到“界面和外观 → 渲染器”切换渲染方案或关闭硬件加速。
  • 软件内置 RapidOCR、PaddleOCR 两类离线引擎插件,速度和准确率各有取舍,可在全局设置里按文档类型切换。
  • 只保留当前要用的标签页,每个页面都持有独立的工作状态。

常见故障

  • 点图标没反应:确认umi-ocr.sh有执行权限,在终端手动运行一次看报错;v2.1.5 起可查UmiOCR-data/logs里的日志定位问题。
  • 识别准确率不理想:换一版 OCR 引擎试试;代码、表格、多栏文档记得选对应排版解析方案;固定水印用忽略区域排除。
  • 批量任务太慢:减少单批图片数量,检查“限制图像边长”是否设得过高,保证内存充足。

备份与迁移配置

你的所有设置(主题、语言、快捷键、识别参数等)都保存在安装目录下的UmiOCR-data/.settings文件里,是 ini 格式。升级或换机器前,把整个Umi-OCR目录(含UmiOCR-data子目录)拷走即可;手动改过配置文件后,还可以用--reload指令热加载,不必重启软件。

Umi-OCR 把截图、图片批量、文档扫描这三类识别场景收进一个界面,全部离线完成,配置也能整目录带走。对办公、学习、档案数字化场景,以及想搭本地自动化识别流水线的用户来说,它是目前 Linux 上很少见的全能型离线 OCR 选择——按上面的步骤配好一次,之后每次识别都只需要一个快捷键。

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/12 17:22:03

电影入库后别手贴海报了:Radarr 海报墙自动化攻略

电影入库后别手贴海报了:Radarr 海报墙自动化攻略 【免费下载链接】Radarr Movie organizer/manager for usenet and torrent users. 项目地址: https://gitcode.com/GitHub_Trending/ra/Radarr 一部片子下完、改名、入库,海报却还是个灰色占位图…

作者头像 李华
网站建设 2026/9/12 17:21:59

TDengine 基于 MQTT 的数据订阅:Bnode 管理与 taosmqtt 消费实践

TDengine 基于 MQTT 的数据订阅:Bnode 管理与 taosmqtt 消费实践 【免费下载链接】TDengine High-performance, scalable time-series database designed for Industrial IoT (IIoT) scenarios 项目地址: https://gitcode.com/GitHub_Trending/tde/TDengine …

作者头像 李华
网站建设 2026/9/12 17:18:58

渗透测试自学第十天:从HTTP协议到Burp Suite抓包改包实战

第十天,我没急着去学那些听起来很帅的东西,而是老老实实把HTTP协议的知识重新过了一遍,再把Burp Suite从安装到真正拦下第一个包,完整走通了一遍。这大概是自学渗透测试以来最踏实的一天——因为从这天开始,手头的工具…

作者头像 李华
网站建设 2026/9/12 17:18:55

模型蒸馏与数据版权争议:大模型 API 调用的合规边界与风险规避

1. 事件全景:一场关于“数据版权”的正面硬刚这两天 AI 圈炸了锅,Anthropic 直接在官网和社交媒体上公开点名了三大国产大模型,声称它们涉嫌“蒸馏”自家 Claude 系列模型的能力,而且证据相当具体。与此同时,马斯克也没…

作者头像 李华
网站建设 2026/9/12 17:18:33

多无人机协同路径规划的改进PSO算法与MATLAB实现

1. 项目背景与核心挑战多无人机协同作业已成为物流配送、农业植保、灾害救援等领域的重要技术手段。在复杂三维环境中实现多机动态避障路径规划,需要解决三个核心问题:实时环境感知与障碍物动态更新多目标优化(路径长度、能耗、安全性等&…

作者头像 李华