Umi-OCR 图片转文字排版实战:OCR 排版乱码的成因与修正手册
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
用 Umi-OCR 做图片转文字时,最常见的抱怨不是"字认错了",而是"字认对了但排乱了":双栏论文左右串栏、代码截图缩进丢失、水印文字混进正文。本文从 Umi-OCR 排版错乱的几个典型成因入手,按图片类型给出对应的配置方案,并覆盖批量处理、命令行调用和质量自查,帮你定位并修正 OCR 排版问题。
排版乱码从哪来:先定位,再动手
Umi-OCR 的 OCR 引擎负责"认出字",而文本后处理(排版解析)负责"把认出的字块按阅读顺序重新排列"。引擎输出的是带坐标的文本块,如果后处理方案和图片的真实版式不匹配,就会出现三类典型乱码:
- 串栏:双栏文档的左右栏交替出现,段落被打散——通常是用了"单栏"方案去处理多栏版面;
- 缩进丢失:代码截图的层级结构被抹平——通常是用了普通文档方案,没有保留行首空格;
- 杂质混入:水印、页眉页脚、LOGO 文字出现在正文里——不是排版问题,是识别范围问题。
动手调参数前,先用这三类现象给自己手里的图片对号入座,能省掉大部分试错时间。
按图片类型选换行方案
Umi-OCR 在截图OCR 和批量OCR 页的右侧设置区都提供"文本后处理"下拉框,预设方案分多栏和单栏两组,各带"按自然段换行 / 总是换行 / 无换行"三档。选择逻辑如下:
- 多栏论文、双栏文档:选
多栏-按自然段换行。它会自动识别栏位结构,按自然段规则在正确的位置断行,是双栏 OCR 识别场景的默认选择。 - 普通单栏文档:选
单栏-按自然段换行或单栏-总是换行。前者保留段落结构,后者每句独立成行,适合条目式内容。 - 代码截图:必须选
单栏-保留缩进,它会保留行首缩进和行内空格,函数嵌套、注释对齐才不会乱。 - 纯提取、不要求版式:选
不做处理,直接拿引擎原始输出,每段语句独立成行。
以上方案均自动适配横排与竖排(从右到左)文字;竖排识别能否成功,还要看所用 OCR 引擎本身是否支持。
用忽略区域圈掉水印、页眉和页脚
忽略区域是批量OCR 页的专属功能,用于在识别前把干扰文字从画面里"裁掉"。操作步骤:
- 进入批量OCR 页右栏设置,打开忽略区域编辑器。
- 按住鼠标右键,在预览图上拖出矩形框,每个框代表一块不识别的区域。
- 水印位置不固定时,多画几个框,尽量把框画大,完全包住所有可能出现的位置。
有一个容易踩的坑:被忽略的是整个文本块,而不是单个字符。如果某个框里同时盖住了水印和正文,正文会跟着一起被丢掉。画框前可以先缩小预览,确认框内只有干扰内容。文档识别页(PDF 扫描件)同样支持忽略区域,适合排除重复出现的页眉页脚。
批量图片与命令行场景
批量页适合几百张量级的图片转文字任务:拖入图片(支持 jpg、png、webp、tiff 等格式),选好上面的后处理方案,结果可保存为 txt、md、csv、jsonl。识别超大长图时,先调高"设置 → 文字识别 → 限制图像边长"的数值,否则大图会被自动缩放影响精度。
习惯脚本化的场景可以直接走命令行。入口是主程序本身,常用参数:
umi-ocr --path "D:/img1.png" "D:/image/test" --output "D:/out.txt" umi-ocr --screenshot --clip umi-ocr --reload--path可传文件夹,会递归识别其中所有图片;--clip把结果送进剪贴板;--reload用于手动改完配置文件后让软件重新加载设置。注意:截图、粘贴、路径这三类指令用的是截图OCR 页的设定,命令行任务不想弹主窗口时,需在该页设置里关闭"弹出主窗口"选项。参数细节以官方手册为准:docs/README_CLI.md。
改完参数,用这份清单自查
一轮配置完成后,抽查两三个样本,对照下面几点:
- 段落边界:自然段是否被错误拆行或合并,标题有没有被并进正文;
- 阅读顺序:双栏文档是否按"左栏读完再右栏"的顺序输出;
- 缩进与空格:代码截图的层级、注释对齐是否保留;
- 杂质过滤:水印、页眉页脚是否已全部消失,且没有误伤正文;
- 空行节奏:段落之间是否留有可分辨的间隔,方便后续编辑。
自查发现"顺序对但换行怪",优先怀疑换行档位选错;发现"顺序本身就错",说明栏位识别失败,换一组多栏/单栏方案再试。
延伸阅读
- README 使用文档:截图OCR、批量OCR、文档识别各标签页的完整说明
- 命令行手册:全部指令、输出方式与高级函数调用
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考