news 2026/9/20 15:06:08

RapidOCR 入门指南:多语言 OCR 一条命令跑起来

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
RapidOCR 入门指南:多语言 OCR 一条命令跑起来

RapidOCR 入门指南:多语言 OCR 一条命令跑起来

【免费下载链接】RapidOCR📄 Awesome OCR multiple programing languages toolkits based on ONNX Runtime, OpenVINO, MNN, PaddlePaddle, TensorRT and PyTorch.项目地址: https://gitcode.com/GitHub_Trending/ra/RapidOCR

拿到一张带文字的图片,想快速把文字提取出来?RapidOCR 是一个免费开源的多语言文本识别工具,底层把 PaddleOCR 模型转成 ONNX 通用格式,支持 OnnxRuntime、OpenVINO、PaddlePaddle、TensorRT 等多种推理引擎,Windows、Linux、macOS 都能离线运行。这篇指南带你从安装到跑通,再到看懂代码结构。

先认清它:输入图片,输出文字

RapidOCR 干的事一句话能说清:给一张图片,还你文字内容、每段文字的坐标和置信度。

默认模型支持中英文,换成对应语言模型后还能识别日语、韩语、阿拉伯语等,仓库测试集里就有这些语言的样例图。它内部分三步走:检测模型找出文字区域,方向分类模型判断文字是否倒置,识别模型把字读出来。

装好之后,先跑最小示例。

📦 三步完成安装

最省事的方式是直接装 PyPI 上的包:

pip install rapidocr onnxruntime

不用配 GPU,也不用手动下模型:首次识别时模型会自动下载并缓存在本地。如果你有 NPU、Apple 芯片,或者想用 TensorRT,docker/ 目录下每种推理引擎都配了现成的 Dockerfile,直接构建即可。

下一步,写五行代码识别第一张图。

五行代码识别第一张图

from rapidocr import RapidOCR engine = RapidOCR() result = engine("your_image.jpg") print(result) result.vis("vis_result.jpg")

result是结构化对象:result.txts是识别出的文字,result.scores是置信度,result.boxes是坐标。result.vis()会把识别框画回原图并保存,方便你肉眼确认它认没认对。想直接看完整流程,python/demo.py 是官方示例,原样可运行。

跑通之后,再按需换语言、换引擎。

⚙️ 切换语言与推理引擎

两个最常用的进阶操作:

  1. 换语言:初始化时传 params 字典,覆盖配置里的lang_type字段即可切换识别模型的语言:
engine = RapidOCR(params={"Rec": {"lang_type": "en"}})
  1. 换引擎:修改 python/rapidocr/config.yaml 中 Det、Cls、Rec 三个段落下的engine_type,从 onnxruntime 换成 paddle、openvino 或 tensorrt,业务代码一行不用动。

再附两个小开关:把return_word_box设为 true 可以拿到词级别坐标;方向分类阶段会自动处理倒置文字,横竖混排也能正常读出。

接下来看看这些能力对应代码里的哪些目录。

📁 从目录结构看它如何工作

核心就是三个目录加一个配置文件:

  • python/rapidocr/ch_ppocr_det/:文本检测,负责定位图片里的文字区域
  • python/rapidocr/ch_ppocr_rec/:文本识别,负责读出文字内容
  • python/rapidocr/inference_engine/:六种推理引擎各占一个子目录,扩展或对比引擎都在这里

所有模型选择和引擎参数集中在 config.yaml 里,改行为不用翻代码。

调优建议与适用场景

调优记住三点:图片过大过小会自动缩放,文字清晰比盲目放大更有效;纯 CPU 环境保持默认 onnxruntime,有 NVIDIA 显卡建议切 tensorrt;出现漏字或误框时,优先调配置里的text_score阈值。

它适合这几类场景:纸质文档数字化,一条命令把扫描件变成可编辑文本;网页截图信息提取;给翻译工具提供文字输入;以及用 MNN 引擎部署到手机等边缘设备。

现在就执行一条pip install rapidocr onnxruntime,拿你手头任何一张带字的图片跑起来。

【免费下载链接】RapidOCR📄 Awesome OCR multiple programing languages toolkits based on ONNX Runtime, OpenVINO, MNN, PaddlePaddle, TensorRT and PyTorch.项目地址: https://gitcode.com/GitHub_Trending/ra/RapidOCR

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/20 15:04:21

GetQzonehistory使用指南:十分钟把QQ空间历史说说完整搬到本地硬盘

GetQzonehistory使用指南:十分钟把QQ空间历史说说完整搬到本地硬盘 【免费下载链接】GetQzonehistory 获取QQ空间发布的历史说说 项目地址: https://gitcode.com/GitHub_Trending/ge/GetQzonehistory 给QQ空间做一次彻底的历史说说备份,是你迟早会…

作者头像 李华
网站建设 2026/9/20 15:03:17

OpenClaw 配阿里云百炼API 报 invalid api key?TaoToken 这样改 baseUrl

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/20 15:02:57

Cap 免费开源屏幕录制工具:录制、剪辑、分享一站式完成

Cap 免费开源屏幕录制工具:录制、剪辑、分享一站式完成 【免费下载链接】Cap Open source Loom alternative. Beautiful, shareable screen recordings. 项目地址: https://gitcode.com/GitHub_Trending/cap1/Cap Cap 是一个开源的屏幕录制工具,一…

作者头像 李华
网站建设 2026/9/20 15:02:34

结构疲劳分析基础:S-N曲线、Miner理论与工程实践

简介:这份PPT来自疲劳与断裂力学课程第四章,系统梳理结构疲劳分析的基础理论,适合机械、航空、土木等专业学生及从事疲劳设计的工程技术人员学习。包体为单个PPT文件,大小仅1.3MB,内容聚焦而精炼,便于快速开…

作者头像 李华
网站建设 2026/9/20 15:01:54

一线捉妖股主图指标源码解析:通达信公式编写逻辑与过滤技巧

简介:通达信一线捉妖股主图指标源码文档,是一份面向股票技术分析爱好者与通达信软件用户的公式教程。文档以精简的源码与变量拆解方式,系统讲解主图指标的构建逻辑,涵盖VAR1至VAR21等核心变量计算、移动平均线与波动率判断、底部顶…

作者头像 李华
网站建设 2026/9/20 15:01:52

高中数学知识点全总结:八大板块知识框架与复习文档制作指南

简介:这是一份面向高中生与高考复习者的数学知识点系统梳理文档,将高中数学九大章节的核心考点按模块归类,涵盖函数与导数、三角函数与平面向量、数列、立体几何、概率统计、解析几何、参数方程等,并配有学习策略与易错点提醒&…

作者头像 李华