news 2026/8/21 21:24:34

ChineseOCR_Lite:4.7M 超轻量中文 OCR,三行命令跑通本地文字识别

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
ChineseOCR_Lite:4.7M 超轻量中文 OCR,三行命令跑通本地文字识别

ChineseOCR_Lite:4.7M 超轻量中文 OCR,三行命令跑通本地文字识别

【免费下载链接】chineseocr_lite超轻量级中文ocr,支持竖排文字识别, 支持ncnn、mnn、tnn推理 ( dbnet(1.8M) + crnn(2.5M) + anglenet(378KB)) 总模型仅4.7M项目地址: https://gitcode.com/gh_mirrors/ch/chineseocr_lite

ChineseOCR_Lite 是一个超轻量级中文 OCR 工具箱,串起 dbnet 文本检测、crnn 文本识别、anglenet 方向校正三个小模型,模型总量只有 4.7M。它让你在纯 CPU 的机器上就能做完全本地、离线的中文字符识别——不用 GPU,不依赖网络,也不用等云端接口,丢一张图片进来,还你带位置框的文字结果。

为什么 4.7M 的中文 OCR 能扛打

架构是经典的"先检测、再识别"两段式,三个部分各司其职:

  • dbnet(1.8M)是文本检测模型,负责先把图里所有文字区域框出来;
  • crnn(2.5M)是基于 LSTM 的序列识别模型(卷积提特征、循环网络按顺序吐字),负责读出每行文字里的字;
  • anglenet(378KB)做方向分类,判断文字是不是被旋转了 180 度。

因为全流程走 ONNX Runtime 的 CPU 推理,不碰 CUDA,老笔记本、嵌入式板卡也能跑;也因为模型总共 4.7M,整套流水线可以塞进手机。仓库里给了 ncnn、mnn、onnx 三种推理引擎的参考实现,外加 C++、Android、JVM、.NET 多端 Demo,想移植到哪个平台都有现成代码对着改。

最能打的点是对竖排和旋转文字的支持:图片里的文字哪怕被印倒了 180 度,anglenet 会先判断出来自动转正,再交给 crnn 识别,你省掉了一道单独的方向校正工序。

哪些活儿交给它

📄批量数字化与脚本接入——以前调云端 OCR API 一张一张传,担心费用和数据出网;现在装完依赖,终端敲一条chineseocr 图片.jpg,输出稳定 JSON:全文、每行置信度、位置框齐全。批量图片套个 shell 循环就完事,agent 和自动化脚本直接解析。

📱嵌入手机和低端设备——以前端侧 OCR 引擎动辄几十上百 MB;现在整个模型集不到 5M,从 ncnn、mnn、onnx 里挑一个和你环境匹配的推理后端,Android 端 Demo 开箱就能跑。

🔁横竖混排、方向颠倒的图——以前要先接方向校正模型再识别;现在竖排、倒排文字直接丢进来,anglenet 先转正再识别,少维护一个模型。

三行命令跑起来

git clone https://gitcode.com/gh_mirrors/ch/chineseocr_lite cd chineseocr_lite && pip install -r requirements.txt python -m chineseocr_lite test_imgs/res.jpg

想要网页界面的话,跑python backend/main.py启动 OCR 服务,默认监听 8089 端口,浏览器打开就能贴图识别。下面两张是内置 Web 页面的实际识别效果:一张是带长段中文的论文截图,一张是多方向排布文字的产品图,检测框和识别行都对得上。

小、免费、能离线

如果你要的是一套"体积小于 5M、免费、纯 CPU 就能跑"的本地中文字符识别工具,ChineseOCR_Lite 就是现成的。clone 下来跑通一张测试图,发现竖排或特殊字体场景有问题,直接提 Issue 反馈。

【免费下载链接】chineseocr_lite超轻量级中文ocr,支持竖排文字识别, 支持ncnn、mnn、tnn推理 ( dbnet(1.8M) + crnn(2.5M) + anglenet(378KB)) 总模型仅4.7M项目地址: https://gitcode.com/gh_mirrors/ch/chineseocr_lite

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/21 21:23:15

C++模板本质:编译期代码生成与泛型设计基石

1. 这不是语法糖&#xff0c;是C程序员的“内功心法”起点你写过vector<int>&#xff0c;用过sort(arr, arr n)&#xff0c;甚至在VS Code里配好了C17标准——但当你第一次看到template<typename T>这行代码时&#xff0c;是不是下意识跳过了&#xff1f;或者更常…

作者头像 李华
网站建设 2026/8/21 21:23:05

Python正态分布检验:原理、方法与实践指南

1. 项目概述&#xff1a;为什么正态分布检验是建模的基石做数据分析或者数学建模的朋友&#xff0c;肯定都听过“正态分布”这个词。它就像数据分析世界里的一个“标准模板”&#xff0c;很多经典的统计方法&#xff0c;比如t检验、方差分析、线性回归&#xff0c;都建立在一个…

作者头像 李华
网站建设 2026/8/21 21:22:59

Snap.Hutao胡桃工具箱:原神抽卡记录分析与角色培养规划工具

Snap.Hutao胡桃工具箱&#xff1a;原神抽卡记录分析与角色培养规划工具 【免费下载链接】Snap.Hutao 实用的开源多功能原神工具箱 &#x1f9f0; / Multifunctional Open-Source Genshin Impact Toolkit &#x1f9f0; 项目地址: https://gitcode.com/GitHub_Trending/sn/Sna…

作者头像 李华
网站建设 2026/8/21 21:20:07

Java HashMap底层原理与面试高频考点解析

1. HashMap高频考点模拟面试全解析 作为Java开发者技术成长路上的必经关卡&#xff0c;HashMap的底层实现与线程安全机制一直是面试官最热衷考察的知识点。我在最近三个月参与的47场技术面试中&#xff0c;有39次被要求在白板上手写HashMap的put方法实现&#xff0c;这个数字足…

作者头像 李华