认识TeleOCR:1.2B轻量级文档解析模型完全指南——一个模型搞定OCR、表格与公式
【免费下载链接】TeleOCR项目地址: https://ai.gitcode.com/hf_mirrors/StarDoc-AI/TeleOCR
TeleOCR 是一个仅约1.2B 参数的开源轻量级文档解析模型,把 OCR 文本识别、表格还原、公式转 LaTeX 全部装进一个模型里。它基于 Qwen2.5-VL 架构,中英双语支持,Apache-2.0 协议完全开源,普通消费级显卡即可本地部署,是 2026 年文档智能领域公认的"小钢炮"。
🎯 为什么你需要一个"轻量"的文档解析模型
传统文档解析方案要么拼凑多个工具(OCR 一个、表格检测一个、公式识别又一个),要么依赖动辄几十 B 参数的大模型,部署成本高、链路复杂。
TeleOCR 的解法很直接:一个模型,统一框架,同时处理数字文档(PDF、扫描件)和相机拍摄的扭曲文档。你拍一张歪斜的纸质合同照片,它也能直接输出结构化结果,无需额外的透视矫正模型。
⚡ 60 秒认识 TeleOCR 的六大核心能力
| 能力 | 说明 | 输出形式 |
|---|---|---|
| 📝 文本 OCR | 中英文混排文本识别 | 纯文本 |
| 📊 表格还原 | 支持合并单元格 | OTSL 标记 → HTML 表格 |
| 🧮 公式识别 | 手写/印刷公式转 LaTeX | $...$LaTeX 代码 |
| 💻 代码解析 | 识别截图中的代码片段 | 代码文本 |
| 🗂️ 版面分析 | 标题、段落、图表区域定位 | 结构块 + 坐标 |
| 🔬 科学图表解析 | 从科研图/表中抽取隐含数据表格 | HTML 表格 |
值得一提的是,模型对扭曲文档做了专门的几何感知建模——拍摄照片常见的弯曲、倾斜、透视变形都不再是问题,这在同类轻量模型中并不多见。
📈 成绩到底有多强?
在权威基准OmniDocBench v1.6上,TeleOCR 以 96.87 的综合分拿下 SOTA,超过 30B 级别的通用大模型:
| 模型 | 参数量 | 综合分 ↑ | 表格 TEDS ↑ |
|---|---|---|---|
| TeleOCR | 1.2B | 96.87 | 97.05 |
| MinerU 2.5 Pro | 1.2B | 95.75 | 93.42 |
| Gemini 3 Pro | 未公开 | 92.85 | 89.15 |
| Qwen3-VL-235B | 235B | 89.78 | 83.07 |
在 EMNLP 2026 举办的Dr.DocBench Challenge文档解析竞赛中,TeleOCR 以 67.96 的综合分排名第一,领先 MinerU 2.5 Pro 约 5.7 分。
💡 关键结论:1.2B 参数 ≈ 235B 通用大模型的文档解析表现,而推理成本只有它的零头。
📦 模型文件里都有什么
整个仓库就是一套即用的推理模型,核心文件如下:
- model.safetensors —— 模型权重本体(bfloat16 精度)
- config.json —— 架构配置:28 层 Transformer、128K 上下文长度、基于
qwen2_5_vl - modeling_naviocr.py —— 自定义模型加载代码,
trust_remote_code=True时自动启用 - tokenizer.json 与 vocab.json —— 分词器,包含 OTSL 表格专用标记
- preprocessor_config.json —— 图像处理参数(动态分辨率,最高约 12.8M 像素)
- generation_config.json —— 推理参数(temperature 0.1,适合确定性输出)
- chat_template.jinja —— 对话模板
想深入了解模型细节和完整评测,可阅读项目说明文档 README.md。
🚀 三步跑通本地文档解析
第一步:安装依赖
仅需 HuggingFace 生态三大件:
pip install transformers torch pillow第二步:加载模型
import torch from PIL import Image from transformers import AutoProcessor, AutoModel processor = AutoProcessor.from_pretrained("StarDoc-AI/TeleOCR", trust_remote_code=True, use_fast=True) model = AutoModel.from_pretrained("StarDoc-AI/TeleOCR", trust_remote_code=True, torch_dtype=torch.bfloat16).cuda().eval()第三步:发一句话,拿一个结果
TeleOCR 采用自然语言指令驱动,想解析什么就说什么:
# 表格识别:输出 OTSL 格式,可自动转成 HTML raw = infer(Image.open("./assets/table.png"), "This is the image of a table. Please output the table in OTSL format.")官方示例覆盖文本、表格、公式、代码、版面分析共 6 类场景,完整用法见 README.md 的 Quick Start 部分。
🧠 1.2B 参数凭什么做到 SOTA?
TeleOCR 论文(技术报告 arXiv:2608.12898)提出的几个关键创新,值得了解:
- 多节点共识投票(MCV)——自动合成高质量伪标签,数据质量拉满
- 几何感知文档建模——专门针对相机拍摄文档的形变问题
- 曲率引导的 Douglas-Peucker 采样(CGDP)——更精细地捕捉弯曲文字区域
- 内容-结构解耦学习——表格与公式"内容"和"结构"分开训练,两者同时高分
- 四阶段渐进训练——从易到难,逐步逼近极限
这些技术让它在保持轻量部署的前提下,性能反而超过更大的模型。
🛠️ 适合哪些场景?
- ✅ 本地化文档数字化(发票、合同、试卷批量解析)
- ✅ 论文/书籍电子化:公式转 LaTeX 特别出色(见上方示例图)
- ✅ 手机拍摄文档的实时解析(歪斜、反光场景)
- ✅ 科研图表数据抽取
- ⚠️ 提示:完整的生产级文档解析管线(含版面切分、阅读顺序)建议配合官方推理框架使用,可参考 README.md 中的说明
💬 写在最后
TeleOCR 证明了文档解析这件事不需要大参数也能做好:1.2B 的体量、Apache-2.0 的开源协议、中英双语支持、拍照文档也能扛——对于想把文档智能装进自己产品里的团队和个人开发者,它目前几乎是"开箱即用"的最优选择之一。
建议先从文本 OCR 和公式识别玩起,这两个任务几行代码即可体验完整效果。动手试试吧!🚀
【免费下载链接】TeleOCR项目地址: https://ai.gitcode.com/hf_mirrors/StarDoc-AI/TeleOCR
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考