ChineseErrorCorrector:中文文本纠错综合平台终极指南——一站式掌握拼写纠错、语法纠错与SOTA模型五大核心能力
【免费下载链接】ChineseErrorCorrector一个面向中文文本纠错任务的综合平台,集学术研究、模型训练、模型评测和推理部署于一体,文本纠错新Sota。( 2026 ACL Main Oral )项目地址: https://gitcode.com/gh_mirrors/ch/ChineseErrorCorrector
ChineseErrorCorrector是一个面向中文文本纠错任务的综合平台,集拼写纠错(CSC)与语法纠错(CGEC)的模型训练、评测、推理部署与数据增强于一体。其旗舰模型 ChineseErrorCorrector4-4B 荣获2026 ACL Main Oral,在 NACGEC 与 CSCD 两大权威榜单刷新 SOTA,全面超越 GPT-4。
🎯 项目定位:一个平台覆盖中文纠错全流程
对新手来说,做中文纠错最大的痛点是"东拼西凑"——模型在 A 仓库、评测脚本在 B 仓库、训练数据在 C 仓库。ChineseErrorCorrector 把整条链路整合在一个平台里,覆盖五大核心能力:
| 核心能力 | 能做什么 | 主要入口 |
|---|---|---|
| 🎓 学术研究 | 持续更新的中文纠错论文清单 | README_paper.md |
| 📏 模型评测 | 支持 80 种语言的通用纠错评测工具 Common Errant | scores/README.md |
| 🚀 推理部署 | 4B 旗舰模型 + 可选 ELECTRA 字级门控加速 | main.py |
| 🧪 数据增强 | 14 种语法错误一键合成训练语料(2024 CCL 冠军方案) | README_DAT.md |
| 🤖 模型训练 | 开源 34 万 COT、200 万监督数据等高质量语料 | data/ |
它还曾斩获2024 CCL 冠军、2023 NLPCC-NaCGEC 纠错冠军、2022 FCGEC 纠错冠军,学术与工程双料实力。
🏆 模型家族:从 1.5B 轻量到 4B 旗舰怎么选?
平台提供从轻量到旗舰的完整模型矩阵,按需选择即可:
| 模型 | 纠错类型 | 一句话说明 |
|---|---|---|
| ChineseErrorCorrector4-4B🔥 | 语法+拼写 | ACL 2026 Main 论文模型,双榜 SOTA,超越 GPT-4 |
| ChineseErrorCorrector3-4B | 语法+拼写 | 200 万数据全量训练,综合效果好 |
| ChineseErrorCorrector2-7B | 语法+拼写 | 200 万数据多轮迭代训练,在 NaCGEC 超越华为 10 个点 |
| ChineseErrorCorrector-7B | 拼写 | 专注音似、形似等拼写错误纠正 |
| ChineseErrorCorrector-1.5B | 拼写 | 轻量款,显存有限时首选 |
| ChineseErrorDetectorElectra | 字级检错门控 | 轻量判别器,先筛句再调大模型,节省算力 |
SOTA 成绩一览
- NaCGEC(语法纠错):ChineseErrorCorrector4-4B 取得F0.5 = 50.99,第二名仅为 0.4526;
- CSCD(拼写纠错):Correction F1 达59.61,比 GPT-4(54.41)高出 5.2 个点。
🚀 快速上手:中文纠错模型部署三步走
第 1 步:获取代码并安装依赖
git clone https://gitcode.com/gh_mirrors/ch/ChineseErrorCorrector cd ChineseErrorCorrector pip install -r requirements.txt第 2 步:选择推理方式(三选一)
- transformers:单机本地推理,适合调试与小规模评测;
- vLLM 异步批量推理(工程推荐):
vllm serve启动模型后,通过 OpenAI 兼容接口调用,config.py中修改接口地址即可接入; - modelscope:国内用户镜像下载更省事。
第 3 步:运行批量纠错
python main.pyv4 旗舰模型的输出比上一代更"透明"——不仅给出纠正后的句子,还额外返回错误类型和修改原因,例如"朋唷 → 朋友"会被标注为"错别字",并解释是同音字误用。
配置集中在 config.py 的TextCorrectConfig中,接口地址、模型名、并发数都可以通过环境变量覆盖,开箱即用。
省钱技巧:ELECTRA 字级门控加速
大模型逐句生成成本高?平台内置可选的轻量字级判别器:先把句子过一遍 ELECTRA 门控,只对疑似有错的句子调用 4B 大模型,明显干净的句子直接跳过。在 config.py 中把USE_DETECTOR设为True即可启用,门控逻辑见 electra_char_gate_infer.py,详细说明见 README_ELECTRA.md。
🧪 数据增强:14 种语法错误一键合成
这是平台的"隐藏杀手锏"——2024 CCL 冠军方案的核心组件。如果你的领域语料(医疗、法律、教育……)缺少带错误的训练样本,只需一条命令安装 PyPI 包,即可在任意中文文本上注入 14 种语法错误:
from ChineseErrorCorrector.utils.dat import GrammarErrorDat dat = GrammarErrorDat() dat.lack_word("小明住在北京") # 缺字漏字 dat.error_word("小明住在北京") # 错别字以"祥子再度沉沦"这句为例,工具会随机选择 1~4 种错误进行注入(去掉标点、把"沦"改成"论"等),自动生成带标注的训练对。完整 API 见 dat.py,使用文档见 README_DAT.md。
14 种错误类型覆盖四大粒度,每种都配有真实例句:
缺字漏字、错别字、标点问题、主语/谓语/宾语残缺与多余、语序不当、动宾搭配不当……基本覆盖了中文病句的常见类型。
📏 模型评测:Common Errant 通用纠错评测工具
评测评测不用自己写脚本。平台内置Common Errant通用文本纠错评测工具,支持中文、英文等高资源语言和印地语、孟加拉语等低资源语言,共覆盖 80 种语言。
评测流程很直接:
- 用 parallel_to_m2.py 把"原文 + 标注 / 原文 + 预测"转成 M2 评测文件;
- 用 compare_m2.py 对比参考与预测,一键算出 F1 分数。
各语言(中文、英文、德语、乌克兰语、韩语等)的编辑合并与错误分类规则都封装在 scores/ 对应语言目录下,详细操作步骤见 scores/README.md。
🤖 模型训练:用 LLaMA-Factory 微调你的纠错模型
想在自有领域数据上训练纠错模型?平台推荐业界主流框架LLaMA-Factory,并提供了充足的弹药:
| 训练数据 | 规模 | 用途 |
|---|---|---|
| 34 万 COT 数据集 | 34 万 | 带错误推理链,用于训练 v4 旗舰模型 |
| 200 万监督数据集 | 200 万 | 常规 (src, tgt) 监督对,用于 v3 系列 |
| 拼写纠错数据集(CSC) | W271K / Medical / Lemon 等 | 拼写方向专项训练 |
| 语法纠错数据集(CGC) | CGED / FCGEC / MuCGEC / NaCGEC | 语法方向专项训练 |
| Lang8+HSK 混合语料 | 156 万 | 拼写+语法混合 |
选型建议:有 COT 数据优先以 ChineseErrorCorrector4 为基座;只有常规监督数据则推荐 ChineseErrorCorrector3 为基座。领域语料不足时,先用上文的数据增强工具合成错误样本再喂给训练框架。训练完成后的权重用vllm serve加载,把config.py里的OPENAI_MODEL改成自己的模型名即可无缝接入推理与评测流程。
📂 关键文件导航
| 文件 | 作用 |
|---|---|
| main.py | 推理主入口,ErrorCorrect.infer一键批量纠错 |
| config.py | 全部配置:接口地址、模型版本、门控开关 |
| llm/infer/openai_infer.py | OpenAI 兼容接口调用与 v3/v4 输出解析 |
| llm/infer/electra_char_gate_infer.py | ELECTRA 字级门控实现 |
| utils/dat.py | 14 种语法错误增强核心实现 |
| scores/ | Common Errant 评测工具(80 语言) |
| data/ | 训练数据、混淆字表等业务数据 |
| requirements.txt | 依赖清单 |
❓ 新手常见问题
Q1:v3 和 v4 模型有什么区别?v3 直接输出纠正后的句子;v4(ACL 2026 论文模型)会先"思考"再纠错,额外返回错误类型与修改原因,平台会按模型名自动适配 prompt 并剥掉思考块,对外接口完全一致。
Q2:显存有限能跑吗?1.5B 轻量模型适合资源受限场景;批量工程部署推荐 vLLM + ELECTRA 门控组合,可显著降低大模型调用次数。
Q3:可以直接商用吗?可以。项目基于 Apache-2.0 协议开源,学术与商业用途均允许,保留版权与协议声明即可。
✅ 总结
ChineseErrorCorrector 把中文文本纠错的"学、评、用、造"装进了一个平台:
- 想用:三种推理方式任选,SOTA 旗舰模型开箱即得;
- 想评:Common Errant 覆盖 80 种语言,F1 一键出炉;
- 想造数据:14 种语法错误一键增强,冠军方案直接复用;
- 想训:34 万 COT + 200 万监督数据 + LLaMA-Factory 路径全打通。
无论是对中文纠错感兴趣的初学者,还是要在生产环境落地纠错能力的工程师,这个平台都值得 Star 收藏 ⭐。
【免费下载链接】ChineseErrorCorrector一个面向中文文本纠错任务的综合平台,集学术研究、模型训练、模型评测和推理部署于一体,文本纠错新Sota。( 2026 ACL Main Oral )项目地址: https://gitcode.com/gh_mirrors/ch/ChineseErrorCorrector
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考