news 2026/8/25 9:45:31

ChineseErrorCorrector:中文文本纠错综合平台终极指南——一站式掌握拼写纠错、语法纠错与SOTA模型五大核心能力

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
ChineseErrorCorrector:中文文本纠错综合平台终极指南——一站式掌握拼写纠错、语法纠错与SOTA模型五大核心能力

ChineseErrorCorrector:中文文本纠错综合平台终极指南——一站式掌握拼写纠错、语法纠错与SOTA模型五大核心能力

【免费下载链接】ChineseErrorCorrector一个面向中文文本纠错任务的综合平台,集学术研究、模型训练、模型评测和推理部署于一体,文本纠错新Sota。( 2026 ACL Main Oral )项目地址: https://gitcode.com/gh_mirrors/ch/ChineseErrorCorrector

ChineseErrorCorrector是一个面向中文文本纠错任务的综合平台,集拼写纠错(CSC)与语法纠错(CGEC)的模型训练、评测、推理部署与数据增强于一体。其旗舰模型 ChineseErrorCorrector4-4B 荣获2026 ACL Main Oral,在 NACGEC 与 CSCD 两大权威榜单刷新 SOTA,全面超越 GPT-4。

🎯 项目定位:一个平台覆盖中文纠错全流程

对新手来说,做中文纠错最大的痛点是"东拼西凑"——模型在 A 仓库、评测脚本在 B 仓库、训练数据在 C 仓库。ChineseErrorCorrector 把整条链路整合在一个平台里,覆盖五大核心能力:

核心能力能做什么主要入口
🎓 学术研究持续更新的中文纠错论文清单README_paper.md
📏 模型评测支持 80 种语言的通用纠错评测工具 Common Errantscores/README.md
🚀 推理部署4B 旗舰模型 + 可选 ELECTRA 字级门控加速main.py
🧪 数据增强14 种语法错误一键合成训练语料(2024 CCL 冠军方案)README_DAT.md
🤖 模型训练开源 34 万 COT、200 万监督数据等高质量语料data/

它还曾斩获2024 CCL 冠军2023 NLPCC-NaCGEC 纠错冠军2022 FCGEC 纠错冠军,学术与工程双料实力。

🏆 模型家族:从 1.5B 轻量到 4B 旗舰怎么选?

平台提供从轻量到旗舰的完整模型矩阵,按需选择即可:

模型纠错类型一句话说明
ChineseErrorCorrector4-4B🔥语法+拼写ACL 2026 Main 论文模型,双榜 SOTA,超越 GPT-4
ChineseErrorCorrector3-4B语法+拼写200 万数据全量训练,综合效果好
ChineseErrorCorrector2-7B语法+拼写200 万数据多轮迭代训练,在 NaCGEC 超越华为 10 个点
ChineseErrorCorrector-7B拼写专注音似、形似等拼写错误纠正
ChineseErrorCorrector-1.5B拼写轻量款,显存有限时首选
ChineseErrorDetectorElectra字级检错门控轻量判别器,先筛句再调大模型,节省算力

SOTA 成绩一览

  • NaCGEC(语法纠错):ChineseErrorCorrector4-4B 取得F0.5 = 50.99,第二名仅为 0.4526;
  • CSCD(拼写纠错):Correction F1 达59.61,比 GPT-4(54.41)高出 5.2 个点。

🚀 快速上手:中文纠错模型部署三步走

第 1 步:获取代码并安装依赖

git clone https://gitcode.com/gh_mirrors/ch/ChineseErrorCorrector cd ChineseErrorCorrector pip install -r requirements.txt

第 2 步:选择推理方式(三选一)

  • transformers:单机本地推理,适合调试与小规模评测;
  • vLLM 异步批量推理(工程推荐):vllm serve启动模型后,通过 OpenAI 兼容接口调用,config.py中修改接口地址即可接入;
  • modelscope:国内用户镜像下载更省事。

第 3 步:运行批量纠错

python main.py

v4 旗舰模型的输出比上一代更"透明"——不仅给出纠正后的句子,还额外返回错误类型修改原因,例如"朋唷 → 朋友"会被标注为"错别字",并解释是同音字误用。

配置集中在 config.py 的TextCorrectConfig中,接口地址、模型名、并发数都可以通过环境变量覆盖,开箱即用。

省钱技巧:ELECTRA 字级门控加速

大模型逐句生成成本高?平台内置可选的轻量字级判别器:先把句子过一遍 ELECTRA 门控,只对疑似有错的句子调用 4B 大模型,明显干净的句子直接跳过。在 config.py 中把USE_DETECTOR设为True即可启用,门控逻辑见 electra_char_gate_infer.py,详细说明见 README_ELECTRA.md。

🧪 数据增强:14 种语法错误一键合成

这是平台的"隐藏杀手锏"——2024 CCL 冠军方案的核心组件。如果你的领域语料(医疗、法律、教育……)缺少带错误的训练样本,只需一条命令安装 PyPI 包,即可在任意中文文本上注入 14 种语法错误:

from ChineseErrorCorrector.utils.dat import GrammarErrorDat dat = GrammarErrorDat() dat.lack_word("小明住在北京") # 缺字漏字 dat.error_word("小明住在北京") # 错别字

以"祥子再度沉沦"这句为例,工具会随机选择 1~4 种错误进行注入(去掉标点、把"沦"改成"论"等),自动生成带标注的训练对。完整 API 见 dat.py,使用文档见 README_DAT.md。

14 种错误类型覆盖四大粒度,每种都配有真实例句:

缺字漏字、错别字、标点问题、主语/谓语/宾语残缺与多余、语序不当、动宾搭配不当……基本覆盖了中文病句的常见类型。

📏 模型评测:Common Errant 通用纠错评测工具

评测评测不用自己写脚本。平台内置Common Errant通用文本纠错评测工具,支持中文、英文等高资源语言和印地语、孟加拉语等低资源语言,共覆盖 80 种语言

评测流程很直接:

  1. 用 parallel_to_m2.py 把"原文 + 标注 / 原文 + 预测"转成 M2 评测文件;
  2. 用 compare_m2.py 对比参考与预测,一键算出 F1 分数。

各语言(中文、英文、德语、乌克兰语、韩语等)的编辑合并与错误分类规则都封装在 scores/ 对应语言目录下,详细操作步骤见 scores/README.md。

🤖 模型训练:用 LLaMA-Factory 微调你的纠错模型

想在自有领域数据上训练纠错模型?平台推荐业界主流框架LLaMA-Factory,并提供了充足的弹药:

训练数据规模用途
34 万 COT 数据集34 万带错误推理链,用于训练 v4 旗舰模型
200 万监督数据集200 万常规 (src, tgt) 监督对,用于 v3 系列
拼写纠错数据集(CSC)W271K / Medical / Lemon 等拼写方向专项训练
语法纠错数据集(CGC)CGED / FCGEC / MuCGEC / NaCGEC语法方向专项训练
Lang8+HSK 混合语料156 万拼写+语法混合

选型建议:有 COT 数据优先以 ChineseErrorCorrector4 为基座;只有常规监督数据则推荐 ChineseErrorCorrector3 为基座。领域语料不足时,先用上文的数据增强工具合成错误样本再喂给训练框架。训练完成后的权重用vllm serve加载,把config.py里的OPENAI_MODEL改成自己的模型名即可无缝接入推理与评测流程。

📂 关键文件导航

文件作用
main.py推理主入口,ErrorCorrect.infer一键批量纠错
config.py全部配置:接口地址、模型版本、门控开关
llm/infer/openai_infer.pyOpenAI 兼容接口调用与 v3/v4 输出解析
llm/infer/electra_char_gate_infer.pyELECTRA 字级门控实现
utils/dat.py14 种语法错误增强核心实现
scores/Common Errant 评测工具(80 语言)
data/训练数据、混淆字表等业务数据
requirements.txt依赖清单

❓ 新手常见问题

Q1:v3 和 v4 模型有什么区别?v3 直接输出纠正后的句子;v4(ACL 2026 论文模型)会先"思考"再纠错,额外返回错误类型与修改原因,平台会按模型名自动适配 prompt 并剥掉思考块,对外接口完全一致。

Q2:显存有限能跑吗?1.5B 轻量模型适合资源受限场景;批量工程部署推荐 vLLM + ELECTRA 门控组合,可显著降低大模型调用次数。

Q3:可以直接商用吗?可以。项目基于 Apache-2.0 协议开源,学术与商业用途均允许,保留版权与协议声明即可。

✅ 总结

ChineseErrorCorrector 把中文文本纠错的"学、评、用、造"装进了一个平台:

  • :三种推理方式任选,SOTA 旗舰模型开箱即得;
  • :Common Errant 覆盖 80 种语言,F1 一键出炉;
  • 造数据:14 种语法错误一键增强,冠军方案直接复用;
  • :34 万 COT + 200 万监督数据 + LLaMA-Factory 路径全打通。

无论是对中文纠错感兴趣的初学者,还是要在生产环境落地纠错能力的工程师,这个平台都值得 Star 收藏 ⭐。

【免费下载链接】ChineseErrorCorrector一个面向中文文本纠错任务的综合平台,集学术研究、模型训练、模型评测和推理部署于一体,文本纠错新Sota。( 2026 ACL Main Oral )项目地址: https://gitcode.com/gh_mirrors/ch/ChineseErrorCorrector

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/25 9:41:53

软件功能测试面试全攻略:100道高频题解析

1. 软件功能测试面试题的价值与定位对于刚毕业的应届生来说,软件功能测试岗位往往是进入IT行业的首选切入点。不同于性能测试、安全测试等需要特定技术积累的领域,功能测试更注重对软件质量保证基础理念的理解和基本测试技能的掌握。这100道面试题的设计…

作者头像 李华