如何快速看懂 avoid-ai-writing 的 Tier 1/2/3 词汇体系:112 条替换词表 + 10 个套话短语判定标准
【免费下载链接】avoid-ai-writingSkill that audits and rewrites content to remove AI writing patterns. Use it with your favorite agents including Claude Code, OpenClaw, Codex, and Hermes.项目地址: https://gitcode.com/gh_mirrors/avo/avoid-ai-writing
avoid-ai-writing 是一个开源的 AI 写作痕迹检测与改写技能,可配合 Claude Code、Codex 等 AI 智能体使用,把"AI 腔"逐条找出来并给出口语化的替换词。它最核心的资产就是112 条替换词表 + 10 个套话短语,按 Tier 1 / Tier 2 / Tier 3 三层管理——每一层的触发条件、替换方式和证据意义都不一样。读完这篇指南,你不需要读任何代码,就能判断一个词"算不算 AI 腔"、该不该替换。
三层词汇体系:判定条件一目了然
先建立整体印象。三层的设计思路是:词越"可疑",判定越严格地触发;词越普通,越要堆够证据才标记,以此降低对普通人类写作的误报。
| 层级 | 判定条件 | 证据意义 | 评分权重 |
|---|---|---|---|
| Tier 1 | 每个匹配都审查(1A / 1B 分带) | 1A 是 AI 生成痕迹证据;1B 只是冗余表达,不算证据 | 1A ×5 / 1B ×3 |
| Tier 2 | 同一段落出现 2 个及以上不同词 | 单独出现合法,聚集才是 AI 信号 | ×3 |
| Tier 3 | 密度 ≥3% 且不少于 3 次(短语:同一短语 2+ 次,或 3+ 个不同短语) | 只是"用词饱和",提示空洞夸赞 | ×2 |
Tier 1 判定标准:每个匹配都要审查
Tier 1 内部再分两个子层(band),替换方式相同,但"标记意味着什么"完全不同:
- Tier 1A —— AI 高频标记词:据称在机器文本中出现频率远高于人类文本(如
delve、tapestry、tapestry类隐喻)。一个段落里这类词扎堆,就是对"这段是 AI 写的"的直接证据。 - Tier 1B —— 清晰度修订:
in order to、utilize、commence、ascertain、endeavor这类冗词和过度正式词。换掉它们对谁都好,但它不是 AI 证据——项目用 257 段 2023 年前的人类专业写作实测过,1B 词在正式写作中命中率同样不低。
这是整套体系里最容易被误用的一点:把"句子啰嗦"当作"AI 写的证据",正是 1A/1B 分带要防止的错误。在 detect 模式下,两者必须分开汇报。
几个典型替换示例:
| 命中 | 判定 | 建议替换 |
|---|---|---|
delve/delve into | 1A | explore、dig into、look at |
testament to | 1A | shows、proves、demonstrates |
leverag(e) | 1A | use |
in order to | 1B | to |
utilize | 1B | use |
commence | 1B | start、begin |
两个容易踩坑的细节:
- 变形词一并覆盖。每个词条默认覆盖其形态变体——
genuine连带genuinely、leverage连带leveraging/leveraged、meticulous连带meticulously。只有变体带出独立合法含义时才按语境判断。 load-bearing必须带连字符。"load bearing down on the bridge" 是正常英语,不标记;只有连字符形式且紧跟抽象名词(assumption、claim、invariant 等白名单)才算 AI 痕迹——宁可漏报,不误伤。
Tier 2 判定标准:单独合法,聚集才标记
Tier 2 的触发规则很具体:同一段落内出现 2 个或 2 个以上不同的 Tier 2 词,才整体标记(代码中为found.length >= 2)。写一段技术文用一次navigate、一次streamline完全没问题;但一个段落里elevate、foster、seamless同时出现,基本就要动刀了。
代表词条与替换建议:
harness→ use、take advantage ofelevate→ improve、raise、strengthenstreamline→ simplify、speed upmyriad/plethora→ many、a lot of(或直接给出数字)transformative→ 直接说清楚"变了什么、怎么变的"cornerstone→ foundation、basis、key part
条件词条deeply是个好例子:只有与integrated、committed、rooted等"意义感搭配"一起出现才计入聚集;"deeply nested JSON"、"cares deeply" 这类字面用法永远不算——因为这类词在日常文本里的基础概率远高于表内其他词,无条件标记会大量误伤干净的人类写作。
Tier 3 判定标准:密度阈值 + 套话短语规则
Tier 3 全是普通词(significant、innovative、effective、world-class……)。AI 偏爱用它们填满空间,但单次出现完全合法,所以只按密度标记。
单词密度公式:某词出现次数 ≥ max(3, 总词数 × 3%)。也就是说 100 词的文章里出现 3 次significant才标记;50 词里出现 1 次不算——这是为了避免"小文本一碰就响"的噪声。
10 个 Tier 3 套话短语(多词模板句)的判定更严,因为两词短语重复两次的证明力已经强于重复一次 "significant":
- 同一短语出现2 次及以上,即标记;
- 聚集规则:一篇文章出现3 个及以上不同的表内短语,即使每个只出现一次,也是强 AI 信号——这正是 LLM"给自己的套话换着花样用"的形状。
10 个短语分别是:emerging sector/space/category、the integration of、the intersection of、community-driven、long-term sustainability、user engagement、decentralized compute、reward emissions、tokenized incentive structures、designed for long-term。加密、Web3、AI 基建类文本是重灾区,替换方向统一:把抽象名词换成具体对象或数字("community-driven" 要说清社区到底做了什么)。
权重与上下文豁免:为什么这套体系误报少
- 权重梯度(detector/patterns.js 中的
ISSUE_WEIGHTS):1A ×5 > 1B / Tier 2 ×3 > Tier 3 ×2。1B 被刻意压低,保证"改掉一堆冗词"这件事本身永远不会把一篇文档推向 AI 分类。 - 技术语境豁免:
technical模式下,robust、comprehensive、seamless、ecosystem、leverage、facilitate、underpin、streamline8 个技术合法词自动跳过——写技术博客不会被自己的行话误伤。 - 变体与豁免优先:每条词条都带上下文例外(如
real表示"真实的"而非"强调语气"时不标记),检测时先过例外再出手。
新手上手建议
- 先用 detect 模式跑一遍:只看报告、不改文件,熟悉每类标记长什么样。完整模式说明见 README.md。
- 报告里先看 Tier 1A:那才是 AI 痕迹的直接证据;1B 和 Tier 2 / 3 的命中按"文字质量建议"处理,改不改看情况。
- 替换时别发明内容:词表给出的是措辞建议,
myriad users换成many users可以,但不能凭空补出"10 万用户"这类原文没有的数字。 - 对照原文保真度:项目自带
node detector/validate.js before.md after.md对比改写前后是否有内容丢失(保真度校验逻辑在 detector/validate.js)。
相关资料
- 完整词表与 74 类模式规则:references/patterns.md
- 检测引擎与评分权重实现:detector/patterns.js
- 规则与引擎的映射对照表:detector/CATEGORIES.md
- 术语定义(词层级、模式、画像):GLOSSARY.md
- 本地风格检查脚本:scripts/check-style.js
- 词表数量防漂移 CI 校验:scripts/check-pattern-count.sh
掌握"1A 是证据、1B 是修辞、Tier 2 看聚集、Tier 3 看密度"这 16 个字,你就能看懂 avoid-ai-writing 检测报告里的每一条词汇标记了。
【免费下载链接】avoid-ai-writingSkill that audits and rewrites content to remove AI writing patterns. Use it with your favorite agents including Claude Code, OpenClaw, Codex, and Hermes.项目地址: https://gitcode.com/gh_mirrors/avo/avoid-ai-writing
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考