news 2026/9/25 5:00:45

如何快速看懂 avoid-ai-writing 的 Tier 1/2/3 词汇体系:112 条替换词表 + 10 个套话短语判定标准

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
如何快速看懂 avoid-ai-writing 的 Tier 1/2/3 词汇体系:112 条替换词表 + 10 个套话短语判定标准

如何快速看懂 avoid-ai-writing 的 Tier 1/2/3 词汇体系:112 条替换词表 + 10 个套话短语判定标准

【免费下载链接】avoid-ai-writingSkill that audits and rewrites content to remove AI writing patterns. Use it with your favorite agents including Claude Code, OpenClaw, Codex, and Hermes.项目地址: https://gitcode.com/gh_mirrors/avo/avoid-ai-writing

avoid-ai-writing 是一个开源的 AI 写作痕迹检测与改写技能,可配合 Claude Code、Codex 等 AI 智能体使用,把"AI 腔"逐条找出来并给出口语化的替换词。它最核心的资产就是112 条替换词表 + 10 个套话短语,按 Tier 1 / Tier 2 / Tier 3 三层管理——每一层的触发条件、替换方式和证据意义都不一样。读完这篇指南,你不需要读任何代码,就能判断一个词"算不算 AI 腔"、该不该替换。

三层词汇体系:判定条件一目了然

先建立整体印象。三层的设计思路是:词越"可疑",判定越严格地触发;词越普通,越要堆够证据才标记,以此降低对普通人类写作的误报。

层级判定条件证据意义评分权重
Tier 1每个匹配都审查(1A / 1B 分带)1A 是 AI 生成痕迹证据;1B 只是冗余表达,不算证据1A ×5 / 1B ×3
Tier 2同一段落出现 2 个及以上不同词单独出现合法,聚集才是 AI 信号×3
Tier 3密度 ≥3% 且不少于 3 次(短语:同一短语 2+ 次,或 3+ 个不同短语)只是"用词饱和",提示空洞夸赞×2

Tier 1 判定标准:每个匹配都要审查

Tier 1 内部再分两个子层(band),替换方式相同,但"标记意味着什么"完全不同:

  • Tier 1A —— AI 高频标记词:据称在机器文本中出现频率远高于人类文本(如delve、tapestry、tapestry类隐喻)。一个段落里这类词扎堆,就是对"这段是 AI 写的"的直接证据。
  • Tier 1B —— 清晰度修订:in order to、utilize、commence、ascertain、endeavor这类冗词和过度正式词。换掉它们对谁都好,但它不是 AI 证据——项目用 257 段 2023 年前的人类专业写作实测过,1B 词在正式写作中命中率同样不低。

这是整套体系里最容易被误用的一点:把"句子啰嗦"当作"AI 写的证据",正是 1A/1B 分带要防止的错误。在 detect 模式下,两者必须分开汇报。

几个典型替换示例:

命中判定建议替换
delve/delve into1Aexplore、dig into、look at
testament to1Ashows、proves、demonstrates
leverag(e)1Ause
in order to1Bto
utilize1Buse
commence1Bstart、begin

两个容易踩坑的细节:

  1. 变形词一并覆盖。每个词条默认覆盖其形态变体——genuine连带genuinely、leverage连带leveraging/leveraged、meticulous连带meticulously。只有变体带出独立合法含义时才按语境判断。
  2. load-bearing必须带连字符。"load bearing down on the bridge" 是正常英语,不标记;只有连字符形式且紧跟抽象名词(assumption、claim、invariant 等白名单)才算 AI 痕迹——宁可漏报,不误伤。

Tier 2 判定标准:单独合法,聚集才标记

Tier 2 的触发规则很具体:同一段落内出现 2 个或 2 个以上不同的 Tier 2 词,才整体标记(代码中为found.length >= 2)。写一段技术文用一次navigate、一次streamline完全没问题;但一个段落里elevate、foster、seamless同时出现,基本就要动刀了。

代表词条与替换建议:

  • harness→ use、take advantage of
  • elevate→ improve、raise、strengthen
  • streamline→ simplify、speed up
  • myriad/plethora→ many、a lot of(或直接给出数字)
  • transformative→ 直接说清楚"变了什么、怎么变的"
  • cornerstone→ foundation、basis、key part

条件词条deeply是个好例子:只有与integrated、committed、rooted等"意义感搭配"一起出现才计入聚集;"deeply nested JSON"、"cares deeply" 这类字面用法永远不算——因为这类词在日常文本里的基础概率远高于表内其他词,无条件标记会大量误伤干净的人类写作。

Tier 3 判定标准:密度阈值 + 套话短语规则

Tier 3 全是普通词(significant、innovative、effective、world-class……)。AI 偏爱用它们填满空间,但单次出现完全合法,所以只按密度标记。

单词密度公式:某词出现次数 ≥ max(3, 总词数 × 3%)。也就是说 100 词的文章里出现 3 次significant才标记;50 词里出现 1 次不算——这是为了避免"小文本一碰就响"的噪声。

10 个 Tier 3 套话短语(多词模板句)的判定更严,因为两词短语重复两次的证明力已经强于重复一次 "significant":

  1. 同一短语出现2 次及以上,即标记;
  2. 聚集规则:一篇文章出现3 个及以上不同的表内短语,即使每个只出现一次,也是强 AI 信号——这正是 LLM"给自己的套话换着花样用"的形状。

10 个短语分别是:emerging sector/space/category、the integration of、the intersection of、community-driven、long-term sustainability、user engagement、decentralized compute、reward emissions、tokenized incentive structures、designed for long-term。加密、Web3、AI 基建类文本是重灾区,替换方向统一:把抽象名词换成具体对象或数字("community-driven" 要说清社区到底做了什么)。

权重与上下文豁免:为什么这套体系误报少

  • 权重梯度(detector/patterns.js 中的ISSUE_WEIGHTS):1A ×5 > 1B / Tier 2 ×3 > Tier 3 ×2。1B 被刻意压低,保证"改掉一堆冗词"这件事本身永远不会把一篇文档推向 AI 分类。
  • 技术语境豁免:technical模式下,robust、comprehensive、seamless、ecosystem、leverage、facilitate、underpin、streamline8 个技术合法词自动跳过——写技术博客不会被自己的行话误伤。
  • 变体与豁免优先:每条词条都带上下文例外(如real表示"真实的"而非"强调语气"时不标记),检测时先过例外再出手。

新手上手建议

  1. 先用 detect 模式跑一遍:只看报告、不改文件,熟悉每类标记长什么样。完整模式说明见 README.md。
  2. 报告里先看 Tier 1A:那才是 AI 痕迹的直接证据;1B 和 Tier 2 / 3 的命中按"文字质量建议"处理,改不改看情况。
  3. 替换时别发明内容:词表给出的是措辞建议,myriad users换成many users可以,但不能凭空补出"10 万用户"这类原文没有的数字。
  4. 对照原文保真度:项目自带node detector/validate.js before.md after.md对比改写前后是否有内容丢失(保真度校验逻辑在 detector/validate.js)。

相关资料

  • 完整词表与 74 类模式规则:references/patterns.md
  • 检测引擎与评分权重实现:detector/patterns.js
  • 规则与引擎的映射对照表:detector/CATEGORIES.md
  • 术语定义(词层级、模式、画像):GLOSSARY.md
  • 本地风格检查脚本:scripts/check-style.js
  • 词表数量防漂移 CI 校验:scripts/check-pattern-count.sh

掌握"1A 是证据、1B 是修辞、Tier 2 看聚集、Tier 3 看密度"这 16 个字,你就能看懂 avoid-ai-writing 检测报告里的每一条词汇标记了。

【免费下载链接】avoid-ai-writingSkill that audits and rewrites content to remove AI writing patterns. Use it with your favorite agents including Claude Code, OpenClaw, Codex, and Hermes.项目地址: https://gitcode.com/gh_mirrors/avo/avoid-ai-writing

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/25 5:00:40

PyBLE:基于BLE的ESP32无线调试协议栈

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/25 4:59:27

头歌平台损失函数手写实践:从公式到可调试代码

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/25 4:58:21

九联UNT403HS刷机全攻略:U盘强刷与救砖实战

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/25 4:58:01

Ozone嵌入式调试原理:硬件级追踪与RTOS深度分析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/25 4:57:46

腾讯云WorkBuddy Enterprise企业级AI Agent平台架构与实操指南

1. 从零理解 WorkBuddy Enterprise 的定位与核心价值1.1 这个平台到底解决什么问题WorkBuddy Enterprise 是腾讯云推出的一套企业级 AI 平台与 Agent 生态产品。说白了,它要解决的核心问题是:企业想用 AI,但不知道怎么把 AI 能力安全、可控、…

作者头像 李华