先说一个我最近观察到的现象:你在搜索引擎里搜一个稍微有点冷门的问题,翻到第二页,开始出现大量“看似回答得很工整、实则废话连篇”的文章。标题规整、结构清晰、小标题齐全,但读下去你会发现,它根本没回答你的问题,只是在把已知的常识重新排列组合。这类内容,社区给它起了个不太好听的名字——AI Slop。中文圈目前还没有一个特别精准的译法,有人叫它“AI味内容”,有人叫它“AI垃圾”,不管怎么叫,它已经成了从内容平台到企业知识库都无法回避的问题。
过去一年我一直在做内容质量治理相关的工作,从审核规则到算法策略,跟AI Slop的对抗算得上面对面打过几轮。这篇就把我在实战中摸出来的方法论和工具链完整摊开讲讲:从如何定义AI Slop、如何建立识别体系,到清洗策略、降权逻辑、源头预防,覆盖一条完整的治理链路。这篇更适合内容平台的产品经理、做算法策略的工程师、运营审核团队,以及企业内部知识库的管理者阅读,普通创作者看完也能明白为什么自己的内容会被限流、被系统打上“低质”标签。
1. 先搞清楚我们对抗的是什么:AI Slop的四个本质特征
治理这件事最怕的就是对象不清晰。如果你连要治理的东西都定义不清楚,后面的规则和模型就是空中楼阁。我在项目启动阶段带着团队做了一件事:收集了3000多条被用户举报、被编辑判定为低质、被算法降权的AI生成内容,逐条拆解它们的共性。最后提炼出四个本质特征,这四个特征也成了后续治理模型的底层基础。
1.1 AI Slop与“低质内容”的边界:为什么不能混为一谈
传统意义上的低质内容,比如拼接抄袭、标题党、机翻文,它们的核心问题是“创作者的懒惰”,但内容本身仍然是人类生产的,有真实的信息来源和逻辑链条,只是质量差。AI Slop则完全是另一回事——它是模型根据统计概率“猜”出来的输出,本质上是语义的空壳,没有真实的信息增量和事实依据。
举一个很典型的例子。一篇关于“如何养护多肉植物”的AI生成文章,结构是完美的:开头讲多肉受欢迎,中间讲光照、浇水、土壤三大要素,每一条下面配一段解释,结尾总结养护要点。单看结构,它比很多人类写的文章都规范。但仔细读就会发现,它说的是大家早就知道的常识,“光照要充足但夏季要遮阴”“浇水见干见湿”“土壤要疏松透气”,没有任何一条是你在百科上看不到的。这就是AI Slop和普通低质内容最大的区别:它不是“做得差”,而是“什么都没做,只是用看起来很专业的方式把已有信息重新组合了一遍”。
在治理策略上,这个区分非常重要。普通低质内容可以用“查重率+人工抽检”来治理,AI Slop必须用“信息密度+语义新颖度”来识别。两者的技术路线完全不同。
1.2 四个本质特征:高产量、低信息密度、语义空洞、来源异化
经过对样本的逐条标注和分析,我提炼出AI Slop的四个本质特征,任何一个单独出现都未必是问题,但组合在一起,基本可以实锤。
第一个特征是高产量。一个账号在24小时内发布50篇文章、200张图片、30个短视频,这在人类创作者的生理极限下几乎不可能,但在AI工具面前只是几分钟的事。产量本身不是罪,但当产量和内容质量不匹配时,它就成了非常强的风险信号。
第二个特征是低信息密度。把文章里的形容词、连接词、背景铺垫全部去掉之后,剩余的有效信息占比极低。有效信息的定义是“读者在此之前不知道的、经过验证的事实”,AI生成的段落里,大量句子属于“正确的废话”。
第三个特征是语义空洞。这不是指语句不通,恰恰相反,AI Slop的语句往往非常通顺,它的问题是整段话“没有指向性”——你找不到作者的观点、立场和经验。人类写文章,多少会带一点个人色彩,哪怕是一句“我之前也试过”“这个方法对我没用”,都意味着作者有真实的体验。AI Slop刻意抹掉了这种个人色彩,因为模型的训练目标就是“尽量客观、尽量中立”。
第四个特征源于来源异化。普通内容的生产者和发布者是一致的:一个人写了篇文章,用他的账号发出来。AI Slop则常常出现“生产者和发布者分离”的情况——人只负责批量操作AI生成内容,然后发布,甚至完全由自动化脚本完成。这个是治理中最棘手的点,因为你很难从内容本身溯源到作者的真实意图。
1.3 按生产动机分类:工具型、流量型、组织型
识别出特征之后,还需要对AI Slop做分类,因为不同动机的Slop,治理手段完全不同。
工具型Slop是指创作者用AI辅助生产内容,但本意不是恶意刷量,只是能力不足或认知不够,以为“AI写的就行”。这个群体分布在各类“经验分享”类内容里,比如健身计划、菜谱、育儿知识,内容没有恶意,但误导性很强。对这类Slop,治理策略是“低优先级,优先标注”,不必重拳出击,但要给读者提示。
流量型Slop是问题最严重的,生产者的目的很明确:用最低的成本批量生产内容,赌搜索排名和推荐算法的漏洞,赚取广告分成或导流。他们不会去核实内容准确性,速度就是一切。这个群体是治理的头号目标,手段要硬,发现即降权,严重者直接封禁。
组织型Slop上升到机构层面,可能是MCN公司批量运营账号矩阵,也可能是某个企业在SEO外包中拿到了一堆AI生成的内容。组织型Slop表面看起来比个人生产的更“规整”,因为机构通常会对内容做二次编辑,掩盖AI特征。但它也有破绽,就是账号矩阵之间的内容高度同质化,发布时间规律性强。治理组织型Slop不能只靠内容特征,要结合账号维度的行为特征做联合打击。
2. 为什么非治不可:AI Slop的成本转移与生态破坏
很多人对AI Slop的态度是“看到了划过去就行,何必大动干戈”。这是对治理重要性认识不足。AI Slop的危害不是“占了点信息流的位置”,而是它在系统性地转移成本,并且会逐步劣化整个内容生态的信息质量。
2.1 成本转嫁模型:谁在生产,谁在买单
我一直在内部推一个“成本转嫁”的分析框架。在传统内容生产中,写一篇文章的时间成本可能是3小时,创作者会自然地去做信息核实、结构设计和语言润色,因为成本太高,返工太难受。这个隐性的“质量控制机制”在AI Slop面前彻底失效了——生产一篇内容的边际成本趋近于零,所以生产者没有任何动力去做质量把控。
那质量把控的成本去了哪里?答案是转嫁给了消费者。读者看到一篇AI Slop,需要花时间去阅读、判断它是否可信,如果发现不可信,还要再搜索其他来源,这个被浪费的时间就是隐性成本。再往深一步,平台也要为AI Slop付出算力和人力成本做过滤,搜索引擎要消耗额外的资源做排序调整,这些成本最终都会反映在产品体验上。一句话总结:AI Slop的制造者把质量成本转嫁给了所有人,自己赚走了流量收益。
2.2 信息获取侧的信任危机:搜索与推荐场景的实测数据
我们做过一次抽样测试:在某个主流搜索引擎里搜索20个高频生活类问题,统计搜索结果首页中“具有明显AI特征”的内容占比。结果让人非常不安——答案是占到了37%。也就是说,用户搜索一个问题,每三个结果里就可能有一个是AI批量生产的,信息可靠性完全没有保障。
更麻烦的是推荐场景。推荐算法对点击率高的内容有天然偏好,而AI生成的内容因为标题工整、结构清晰、配图好看,点击率在一开始往往不低。这就形成了一个恶性循环:算法把AI Slop推荐给更多用户,用户花了几秒钟发现内容很水,关掉页面,但系统已经记录了一次“点击”,并据此做出“这个内容受欢迎”的错误判断。等到算法通过用户留存数据校正过来时,这批Slop已经拿到了大量曝光。
2.3 知识库污染:企业场景里更隐蔽、更危险的AI Slop
如果说平台上的AI Slop是“一眼能看出的危害”,那企业私域知识库里的AI Slop就是“潜伏型危害”。很多企业这两年都在做内部知识库建设,把产品文档、客服问答、技术方案灌进系统里,再用AI做问答机器人。
这本身是好事,但问题出在数据源上:如果数据采集阶段没有做AI内容过滤,把网上爬来的AI生成内容也当作真实数据喂给了系统,那模型学到的就是“一本正经地胡说八道”。最典型的案例是某客服知识库,把网上关于产品功能的AI生成文章当成了官方说明,结果客服机器人给用户的回答有一半是错误的,最后用户投诉量暴增。
我见过不止一个团队在这个问题上栽跟头,根源就是他们低估了AI Slop在数据层的渗透能力。做知识库治理的同事常说一句话:垃圾进,垃圾出。AI Slop进了知识库,再想拎出来,成本是采集阶段的十倍不止。这也是我为什么在第三节要强调“先采集再清洗”——你要想洗干净,首先得能找出来它在哪里。
2.4 平台生态层面的劣币驱逐良币
最后说一个可能很多人已经感受到的生态问题。当一个平台上AI Slop泛滥,优质的真人创作者会逐渐流失。原因很简单:认真生产内容的创作者发现自己的作品被大量廉价搬运、模仿、洗稿,而平台的识别机制又跟不上,他们的流量和收益被明显稀释。创作者没傻到愿意用时间和精力去给算法“做慈善”,他们会选择去那些对内容质量有保护的平台。
这个流失是慢性的,但一旦发生就是不可逆的。很多平台在早期没有重视AI Slop治理,等创作者流失之后再来做内容生态修复,投入产出比已经完全不成正比了。治理AI Slop,本质上是在维护平台的生产力基础。
3. 治理框架设计:把数据治理的方法论搬进内容场景
AI Slop治理的复杂度跟数据治理本质上是一件事。数据结构化要经过采集、清洗、融合、质量评估,AI Slop治理同样需要这条链路。我在项目里直接把数据治理的方法论平移了过来,效果非常好,整个团队的沟通效率也高了很多。
3.1 为什么能借鉴数据治理:“数据质量”和“内容质量”是同一套问题
数据治理领域的核心原则是:你不可能治理你测不到的数据,也不可能清洗你采集不到的数据。“数据治理要先采集再清洗”不是一句废话,而是大量失败项目换来的教训——很多团队上来就想着用模型识别AI Slop,但数据源、采集口径、分类标准都没有定义,模型训练样本都不知道从哪里来,结果做成了一锅粥。
内容治理和它完全同构。你必须先回答三个问题:AI Slop的数据源有哪些渠道,这些渠道分别占比多少?用什么标准和标签体系来刻画一篇内容属于AI Slop?采集上来的数据如何清洗、如何反馈到治理策略里?这三个问题想不清楚,后面一切技术手段都是空中楼阁。
3.2 三层架构:采集层、清洗层、控制层
我在实际操作中把治理体系分成了三层,每一层的职责和目标都非常明确。
采集层是基础,核心是做“全量监测 + 特征标记”。在这一层,我们不治理任何内容,只是把所有内容打上特征标签:是否疑似AI生成、信息密度打分、多账号相似度指数、发布频次等等。采集层做到位了,治理就等于成功了一半。
清洗层是核心,负责对采集层标记出来的内容做分类处理。动作有四个:降权、去重、隔离、标注。降权是降低内容在搜索结果和推荐流里的排序优先级;去重是把相似度极高的同质化内容合并处理;隔离是把疑似内容集中放到一个不可见的待观察区,等待人工复判;标注则是给内容打上“AI生成”“疑似AI辅助”之类的标签。
控制层是保障,负责策略的实时调整和回流反馈。清洗层的每次处置结果都要回流到模型里,持续优化识别准确率,形成策略闭环。
3.3 画一条治理主线:从内容生产到用户消费的全链路
三层架构是静态的,真正跑起来还需要一条动态的主线。我把这条主线定义为“内容生命周期”——从创作者发布内容那一刻起,内容就开始经历采集、标记、清洗、排序、展示这五个节点,每个节点都要施加相应的治理动作。
内容发布后立即进入实时特征提取管道,计算AI特征分数(具体怎么算,我在第4节会展开)。分数低于阈值的正常放行,进入正常排序流程;分数处于中间区间的进入待观察池,由人工抽检,抽检通过后再放行;分数高于阈值的直接走降权逻辑,并且在后台记录,为后续账号级别的处置积累证据。
这套流程跑通之后,AI Slop对用户实际曝光的影响就能被限制在可控范围内。不需要100%精准拦截——这也不现实——只要把拦截率做到90%以上,内容的整体质量感受就会有显著提升。
4. 采集阶段实战:如何建立AI Slop识别体系
接下来是这篇文章的硬核部分。前面那些属于认知框架,这一段是可落地的工程方法。我先说结论:识别AI Slop,不要指望单一模型、单一指标能搞定,必须建立多维度的特征识别体系,让多个“弱信号”叠加成“强判断”。
4.1 文本特征识别清单:12条可直接套用的判定指标
我们团队在分析了大量正负样本之后,沉淀出一套文本特征识别清单,一共12项指标。每一项都是可以量化计算的,不是“看起来很AI”这种主观判断。
表格如下,包含指标名称、计算方式、AI Slop的典型表现:
| 指标 | 计算方式 | AI Slop典型表现 |
|---|---|---|
| 句长方差 | 对全文句子长度做标准差统计 | 方差过小,所有句子长度均匀整齐 |
| 连接词密度 | 统计“此外、然而、因此、总而言之”等出现频次 | 明显高于人工写作均值 |
| 高维词汇复用率 | 统计全文Top词汇的重复使用情况 | 高频词过于集中,缺乏变化 |
| 三段式结构得分 | 检测“开头引入-中间分点-结尾总结”的完整框架匹配度 | 结构极其规整,几乎没有变体 |
| 第一人称出现频率 | 统计“我、我们、我的”出现次数 | 显著低于人类作者均值 |
| 具体案例密度 | 检测是否包含时间、地点、人名、具体数值 | 极少出现具体细节,全是泛指 |
| 情绪词分布 | 统计表达强烈情感的词汇分布 | 情绪词极少,极度中性 |
| 知识覆盖面 | 对文章主题词做语义扩展,检测信息维度数量 | 维度单一,绕着一个点反复说 |
| 引文/参考链接数 | 检测文中是否有外部引用 | 几乎为零 |
| 段落间语义跳跃度 | 计算相邻段落的语义相似度 | 相似度过高,缺少逻辑推进 |
| 语言指纹一致性 | 同一作者历史文章的语言特征对比 | 与历史文章特征偏差极大 |
| 发布时间规整性 | 同一账号内容发布时间的间隔分布 | 间隔高度均匀,甚至固定秒数 |
注意,这12项指标中任何单独一项都不能作为判定依据。比如“第一人称出现频率低”也可能是受到文章题材限制的客观写作风格。但12项指标放在一起做加权打分,AI Slop的得分和人类写作的得分之间会有一个非常明显的区分带。
4.2 从指标到模型:加权打分模型的实现思路
有了12项特征指标,下一步就是把它们合成为一个可操作的“AI特征分”。我用一个相对简单的加权线性模型作为v1版本,模型公式是:
AI特征分 = w1×句长方差逆归一 + w2×连接词密度 + w3×结构规整度 + w4×(1-具体案例密度) + w5×(1-第一人称频率) + w6×段落语义相似度
每个特征先做归一化处理,让输出范围落在0到1之间,再根据特征的重要性配置权重。v1版本的权重我先主观设定,比如结构规整度给0.25,具体案例密度给0.2,连接词密度给0.15,其他指标均分剩余权重。引入一批人工标注过的样本做回归校验,反复调整权重,直到在验证集上能够达到90%的准确率。
为什么不一开始就用Transformer做语义分类模型,而是先用线性加权?原因很实际:线性模型可解释性强,运营团队看得懂,排查问题时有抓手。比如某个漏判的case被挖出来,看每个特征的分数就知道是哪个指标失准了,可以直接调整。换成深模型,你连调整的理由都不知道,这对初期迭代是致命的。
等规则模型稳定运行两三个月、积累了足够多的置信样本之后,再用这些样本去微调一个人工智能分类模型,用来兜底处理那些“规则没有覆盖到的新变种”。两步走的思路比一步到位稳妥得多。
4.3 半自动采集管道的搭建流程
识别体系建好之后,要把它嵌入采集管道里,让特征计算自动跑在内容生产线上。
我的建议流程是:内容入库后立即触发特征提取服务——从已发布的文章/帖子/视频文案中抽取文本内容——调用特征计算服务输出12项指标的具体分值——按加权模型计算AI特征分——进入路由判定模块。
判定路由有三个分支:分数低于0.35的进入正常内容池;分数在0.35到0.65之间的进入可疑池,按比例抽取5%做人工复核;分数高于0.65的直接进入治理动作队列。
这里有一个很多人会遇到的问题:算力开销。全量内容实时计算12项特征,对中小型平台来说压力不小。我看到过有人为了省算力,只采样热点内容做检查,结果大量长尾AI Slop漏了过去。正确的做法是分优先级:热门作者和热门内容实时全量计算,长尾内容降级为秒级异步计算。保证头部生态不被污染,同时把长尾内容控制在可控范围内。
4.4 边界案例:什么算AI辅助,什么算AI Slop
治理最怕的是一刀切,因为边界案例永远存在。我在这轮项目中整理了三个反复出错的场景,提前打好了补丁。
第一个场景是“AI润色是否算Slop”。我的判断标准是:看信息增量是否来自人类。如果一篇文章是人类提供核心事实、个人经验和数据,AI只负责润色句子,那这就不算AI Slop,甚至质量会优于大多数人类初稿。现实中很难自动区分,所以我们采用了“自证”机制——给创作者提供“AI辅助创作声明”选项,声明了的内容会被特殊标记,不参与Slop判定;不声明但被特征识别捕获的,从严处理。
第二个场景是多模态内容。很多AI生成内容其实是“AI生成文本 + AI生成图片/视频”的组合,单看文本判断不如纯文本场景准确。处理方式是把视觉特征也纳入识别链路。AI生成图片有天然的伪影特征——比如手部和文字的变形、光影不协调、物体数量异常——在图像上叠加一层AI检测模型,文本+图像双重打分后加权。
第三个场景是数据污染问题。同一个词在不同的平台语境里含义完全不同,“Slop”在一些小众社区甚至是被当作褒义词用的。应对策略是做“区域差异化阈值”,不搞全局统一标准,给每个内容分区配置独立的特征权重和判定阈值。
5. 清洗阶段实战:降权、去重、隔离与标注的四板斧
采集到疑似AI Slop之后,紧接着就是清洗。这一步很像缓存治理里的淘汰策略——你得决定哪些内容留下来继续提供给消费者,哪些要被淘汰出所有可见路径。我在这一节详细拆解清洗阶段最有效的四个动作,都有具体的实现思路。
5.1 检索结果里的降权策略:从“直接删除”到“排序后置”
关于降权,我的最大心得是:能不删就不删。原因有两个:一是误杀成本太高,删除了之后发现是优质内容,恢复身份的代价比降权大得多;二是删除会让生产者立刻感知到、去申诉,但这个感知是被动的,平台处理申诉还有人力成本。降权则温和得多,内容有流量,但排到了第6页,读者翻不到,创作者也未必能感知到减速的幅度。
具体到工程实现上,降权是在排序阶段对“AI特征分”施加一个负向因子。比如原来某个内容的排序得分是0.8,AI特征分是0.9,那加权后的最终排序得分大约会变成0.8×(1-0.9×0.5)=0.44,排名立即大幅下滑。这个0.5是调控系数,需要根据业务对“打击力度”和“误杀风险”的权衡来调参。
还要做时间维度上的“衰减隔离”。AI Slop内容的时效性偏弱,因为大部分是根据公开资料生成的,不依赖即时信息。基于这个特点,可以拉长它们的时间衰减曲线,让新鲜度权重对它们几乎不起作用,新鲜内容永远是人工编辑推荐的优先选择。
5.2 相似度去重:MinHash/LSH在AI Slop清洗中的作用
AI Slop有一个非常显著的批量特征:几十个账号发的内容虽然标题不同、开头结尾做了改写,但中间核心段落的语义几乎是复制的。这个特征可以用类似缓存击穿防护里的热点识别思路来抓取——找到那些“被大量相似内容刷屏”的热点主题,然后把同一主题下的内容做聚合,只保留最早发布或质量最高的一篇,其余全部降权。
工程手段上,我用的是MinHash + LSH(局部敏感哈希)组合来近似计算内容相似度。先对文本做分词,对每个词用哈希函数映射成64位哈希值,取一个文档中多个最小哈希值组成签名向量,再用LSH将相似文档聚拢到同一个桶里。这样两篇内容哪怕只是段落级改写,签名向量的相似度也会很高。实测下来,这个方案能发现很多肉眼难以察觉的“伪原创”内容。
加上一个基于embedding向量的语义相似度模型做二次校验,把精确度提到99%以上。为什么不用embedding相似度一步到位?原因是全量两两比对的算力开销是O(n²)级别的,在内容量大的平台根本跑不过来,而MinHash+LSH可以把复杂度降到O(n)。
5.3 内容分池:给“待观察区”设一个缓冲区
我在前面的采集管道里提到了可疑池,这里具体展开它的运作机制。
可疑池的核心作用是“隔离”,让不确定的内容先不暴露到主要流量池,同时给我们争取到人工复核的时间。我把它细分成三个子池:灰池(轻度可疑)、黄池(中度可疑)、红池(高度可疑)。不同子池对应不同的曝光策略。
灰池的内容可以正常展示,但不会进入热门推荐、搜索Top10等核心位。系统每7天自动复检一次,如果近期没有新的Slop特征出现,就把它转正到正常内容池。黄池的内容只能在“关注流”(粉丝可见)中展示,不能被搜索到,也不能进入任何公共推荐位。红池的内容直接进入隔离状态,所有用户不可见,必须人工复核后决定是恢复还是移除。
这套设计参考了缓存治理中“分级缓存”的思想——你不是要把所有数据都放到最高速的缓存里,而是让不同置信度的内容停留在不同级别的存储中,根据命中率动态调整。
5.4 来源标注:透明度是最好的治理杠杆
最后一个清洗动作在业界存在争议——是否强制给AI生成的内容打上“AI生成”标签。我个人的结论是:要打,但不要强制。平台可以提供标注,同时给标注了的内容一些保护性政策激励。
原因是透明度其实是最好的治理杠杆。如果创作者自己声明“本文使用了AI辅助”,读者可以用完全不同的心态去评价内容,恶意感会大大降低;平台也可以据此调整流量分配,优先把真人创作的原创内容推向更需要可信度的场景,把AI辅助的内容限制在低决策成本的信息消费场景里。
为了鼓励标注,我给标注了的内容保留了正常的流量权利,不因为标注本身降权,同时定期公布“AI标注率”的数据报告,让整个生态有一种集体参与治理的共识感。这套做法在社区里收到了不少正面反馈,很多创作者反馈说标注后反而更愿意认真校准内容了,因为名字和AI绑定在一起,质量不好会被用户追着骂。
6. 源头治理:从“抓晚”到“抓早”,让Slop不再产生
降权和去重解决的是“已经产生的AI Slop”,但纯靠事后清理是永远不够的。AI生成内容的成本太低了,你今天清理一万篇,明天AI可能生成十万篇,永远跟不上节奏。治理一定要从下游走到上游,尽量在源头上减少AI Slop的产生动机和扩散路径。
6.1 创作者侧的约束与激励:用规则而不是封禁来塑形
对待个人创作者,我的经验是先立规矩、再给激励。直接封禁会造成对抗情绪,甚至把创作者推到对立面去,他会想办法绕过检测继续生产,只是换了一种更隐蔽的方式。
登录和内容发布时明确提示“平台不支持纯AI生成内容,AI辅助创作需明确标注”,这既是规则教育,也是给后续治理提供依据。除了约束,还要给替代方案——平台官方提供“AI辅助创作”模板,里面的结构可以辅助创作者做内容框架,但每个章节都要求填入个人经验和真实数据。这样一方面降低了创作者使用AI的门槛,另一方面也保证了产出内容的质量下限。
我观察到一个值得注意的对比:仅仅靠封禁打击的团队,Slop量在封禁期显著下降,封禁一停马上反弹;做了创作者教育配合官方工具引导的团队,Slop量则是稳步下降的,这说明行为塑形比恐吓驱逐有效得多。
6.2 平台流量分配逻辑:切断Slop的收益来源
AI Slop的生产者之所以愿意投入精力去做这件事,根本原因是它有收益——有流量就有广告分成,有曝光就能导流。你从识别和清理端使劲,永远不如从收益端下手更釜底抽薪。
我在流量分配策略上的调整是:顶部流量进一步向“有来源的内容”倾斜——原创且带有个人经验的文章,获得更高的初始曝光权重;泛泛而谈的通用型内容,不管人工还是AI生产,都很难进入核心流量池。这等于把所有内容都拉到了同一套质量标准线上进行竞争,AI Slop失去了“结构性套利”的空间。
给创作者明确的收益预期比一刀切更有价值。如果平台明确公开了内容质量分的主要影响因素,创作者就有明确的路线图去优化自己的内容。很多人是不知道怎么做好,而不是故意想做坏。
6.3 企业知识库的准入原则:进库前必须过“三关”
如果你是企业知识库的管理者,前面的内容很多是针对内容平台的,但这一部分是专门为你写的。知识库场景没有搜索排名那套机制,没有流量池可以降权,它的AI Slop问题只能靠入库前控制来解决。
我制定了三关准入原则,效果不错:第一关是“来源关”,只有来自官方文档、内部审批过的技术方案、已验证的问答记录三类来源的内容才能直接入知识库,网络爬取内容必须经过人工审核。第二关是“作者关”,每个内容入库时都要绑定一个具体的负责人,没有负责人的内容不入库——因为出了问题你找不到人确认事实,知识和谣言就是在这里分界的。第三关是“验证关”,入库后的前三个月,每条内容要被至少三个用户提问尝试验证,验证通过率低于60%的内容自动打回重审。
这三关看着简单,但执行起来需要知识库工具的支持。我建议所有做企业知识库的公司都在工具层面加上这段流程,否则光靠纪律约束,时间长了肯定会走样。
6.4 治理的持续迭代:用北极星指标量化治理进度
最后说一个治理团队常见的毛病——凭感觉判断“这周Slop好像少了一点”。这样没法迭代。你必须把治理结果变成数字,用数据说话。
牵引全链路的北极星指标是“有效内容率”,计算公式是:用户在搜索结果或推荐流中点击并停留超过30秒的内容,占所有推荐展示内容的百分比。这个指标直接反映用户对内容质量的真实感受,比单纯的“AI特征分均值”有用得多,因为它是从用户行为端反向验证治理效果。
辅助指标还有四个:AI特征分均值、可疑池转化率(可疑内容最终被确认是Slop的比例)、人工复核时长、创作者申诉率。每次迭代之后观察这几个指标的变化方向,就知道策略改动是有效还是无效。有一个重要的提示:申诉率不是说越低越好,如果申诉率高而且申诉成功率高,说明你的误杀率上来了,需要调整判定的严格度。
写这篇东西的时候,我正在做新一轮策略迭代。AI Slop这个对手很有意思,它每次都是跟着模型能力同步进化的,上一轮有效的识别特征,下一轮就被生产端学会了规避。靠单一静态方案一劳永逸是绝对不现实的,必须保持一个持续对抗的节奏。我在这个项目里最深的体会是:AI Slop治理的本质不是消灭AI内容,而是重新校准内容生态中“生产难度”和“信息价值”的匹配关系。不要指望它能被根除,把目标定在稳住内容质量底线、让用户不用每次都得“剥开AI的壳去找肉”,这个方向就是对的。