这个项目我做了半年,名字就叫“AI元人文:元探索”。起因特别简单:当时我已经能用AI快速生成各种文章、脚本和课程大纲,但生成得越多,越发现自己只是在重复已有的知识。真正缺的不是内容,而是一套能让我不断追问“为什么要写这些”“这些东西之间有什么关系”的元层方法。所谓元人文,不是又造一个新学科词,而是把人文研究本身当作研究对象,用AI去观察、拆解和重组;元探索,则是对这套观察与拆解过程的持续迭代。这篇文章就是想把这半年的实操经验完整记录下来,从概念、选型、工作流到避坑清单,给正在做AI+人文、AI内容创作或教育设计的同行一个可以直接参考复现的样本。
1. 元人文不是新造词:它是被AI逼出来的问题
1.1 当内容生产不再稀缺,稀缺的变成了什么
传统人文研究的路径很清晰:提出问题、阅读文献、形成论点、写成文章。这个过程里最耗时的部分是阅读和整理,一个人要做到“下笔有出处”,往往要泡很久图书馆。我做比较文化类内容时,过去写一篇东西光背景资料就要啃两三个星期的书,然后才能动笔。
AI改变的是这条链路的起点。现在打开对话框,让模型生成一份“东西方时间观念差异”的综述,十分钟内它能给你十个不同版本,每个版本都逻辑自洽、引经据典。这时候我才意识到,内容生产不再稀缺了,稀缺的变成了“提出好问题的能力”和“判断什么值得深挖的判断力”。你看同一个主题,AI能给你“东方循环时间观更注重过程”的版本,也能给你“西方线性时间观更容易产生现代性焦虑”的版本,还能给你“农业社会与工业社会的时间感知差异”的版本。哪一版值得继续投入写作精力?这已经不是工具问题,而是元层面的判断问题。
所谓元人文,就是在面对这些选择时,不急着让AI替我做决定,而是先追问:我为什么需要知道这些?我的读者在这个话题上真正的困惑是什么?哪些差异是真实的文化差异,哪些只是模型从训练数据里统计出来的刻板印象?这就像学摄影,快门按下去很容易,难的是决定为什么要按下快门、站在什么位置按。AI把人从繁琐的拍摄操作中解放出来,反而让“取景框”这个元层能力变得更加关键。
1.2 项目雏形:把“探索”本身变成研究对象
“元探索”这个词,是我在整理自己的AI交互记录时想到的。那时候我每天会跟AI聊大量问题,从文化比较到教育设计,聊完就完了,没有沉淀。有一天我翻聊天记录,发现一星期之内我问了AI很多关于“效率”的问题,却几乎没有涉及“公平”“幸福”“意义”这类价值问题。这个发现吓了我一跳——我的提问倾向在不知不觉中变得很窄,而我完全没意识到。
于是我把这个项目设计成两层结构。第一层是用AI完成具体的人文探索任务,比如生成文献综述、设计课程大纲、拆解叙事框架;第二层是持续记录和分析我自己的探索过程,包括我提了什么问、为什么选这个方向、如何筛掉不合适的生成结果。第二层就是“元探索”,它不直接产出内容,它产出的是关于“我如何探索”的认知。
这个设计看起来抽象,落地之后却很实用。比如我会在每次重要AI交互之后,写一段几百字的探索日志,内容包括三个问题:我这次想解决什么问题?我给了模型哪些限制?我因为什么理由选定了最终方案?攒到几十条之后,再让AI帮我归纳这些日志里的共性。结果很有价值,它把“我感觉自己很努力”变成了“我原来一直扎堆在某些类型的问题上,其他类型长期被忽略”。这就是元人文的核心动作:把隐形的思维惯性变成可见的数据,再拿这些数据校准下一次探索。
2. 为什么选择AI Agent而不是单个AI应用
2.1 单点工具和Agent工作流的本质差异
项目刚开始时,我用的都是单点AI工具:聊天窗口、写作助手、画图软件。每个工具单看都能出活儿,但连起来用就发现问题:我让一个模型生成了文献综述,再让另一个模型点评这段综述,这两个环节之间是没有记忆和配合的,所有背景都要重新传一遍,上下文经常丢失。更麻烦的是,每个模型只回答当前问题,不会主动质疑前一步的目标设定。
后来我转向AI Agent的思路。打个比方:单点问答像是你打电话给一位什么都懂的朋友,你问一句他答一句,但这位朋友不记得你上一通电话聊了什么,也不知道你为什么问这个;Agent工作流则像你组织了一支项目小组,有人负责查资料,有人负责唱反调,有人负责整理纪要,而且小组共享一份项目文档,每个人都知道眼下的目标和边界。
我给自己的项目搭的是一个很轻量的多AI协作流程。没有用复杂的智能体平台,而是用提示词给不同模型分配固定角色,再通过一个简单的“会议纪要”文档同步信息。这样做的好处是灵活,模型换谁都能跑;坏处是需要自己维护流程。如果你不想从头造轮子,也可以使用市面上成熟的多智能体框架或支持工作流的AI平台,但核心逻辑是一致的:让多个AI角色在同一目标下协作,而不是每次从零开始。
2.2 人文问题为什么更需要多视角协作
人文问题天然没有唯一答案。问“什么是好的教育”,可以有进步主义、保守主义、批判理论、功利主义等多种回答。如果你只用一个AI模型、一种提示词,它通常只会给你一个经过调和的主流答案,听起来正确,但没有对话感。这在内容创作里特别要命,因为好的人文内容恰恰需要张力和争辩。
我做了一套简易的多角色方案:一个AI扮演“文献综述者”,负责给出主流观点和出处;一个AI扮演“观念批判者”,专门攻击前面结论中的漏洞;一个AI扮演“跨文化比较者”,负责引入不同文化语境下的例子。它们面对同一个问题,但输出面向完全不同。我作为人类主持人,把三份输出放在一起对比。很多单看很顺的结论,在对比之下立刻显出问题。
举个例子。我让AI讨论“AI是否应该参与文艺创作”。文献综述者给出的是行业报告里的趋势判断;观念批判者直接指出,这些报告都建立在“作品产出效率”的指标上,根本没有衡量作者主体性被弱化的风险;跨文化比较者则补充了东亚和欧美在“作者”概念上的认知差异。三份材料拼在一起,我就不需要再去搜几十篇文章才能得到一个立体的图景。这个过程也证明了一个判断:AI Agent的价值不在单个回答的质量,而在它能帮你组织一场多角度的思想交锋,而这正是人文探索最需要的。
| 维度 | 单点AI问答 | Agent工作流 |
|---|---|---|
| 上下文记忆 | 依赖单次对话,容易丢失 | 多角色共享目标与背景 |
| 视角数量 | 通常单一 | 可配置多个对立视角 |
| 验证能力 | 较弱,没有交叉审查 | 可设计相互批判环节 |
| 流程复用 | 每次重新开始 | 可沉淀为标准流程 |
| 对人判断力的依赖 | 低,容易盲从 | 高,人负责最终裁决 |
选型这件事我踩过几次坑,后期总结成一句话:不要因为某模型“聪明”就长期锁定它,人文工作流的结构稳定性比模型智商更重要。模型更新很快,今天最好用的明天可能就被超越,但一个美观的“多方辩论+交叉验证”流程可以持续用很久。
3. 从元问答到元验证:搭建一条四条腿的AI人文工作流
3.1 第一步:用AI拆解研究问题,而不是直接索要答案
很多人的习惯是让AI直接生成一篇文章,这种用法放在Agent工作流里是不合格的。我更愿意把第一步定义成“问题拆解”。比如我最近想写一篇《AI时代的人文教育应该教什么》,一开始根本没想清楚,问题又大又虚。我给AI的提示词是这样写的:
请把“AI时代的人文教育应该教什么”拆解成至少六个可操作的子问题。 每个子问题需要包含:能力目标、知识领域、可观察的评价方式。 不要给答案,只给问题框架。这看起来很简单,作用却很关键。AI生成的子问题里有一项是“如何设计一种不被AI分数绑架的评价方式”,这个视角我之前完全没想到。如果直接让它写文章,它大概率会写出一篇工整的“人文教育重要性”综述,而不是这种值得继续深挖的问题。
问题拆解完之后,我会把六个子问题作为项目文档发给所有AI角色。这一步相当于给整个Agent工作流定了地图。没有地图就分头行动,多角色协作一定会各说各话。有了地图之后,每个角色的工作范围明确,交叉验证也就有了坐标。
3.2 第二步:多源生成与“元假设”记录
执行阶段,每个AI角色拿到同一个子问题,但被要求从不同立场出发回答。这里要强调一点:人文探索不能只看正文内容,还要看内容背后的“元假设”。比如一个AI说“人文教育应该强调批判性思维”,它的元假设可能是“信息过剩的时代,筛选信息的能力最重要”;另一个AI说“人文教育应该强调共情”,它的元假设可能是“技术越发达,人际关系越稀缺”。
如果只收集答案,你会觉得两边都有道理,然后陷入选择困难。所以我在流程里增加了一个强制步骤:每个角色除了给出观点,还必须单独提交一段“我这样说的前提假设是什么”。这样一来,观点的分歧就显化成前提的分歧,而不再只是结论打架。判断力也用到了刀刃上——你不是在“好的回答”和“坏的回答”之间选,而是在“不同的价值前提”之间进行有意识的定位。
实际执行时我通常开三个对话窗口,分别粘贴相同的项目文档,但把最后一行提示词换掉。文献综述者的提示词是“请以尽量客观的语气综述现有研究”;观念批判者的提示词是“请从你站立的立场出发,攻击这个主流观点的漏洞”;跨文化比较者的提示词是“请补充至少两个非西方语境下的案例,检验这个结论的普遍性”。
3.3 第三步:交叉验证和第四步:人工定稿
交叉验证是这套工作流里最容易被忽略、也最值得花时间的环节。做法很简单:把三个角色的输出汇总,再让一个新AI角色或同一个模型换上一个“裁判”身份,按以下清单逐条审查:事实性信息有没有证据?论证过程中有没有偷换概念?有没有把一个文化的局部现象当成普遍规律?有没有混入模型自己编造的内容?
我习惯把交叉验证的提示词做成固定模板。模板里还会要求“如果发现可疑信息,请明确说‘这里需要人工核对’,不要含糊带过”。这样得到的审查报告可以直接变成我的待办清单。它可能挑出很多问题,但这些问题比我自己通读三遍更容易定位。你别说,这一招在刚开始用的时候效果惊人,AI居然能发现自己另一条回答里隐藏的偏见,比如一个讲“西方思维更理性”的论断,在换角色之后自己指出这个论断忽视了非西方知识体系里的逻辑传统。
完成以上三步,才轮到人工定稿。我不会跳过这一步,因为AI擅长生成“合理”的文本,但“合理”不等于“负责任”。哪个问题值得写进文章、哪种价值立场愿意署名承担后果、哪些例子需要重新核实,这些只能由人来决定。我的快捷键是:AI负责提供选项和检验选项,人负责选择选项并为选择负责。这四条腿缺了哪一条,工作流都会跑偏。
4. 实测一年后的避坑清单:幻觉、版权和“正确但无用”
4.1 幻觉问题的完整排查链路
有一次我在写一篇关于“礼物交换”的文化比较文章,AI给出一个听起来很典的人类学案例,还标注了出处。我当时多留了个心眼,让它“给出这个案例所在的书名和章节页码”,它立刻开始编造。页码倒是有模有样,但书名始终对不上。这就是幻觉的典型表现:表面流畅,细节经不起追问。
我的排查链路现在已经固化成四步。第一步先怀疑,凡是模型给出的具体名称、数字、引文,默认按“可能不存在”处理。第二步做隔离变量测试,把同一句话里的核心事实提出来,换个说法重新问模型,看它是否前后一致。第三步要求它“如果无法确认,请直接回答不确定”,把默认的“自信模式”关掉。第四步再引入搜索增强或知识库工具,让AI只基于给定的资料回答。经过这四步,大部分幻觉都能被挡在工作流外面。
我还发现一个更省力的办法:在给AI的提示词里写明“禁止编造出处,如果无法追溯到可核实的来源,请用‘多项研究提示’这种模糊表述,并标注需要人工核实”。这个提示词能显著减少假引用的出现。当然,人依然是最终责任人,尤其是涉及真实文化案例时,我会手动把关键条目放到学术数据库里做二次检索。
4.2 版权和原创性的处理原则
AI生成内容是否算抄袭,学术界和内容平台还没有统一结论,但在实操层面我给自己定了几条规矩。第一,AI生成的文本当作“素材”而不是“成品”,不直接发布未修改的长段落。第二,用“改写重组+加入个人经验”的方式处理模型输出。第三,涉及直接引用他人观点时,只把这些观点当作线索,顺着线索去查原文再引用。
我做过一次实验:让AI逐字复述一篇经典文章的段落,它做得非常接近原文,这种输出我直接丢弃。因为哪怕技术上没有版权问题,内容生产者的底线也不应该是一键复制。元人文的立场应该是“用AI放大自己的思维,而不是替代自己的思考”。所以在我给AI的提示词里,通常有一句“请用你自己的语言表达观点,不要引用现成的长段落”。效果不是百分之百,但至少能降低整段复制的概率。
4.3 “正确但无用”的AI文本:为什么最坑
比幻觉更隐蔽的坑,是AI生成那些极度正确、极度完整、但完全没有观点和温度的文本。它可能引用了所有主流观点,句式工整,逻辑严密,但你读完之后不知道作者想说什么。这种“正确但无用”的内容,传播出去损害的是作者的可信度。
你会发现这种文本的共同特点是:全篇形容词和抽象概念很多,缺少具体的人和具体的事件。诊断方法很好用:把每一段里的名词找出来,如果名词全是“思想”“价值”“文化”“逻辑”这层级别的,多半就是没落地。我的对策是在提示词里加硬性要求:“每个段落必须包含至少一个可反驳的判断句,并且必须举一个具体的例子,可以是虚构的但需要有细节,比如人物、地点、时间。”
这个规则的改变是立竿见影的。AI开始给出“在某个县城中学,教师用AI批改作文,结果把学生一篇关于家庭离异的文章打回重写,理由是‘不够正能量’”——这样的细节会让讨论瞬间变得有血有肉。虽然例子是模型编的,但它承担的是“思想实验”的功能,不是事实陈述,这反而让人文讨论更接近真实。所以遇到“正确但无用”的文章,别只顾着修改措辞,要回到提示词层面增加约束。
5. 元探索的实际产出:我用这套方法做成的三件事
5.1 从AI素材到可发布的科普长文
我用工作流完整写过一篇《当AI遇见“时间”:四种文化时观》。最初是让AI生成东西方时间观念差异的综述,这一步没什么新鲜的。真正让文章脱胎换骨的是元层动作:我要求AI把“线性时间观”和“循环时间观”看作两个各怀目的的叙述者,而不是两个客观分类,然后让它们互相辩论。结果文章的结构就变成了“时间的辩论”,而不是一个干巴巴的知识列表。
接下来所有AI生成的素材都被我打散重组了。我加入了一个在采访中听到的真实故事:某位老手艺人用“做一件家具要多久”来拒绝智能工厂的订单,他说“机器一夜就能做一百把椅子,但我想让这椅子陪我二十年”。这句话成了文章的核心切口,AI生成的所有材料最后都围绕这个人的生活态度重新组织。文章发布后收到的反馈明显比过去那些“知识罗列型”文章好很多,因为读者记住的不是概念,而是具体的人。
5.2 AI辅助设计一门人文课程的大纲
第二件事是设计“AI人文实验室”的课程大纲。我把课程目标定义为“帮助学员用AI探索自己和他人理解世界的差异”,但一开始我也不知道这门课应该怎么排。我让AI按五个完全不同的人才培养思路各生成一份大纲:工具能力型、文化比较型、批判反思型、创意表达型、社会行动型。拿到五份大纲后,我没有“综合它们的最好部分”,因为那样会变成一个大杂烩。
我用了一个关键筛选指标:哪些单元能让学员在15分钟内获得“认知翻转”,就是那种“原来还可以这样看问题”的瞬间。按照这个标准,课程最终保留了“用AI模拟另一种价值观”“多AI角色辩论一个社会议题”“分析自己的提问日志”三个模块。这三个模块恰好都是我后来在实际项目中验证过有效的。AI在这里真正扮演的是白板上的候选方案,而不是权威决策者,最后选什么、怎么排序,仍然由课程设计者的价值观决定。
5.3 AI漫剧和短剧的叙事框架推演
第三件事有点跨界,我把这套工作流用到AI短剧的叙事开发里。刚开始想做一个关于“未来城市记忆”的八集短剧,主创团队几个人头脑风暴了好几天,故事线始终走不出套路。后来我把角色设定、核心冲突和目标观众画像给AI,让它同时生成三个完全不同的叙事走向:一个偏向悬疑、一个偏向情感、一个偏向社会思考。
更有意思的是,我让AI干了一件传统编剧很少做的工作:为三个人物分别写“内心价值说明书”,解释每个人在冲突中的核心恐惧和渴望。这个步骤让角色不再只是情节工具。然后我再让AI模拟这三个人物就某一个情节决策开会,看他们会怎么吵起来。很多戏剧冲突就是这样生成的,比硬写反转自然得多。这套方法后来也用在短视频分镜的文案策划里,虽然产出形式不同,底层的多角色模拟逻辑却是同一套。
6. 下一步:让AI参与“元探索”本身
6.1 把探索过程变成可分析的日志
做完了上面的事,我意识到一个之前没想明白的问题:元探索不能只靠人肉追踪。于是我开始把每一次AI交互的重要节点记录下来,包括原始问题、筛选标准、选定的生成结果和弃用的原因,攒成一份结构化日志。然后我让AI定期分析这份日志,找出我的提问盲区。
第一次分析的结果非常有意思:我发现自己在做文化比较时,总倾向于选择“东西方对立”的框架,很少涉及“周边文化圈内部的差异”;在讨论教育问题时,我经常提到“批判性思维”,但几乎不提“知识积累”。这些盲点不是我故意忽略的,而是我的思维惯性在起作用。AI做这件事并不比人更聪明,但它可以不知疲倦地把几十条日志放在一起看,找出人类会习惯性忽略的模式。
6.2 用测试开发思路给提示词建立评测集
为了不让“元探索”停留在玄学层面,我引入了测试开发的思路。过去写代码要给函数写测试用例,现在的提示词也一样。我建立了一个小评测集,里面包含十个固定的人文问题,横跨文化、伦理、教育、艺术等方向。每次调整提示词模板,我就把评测集完整跑一遍,然后按照明确性、立场清晰度、事实可核实度、案例具体度和可读性五个维度打分。
这套做法听起来很笨,但它真的能让人进步。我试过把同一套评测集在温度和模型参数变化时各跑五遍,记录每次输出的稳定程度。有些提示词单看一次效果很好,跑五遍以后会发现立场漂移特别严重,前一遍还是某个观点,后一遍就完全站到了反面。通过简单统计,我就能定位哪些提示词需要补充“立场锁定”的指令。这比纯靠感觉调prompt要靠谱得多。
6.3 元探索的循环,和我最终的体会
项目做到现在,我对“AI元人文”的理解慢慢成形了。它不是一个固定答案,而是一个持续循环:设定问题,用AI生成多元素材,通过交叉验证排除风险,人工完成价值判断,再把整个过程的记录拿回去喂养下一轮提问。每一步都在让思考变得更可见、更可校准。
我个人最深的体会是:AI不会让人文思考变廉价,反而会让好的思考变得更贵。因为它释放了那些繁琐的生产环节,让真正决定内容高度的元层能力被推到聚光灯下。也许未来AI能做到的事越来越多,但“为什么要做”“为了谁而做”“用什么价值标准来判断”这些问题,始终要留给人回答。元探索这条路没有终点,我现在也还在研究怎样才能让AI更准确地识别我提问中的盲区。如果你也在做类似的项目,欢迎从一个小问题开始记录你的探索日志——坚持一个月后再看,你会对自己的思维惯性感到惊讶。