我有个做音乐制作的朋友,每次在DAW里处理鼓组的MIDI轨时,都有一个近乎固执的习惯:把军鼓、踩镲的音符逐个拖离量化网格,往前后偏移十几到几十毫秒。他跟我说过一句我记到现在的话:"太正的节拍没有呼吸,鼓机打出来的东西就是这样,它有力度,但没有灵魂。"
这句话放在今天的LLM(大语言模型)身上,几乎可以原封不动地平移。我们批评AI生成的文章"没有灵魂""一股AI味",本质上和上世纪乐手嘲讽第一批鼓机"机械、死板、没有人情味"是同一件事。这个话题已经被讨论了很多轮,但大多数讨论都停在"AI有没有灵魂"这种哲学判断题上,真正值得问的是另一层:为什么鼓机挨过的骂,今天原样落在了LLM头上?以及在承认"机器没有灵魂"的前提下,创作流程里还能不能把人的灵魂装回去?
这篇文章不打算替AI辩护,也不打算搞技术焦虑营销。我想做的是把"灵魂"这个词拆成可操作的成分,用鼓机的历史当镜子,结合我自己的真实使用经验,聊聊LLM写作的真正边界在哪,以及一个普通写作者、内容从业者,怎么在这种工具面前保住自己那点"人味"。
1. 鼓机挨过的骂,正是LLM正在挨的骂
1.1 "没有灵魂"到底是谁的问题
1970年代末到80年代初,Roland TR-808、TR-909这些经典鼓机陆续进入市场,当时主流音乐圈的反应和今天不少人面对ChatGPT的反应几乎一模一样:音色太假,节奏太死,没有现场演奏的呼吸感。乐评人写稿嘲讽它们是"会打拍子的洗衣机",录音室里的老牌鼓手觉得自己被一台机器冒犯了。你去翻当年的音乐媒体,能翻出一堆措辞激烈的评论,核心论点只有一句话:鼓机没有灵魂。
但结果我们都知道了。TR-808不但没被骂退场,反而成了嘻哈、电子、流行音乐的地基音色。很多经典唱片里的鼓组声音,一听就是808出来的。问题来了:同一台机器,为什么在有人手里是"死板的节拍",在另一些人手里就成了能定义一代审美的音色?
答案在用法。早期制作人直接把鼓机的出厂预设拍进轨道,音量、时值全部均匀,连力度都是同一个值,听起来当然像节拍器。后来制作人开始用"人性化"功能,给每个音符加随机的时值偏移和力度变化,或者在录音时干脆关掉量化,让鼓手用MIDI键盘"弹"出鼓点,再把这些不完美的音符循环成Loop。同样是那台机器的声音,但因为去掉了"完全均匀"这个出厂设置,律动感就出来了。
鼓机还是那台鼓机,变的不是设备,是人怎么对待那些音符。
1.2 "均匀"是原罪,不是技术问题
这个例子放到LLM上,对照关系非常工整。LLM的默认输出是什么?是平均分配的段落长度、完备的逻辑结构、每段都有的中心句、恰到好处的转折词、立场温和的结论。"完整、均匀、正确、无意外",这是语言模型被训练出来之后的本能表现,就像鼓机出厂时的完美量化。
但我们人类判断一段文字"有灵魂",用的恰恰是另一套标准。我们喜欢作者在某个段落里忽然不按套路出牌,喜欢一句短得突兀的话砸在长段落之后,喜欢一个偏离主题的私人细节忽然冒出来。这些特征本质上都是"不均匀"——信息密度不均匀、节奏不均匀、情感浓度不均匀。而LLM最擅长的事情就是消除不均匀。
所以"AI没有灵魂"这个批评,技术上是不准确的。准确的说法是:LLM生成的原始内容,天然处于一种"过分均匀"的状态,而"灵魂感"几乎必然来自对均匀状态的偏离。鼓机没有灵魂的真相不是它打不出好节拍,而是它默认打出的节拍无人修改;LLM没有灵魂的真相不是它写不出好文字,而是它默认写出的文字未经人类的选择与偏移。
1.3 鼓机幸运的地方,LLM其实也具备
再往下想一层,鼓机当年从"被嘲讽的对象"变成"经典设备",依赖的制作人是一批真正懂节奏、有审美的音乐人。他们把机器当作一个新的乐器,而不是"自动完成工作"的工具。这个条件放在LLM这里其实已经变得更好了——LLM比鼓机灵活得多,它可以接受不断修改,可以被喂入大量个人语料,可以被要求模仿任何一种风格,甚至可以和人类进行几十轮对话式的迭代。
问题只在于,今天大多数人的用法还停留在"给一个prompt、生成一版、直接拿来用"的阶段。这就像当年直接把鼓机出厂预设录进轨道,完全跳过人的处理环节。你会发现那些批评AI写作"没魂"的人,绝大多数没有做过任何形式的二次编辑,没有试过把生成内容的节奏打破再重组,也没有尝试过用自己的写作习惯去反驯模型。
工具本身没有变,变的是使用它的人与流程。这一点是这篇文章后续所有讨论的总前提。
2. 把"灵魂"拆开看,它其实是五种可操作的成分
要继续往下谈,就不能让"灵魂"停留在玄学层面。我花了很长时间去观察那些让我觉得"有感觉"的文字到底特殊在哪,最后拆出了五个可以单独拿出来检验的成分。这五个成分不依赖任何文艺理论,直接用实际操作就能感知到。
2.1 微观不均匀性:人味的物理基础
回到鼓机的例子。真人鼓手每一次击打军鼓,力量、角度、时值都有微小的区别,正是这些小区别构成了所谓的Groove。你如果把这些偏差全部抹平,得到的就是机械节拍,技术上无懈可击,听感上却索然无味。
文字里对应的微观不均匀性是什么?是句子长度的起伏。一段由五六个长度相近、结构相似的句子组成的文字,读起来会非常"平";而一段夹杂着长句、短句、甚至单字句的文字,即使内容完全相同,阅读节奏也会完全不同。你去看公认文笔好的作家,几乎没有谁会连续五句用同一个句式写下去。
LLM的问题恰恰在于,它的默认输出非常容易陷入这种均匀句式。因为训练数据里被反复强调的"好文章"往往结构规范、逻辑工整,模型学到的是"每种句式出现概率大致相当"的稳妥策略。这不是它不会写短句,而是它默认不这么做。要让输出有人味,第一件事就是主动打破句长分布的均匀性。
2.2 非对称信息密度:注意力不该被平均分配
第二个成分是信息密度的分布。人类写作时,注意力天然是不均匀的——某个细节可能被放大成整整一段,另一个同样重要的背景却一句话带过。这种取舍本身就有强烈的个人色彩。
举个例子,同样写一场雨,一个作者可能花三百字描写雨滴打在窗户上的声音,另一个作者只用一句"那天雨很大"带过,然后把大量篇幅放在人物的对话里。这些取舍没有标准答案,但它们决定了文字的气质。
LLM的问题在于,它默认会用一种"均衡分配"的模式处理信息。给它一个话题,它会条件反射地把背景、现状、问题、解决方案、注意事项全部展开,每个部分篇幅相近,详略完全一致。这种"周全"看起来很专业,但也恰恰是最没有记忆点的——没有任何一个部分被真正放大,也没有任何一处显得真正重要。
真正的操作方式应该是:先确定这一篇文章只想让读者记住一个点,然后刻意只放大那个点,其他部分全部压缩。这种"偏科"式信息分配,是LLM很难自己完成的,因为它默认的奖励函数里"全面覆盖"的权重太高了。
2.3 呼吸感:结构层面的留白
呼吸感比微观节奏更大一层,它说的是整个文本的起承转合里,有没有留出让读者"喘气"的位置,以及有没有在合适的地方突然停下来。
听音乐的时候,真正让人情绪被调动的不只是密集的音符,还有休止符。节奏密集到顶点后突然全停一拍,那种张力比任何连续的轰炸都更强。文字也一样:一个长篇论述中间突然出现一行孤零零的短句,或者整个章节戛然而止不再展开,这种结构上的留白会让读者自己完成情绪的补全。
LLM生成的内容在结构上倾向于"闭环"——每个话题都给出完整的起承转合,段与段之间都用过渡句衔接,结尾处习惯性地总结全部观点。这种习惯在功能性文档里是优点,但在创作型的文字里,它每次都替读者省掉了"自己发现"的乐趣。
呼吸感的建立不需要大改,只需要两步:去掉一部分过渡句,让段落之间出现一些意义上的跳跃;在某个充分展开的部分之后,故意让下一部分收得很短,形成明显的松紧落差。这个操作逻辑和制作人把鼓组某一记军鼓整个去掉、让节拍突然空掉一拍,完全是一回事。
2.4 语境化意外:不完美的叙事亮点
爵士乐手管那种"弹错了但刚好好听"的音符叫"盲鸡"(chicken note)。一个精确执行每一个音符的演奏没有意外,也就没有惊喜。文字创作里也有很多"漂亮的错误"——语法有问题但传达出了准确的情绪,逻辑不完整但留下了悬念,观点偏激但恰恰击中了要害。
LLM在训练时被反复校准去避免"错误",它的输出在语法和逻辑上的正确率极高,但代价是几乎不会出现任何在标准之外形成美感的偏离。这就是为什么很多AI生成的文章读起来"对",但不对味——它太正确了,正确到没有任何一个地方能让你停下来想一下。
要获得这种意外,最可靠的办法不是让模型自行产出,而是在生成后由人类刻意引入。一段原本写得滴水不漏的论证,删掉某一个论据,让结论显得有些跳跃;一段原本措辞审慎的评价,换上一个更果断、甚至更武断的词。这些小修改在标准意义上都是"错误",但在阅读体验里,它们是让文字活起来的关键。
2.5 个人印记:超越单篇内容的身份指纹
最后一个成分不完全在单篇内容里,它横跨一个人所有的输出。你听一个打了二十年的鼓手演奏,哪怕只给了他一小段节拍,你也能认出那是他;你读一位作家的一篇短文,可能隔两段就知道作者是谁。这种识别度来源于一个人重复出现的句式偏好、惯用意象、独特的联想路径。这就是个人印记。
LLM在默认状态下最大的问题不是不会模仿,而是它没有稳定的身份。同一件事,你问它两遍,它会给你两篇倾向一致但没有统一风格的文章——它更像一个能力很强但从来不带个人偏好的"匿名文体家"。这种匿名性会稀释一切内容的气质。
解决办法是在创作流程里建立"偏好指纹":把你喜欢用的一些句式、经常出现的意象、反复涉及的观点记录下来,每次生成之前固定地把这些信息喂给模型。它不是让模型变成你,而是用你的选择持续校准模型的默认方向,让输出逐渐向你的射程靠拢。
3. 同一个LLM,两种生成方式,两种质感
理论拆解再多,不如拿实际案例说话。我先后在同一个LLM上用两种完全不同的方式生成同一主题的短文,主题定为"城市夜晚"。第一轮我直接用了一个宽泛的prompt,第二轮用了我自己摸索出来的一套"鼓机思路"。两轮之间的差异,能很清楚地展现上述五个成分在真实输出里的表现。
3.1 第一轮:直接生成
我输入的是:写一篇关于城市夜晚的短文,800字左右。
得到的输出是标准的AI模板:以"城市夜晚有着不同于白天的魅力"式句子开头,分成三个左右的段落,分别讲霓虹灯光、街头小吃、晚归的心情,再用一个"人们在这座城市的夜晚找到各自的温度"式的总结收尾。段落之间都有承上启下的过渡句,每段都有一个鲜明的中心句,措辞挑不出明显的毛病,情绪总体温和、正向、鼓励。
问题也很明显:没有任何一个细节是具体的。霓虹灯是哪种颜色的霓虹灯?街头小吃在哪条街?晚归的人是刚刚下班还是要赶火车?原稿全部没有回答这些问题。这就是非对称信息密度的反面——它把所有可能的细节都推平铺开,每个话题都点到,哪个都没展开。
句式也一样,几乎每隔一两句就出现一个四字成语式的对仗表达,读起来像一份印刷精美的城市宣传册。谈不上不好,但也谈不上记住。
3.2 第二轮:鼓机式的偏差介入
第二轮我换了一种做法。我先给模型输入了一段非常具体的"个人坐标":视角是便利店夜班店员,他每天凌晨两点准备下班时,习惯站在收银台后隔着玻璃门看马路对面的写字楼,整篇文章只围绕这一个动作展开,不允许添加其他场景。然后我追加了两个结构性的约束:全篇只用四个自然段,除第一段外,其余三段必须一段比一段短;结尾那句不允许做任何总结,必须写一个与全文无关的、具体的物象。
这一次的输出有了明显的气象变化。视角变得聚焦,所有描述都围绕玻璃门和写字楼的灯光展开;四段的节奏从长到短,形成一种逐步收紧的推进感;结尾落在一盏熄灯后还在闪的白色应急灯上,没有解释,没有升华。整个文本仍然带有AI的用词习惯,但气息已经完全不同——它是"一个人站在某个位置看到的物理景象",而不是"一篇介绍城市夜晚的文章"。
可以说第二轮里微观不均匀性(段落长短)通过约束被强行注入;非对称信息密度(所有注意力倾注到单一场景)通过视角设定被强制实现;呼吸感和语境化意外则来自结尾"不总结、只呈现物象"的硬性要求。模型的能力没有变化,变的是我对生成结果的塑造程度。
3.3 五维差异对照表
为了方便看出两个版本的差别,我列一个对照表,对应的是上面拆解的五个成分:
| 维度 | 直接生成 | 鼓机思路生成 |
|---|---|---|
| 微观不均匀性 | 句式整齐、段落平均 | 通过约束人为制造长短落差与收束节奏 |
| 非对称信息密度 | 全话题均匀铺开 | 单一视角、单一场面、彻底聚焦 |
| 呼吸感 | 段落间靠过渡句平滑连接 | 段落间留出跳跃,结尾拒绝总结 |
| 语境化意外 | 几乎无偏离,角度温和 | 结尾以独立物象制造跳出感 |
| 个人印记 | 无,匿名宣传册风格 | 视角与约束自带人格化倾向 |
这张表的结论也很直接:模型的默认输出可以被理解为"出厂设定",而人的工作就是像制作人处理MIDI音符一样,对它的输出做系统性的人为偏差。不要指望LLM自己产生灵魂,而是通过人的操作,把灵魂的各个组件装进生成流程。
4. 让"人"回到创作流程里:一套可复用的工作方法
把前面这些观察落实成操作,我自己试下来比较有效的是下面这套流程。它不复杂,但每一步都要求人亲自介入,正是这些介入动作构成了"灵魂"真正发生的地方。
4.1 先选立场,再让模型输出
绝大多数人用LLM写作的第一步是描述主题和字数,这是最大误区。主题是公共的,立场才是私人的。在让模型写之前,先确定这篇内容要站在哪个位置上——不是"讨论城市夜晚"这样中性的立场,而是"我认为凌晨两点的便利店是城市里唯一不说谎的地方"这样有偏向的立场。
一个实用的办法:先让模型列出十个"关于这个主题最常见的陈词滥调",然后从里面选出一个你最想反驳的,把反驳姿态作为整篇文章的锚点。这一步做完了,后面生成的文本才可能天然地带有人味,因为它不是一个无身份的信息梳理,而是一个带着观点的表达。
4.2 生成后必须做"人类化"调整
拿到模型的初稿后,先不急着看内容对不对。打开文档,做几个固定的机械动作:
- 删掉所有的过渡句("值得注意的是""与此同时""总的来说"这类词一律清理)
- 把最长的那个自然段拦腰截断,让它在半路停下
- 把全文最后一句话的总结功能去掉,换成一个具体的、不解释的物象
- 在任意一个你觉得"还可以再展开"的段落后面,故意不再展开
这套操作本质上就是鼓机里的humanize功能——对过于均匀的音符时间线施加微小的偏移和破坏。模型生成的文本是严格量化的,这几个动作就是在为它加入"摇摆感"。做完这些修改,哪怕不改动任何实质性内容,文本的阅读气质也会有肉眼可见的变化。
4.3 建立一份"偏好指纹",摆脱匿名性
在多次迭代过程中,把暴露你自己特征的内容记录下来。哪些句式是你写东西时一定会用的,比如"我从来不觉得""事情往往不是表面那样";哪些意象是你反复使用的,比如"雨天""旧玻璃""深夜便利店";哪些话题立场是你绝对会坚持的,哪些是你完全不想碰的。
积累到一定程度后,把这些偏好整理成一段固定文字,在每次生成前作为"风格前置"喂给模型。它的作用不是让模型完全模仿你,而是让输出从一个匿名文体家的默认状态,迁移到你的坐标系里。
我见过很多抱怨"AI写的东西太千篇一律"的人,根本问题不是模型不够强,而是他从未在生成流程里留下过任何自己的痕迹。
4.4 三个容易走偏的误区
这套方法用久了,也有几个坑需要提醒:
第一,不要把"灵魂"寄托在更精细的prompt上。Prompt只是设置初始条件,它不能替代生成后的选择和修改。我见过有人花几个小时设计一个巨长的prompt,最后得到的文本依然没有生气——因为那一整段复杂的参数里,没有任何人造的偏移动作。
第二,不要追求"完全不像AI"。如果一个人为了消除所有AI痕迹,把文本改得扭曲生硬、满是花哨的修辞,那反而是另一种灾难。灵魂感来自于选择,不是来自修辞表演。关键是让文本有你的立场、你的节奏、你的取舍,而不是拼命抹掉机器的印记。
第三,不要在创作的一开始就把判断权全部交给模型。很多人让模型不断修改,直到"我自己觉得满意了"为止——但你如果不说清楚你满意什么,模型只会越来越平稳、越来越正确地滑向中庸。人的责任是给每次迭代提供方向:保留哪个意外、强化哪个断裂、删除哪个平滑。
我自己现在处理大部分文字工作时,已经默认使用这套流程。老实说,效率上比"一次性生成直接使用"要慢,但它值得。那一点慢下来的时间,是你和文本建立关系的时间,是你把一段信息变成自己表达的时间。鼓机的制作人每一个音符地拖动人声,也在做同样的事——慢,但是活。
最后说一句个人体会。每次看到"AI没有灵魂"这种论断,我都不太想争论。因为从使用者的视角来看,这个说法只在一种前提下成立——你完全放弃了对输出的干预。机器确实没有灵魂,但创作从来不是机器一个人的事,它是人和工具之间反复拉扯的结果。鼓机到今天依然没有灵魂,但用鼓机做出来的音乐,可以拥有创作者全部的体温。
所以下一次你听到"LLM没有灵魂",可以换一种回应方式:不替它辩解,也不点头认输,而是打开编辑器,把第一段生成的文字,手动移开几毫秒。