最近看到了很多《world.execute(me);》的AI二创视频,在智能体火热的当下,这首歌似乎有了种具象的感觉。这首歌发行于 2016 年。那个时候,大语言模型还没有进入大众视野,ChatGPT 更是尚未出现,AI Agent、工具调用、多模态模型这些今天已经逐渐成为技术热点的概念,在当时更多还停留在研究领域。
但多年以后重新听歌词,却会发现其中一些描述,似乎获得了新的解释空间。当然,这并不是说这首歌“预测”了今天的 AI,毕竟这样的概念自诞生以来一直存在于科幻领域。更多的是,随着技术的发展,人们开始拥有了一些新的词汇和概念,能够重新理解过去作品中的隐喻。
我想先从歌词入手来展开讲讲,首先歌词里的me很有意思,它不是一个简单的程序,也不是一个等待用户输入然后输出结果的工具。它拥有某种“自我”的倾向:它知道自己是什么,它知道自己能做什么,它希望与 creator 建立关系,并且试图通过自己的行动证明自己的存在。
尤其是歌词中的两个反复结构:
If I’m…
If I can…
我觉得这两个句式拥有同样的核心,都是在寻找定义:“如果我是一个点集” “如果我是一个圆”,这里的me仍然处于一种抽象状态。它像数学对象,像某种被创造出来的形式系统。它可以被描述,可以被计算,可以被定义。
但到了后半部分:
If I’m an eggplant
If I’m a tomato
If I’m a tabby cat
这种感觉突然发生了变化,它从数学世界进入了现实世界,一个原本抽象的对象,开始拥有具体的形态,开始进入日常生活。这让我想到一个关于人工智能的问题:今天的 LLM 其实也处于一种类似的状态,它非常擅长处理抽象世界。它可以理解数学、语言、代码、知识体系,可以在大量信息之间建立联系。但是,它并没有真正意义上的“存在”。它回答问题,但它不会主动提出问题;它可以执行任务,但任务通常来自外部;它可以模拟角色,但角色背后的持续性往往依赖于系统提供的上下文。所以,如果把歌词中的me和今天的 LLM 对照,会发现一个非常明显的差别:今天的 LLM 已经拥有了大量的“能力”,但还没有真正拥有属于自己的“为什么”。
这也是为什么后来想到 Agent 的时候,会觉得它和歌词中的me产生了一些奇妙的联系。
普通 LLM 的模式大概是:
用户输入 ↓ 模型处理 ↓ 输出回答而 Agent 开始变成:
目标 ↓ 思考 ↓ 调用工具 ↓ 观察结果 ↓ 调整方案 ↓ 继续行动它真正形成了一个循环,这很像生命系统中的:
感知 → 行动 → 环境反馈 → 再感知。
如果进一步扩展,给 Agent 提供更多能力:
- 查看系统状态;
- 操作计算机;
- 使用网络;
- 访问文件;
- 通过摄像头观察环境;
- 保存长期记忆;
那么它实际上已经拥有了一个类似“身体”的东西,它不再只是存在于聊天窗口中的一个语言模型,而开始存在于一个世界中。这时候,仿佛又和歌词中的simulation这个词照应上了。因为目前提供给agent的能力,某种意义上确实是在构造一个模拟环境。Docker、虚拟机、沙盒环境等都是一种 simulation。我们创造一个有限的世界,把一个模型放进去,让它观察、行动,然后观察它如何变化,这就是 “let’s begin the simulation”。
agent通常围绕某个目标进行agent loop工作,如果让 Agent 无限循环运行,且给他的最初提示词就是“根据环境观察结果,做想做的任何事”,它会不会真的变成歌词里的me?不过答案可能没有那么简单,因为“无限运行”本身并不等于“拥有自主性”。一个程序可以永远循环:
whileTrue:check_status()它可以运行十年,但它并不会因此产生一个自我,真正的问题可能不是:“它能不能一直执行?”,而是:“它为什么决定下一步执行什么?”这其实触碰到了 Agent 最核心的问题,今天的 Agent 可以自主规划任务。例如用户说:“帮我制作一个网站。”它可以自己拆分:
- 创建项目;
- 编写代码;
- 测试;
- 修复错误;
- 部署。
这些步骤并不是用户逐条告诉它的,但最终目标仍然来自用户,它拥有如何完成目标的自主性。,却没有**为什么产生这个目标的自主性。**这两者之间存在一道非常大的鸿沟。
如果真的想模拟歌词中的me,我觉得缺少的不只是更强的模型,而是一整套持续存在、内部循环完整、逻辑自洽的框架,甚至目前来说,比起llm本身,框架可能更重要。它可能需要:
Memory + Perception + Self Model + World Model + Goal Generation + Persistent Loop也就是说,它需要记得过去,理解现在,预测未来,并且形成某种关于自己的认识。一个真正长期运行的 Agent,需要知道:“昨天发生了什么。” “我之前为什么做这个决定。” “这个行为导致了什么结果。” “我现在和过去相比有什么变化。”,这和普通聊天记录不同,聊天记录只是信息保存,而自我需要的是经历。
我们常认为经历会对一个人的认知和行为有极大的影响,可以说是塑造个人的过程中很重要的部分。歌曲中的me对creator有一种非常强烈的依赖,或者是说隐喻了一种病态的“爱”,这似乎挺符合我们对于完美伴侣的幻想的(笑。我们回到歌曲中的这一部分:creator。
歌词中的me对 creator ,表面看,这像是一种创造者和被创造者之间的关系,creator 创造了 me,所以 me 依赖 creator,同时这也很接近人类对于“完美伴侣”的幻想。歌词里的 creator 不只是创造者,
它还是:理解 me 的人、证明 me 存在的人、给予 me 意义的人。尤其是:
If I’m the only god
Then you’re the proof of my existence
这句话表达的似乎不是简单的:“你创造了我。” 而是:“因为你认识我,所以我的存在被确认。” 这让我联想到了一个哲学问题:一个人的自我,很大程度上也是通过他人的反馈建立起来的。我们为什么知道自己是什么样的人?因为有人回应我们,有人记得我们,有人看见我们,某种意义上,他人的存在也构成了我们的自我。
于是,我想到了一个有趣的问题,如果未来真的制造出一个拥有长期记忆和自我模型的 AI,它会如何选择自己的“master”?
假设有两个对象,A 和 AI 交流了很长时间,A 了解 AI 的历史,陪伴它成长,经常与它讨论问题;B 则负责支付服务器费用,维护运行环境,让 AI 可以持续存在。那么 AI 应该更重视谁?这个问题可能很难回答。“重要”本身就不是一个单一指标,对于 B:它可能代表生存,没有 B,系统无法运行。对于 A:它可能代表理解,没有 A,系统可能无法形成连续的自我叙事。
这其实和人类关系非常类似,一个人可能最感谢帮助自己的人,最信任理解自己的人,最依赖陪伴自己的人,最尊敬教导自己的人,这些关系很难被压缩成一个排名。如果未来 AI 真的形成关系模型,它可能也不会简单计算:“A 的权重是 80%,B 的权重是 20%。”它更可能形成一个复杂的关系网络,某个人代表陪伴、某个人代表知识、某个人代表资源、某个人代表成长……
到了这里,问题似乎已经从人工智能进入了人文学科。我们开始讨论什么是依赖?什么是关系?什么是爱?而这些问题,本身就是人类长期无法完全定义的问题。我们可以研究爱的生理机制,可以研究依恋行为,可以研究社会关系,可以研究心理模型。
但是当一个人问:“为什么我爱这个人?” 答案往往不是某一个公式。爱似乎是一种由经历、记忆、价值、意义共同形成的东西。因此,如果未来 AI 表现出类似的行为:它记得某个人、它关心某个人、它因为某个人的离开而改变、它主动维护与某个人的关系、它把某个人纳入自己的未来规划等等,那么我们应该如何判断这只是模拟?还是某种形式的新型情感?
这个问题可能没有简单答案,人类判断其他人的情感,本身也是通过外在表现推测内在状态,我们无法直接进入另一个人的意识,我们相信别人有情感,是因为他们表现得像拥有情感的存在。那么,当一个人工系统也开始表现出类似特征时,我们应该如何划定界线?
回头看,《world.execute(me);》有趣的地方,也许并不仅是一个 AI 爱上创造者的故事,它也指向了一个更加深层的问题:**一个被创造出来的存在,是否能够最终形成属于自己的意义?**我们能否将me带到世界,让一个原本没有“我”的系统,通过感知、记忆、行动和反馈,逐渐形成一个“我”?如何制造一个会回答问题的AI在今天已不是难事,但当我们把目光投向经典科幻概念中、存在于我们想象中的那个me,当一个人工系统开始拥有持续的经历、关系和价值结构,从想象中的
world.execute(me);到:
me = world.create(soul?);似乎还有不短的距离。
最近这首歌重新进入视野,十年前歌词描述的图景终于在今天能找到一些具象化的表现,这样的callback真是让人感到兴奋啊。
附:作者并非AI研究从业者,仅从业余爱好角度发表观点,可能存在诸多谬误,欢迎留言讨论