连接之躯,符号之魂:人工神经网络中隐性代数结构的因果涌现
耶鲁大学(Yale University)、约翰斯·霍普金斯大学(Johns Hopkins University)、纽约大学(New York University)和微软研究院(Microsoft Research)联合发表名为《The Emergent Symbolic Structure of Artificial Neural Networks》的论文,这篇文章通过对不同规模的神经网络及其内部机制的研究,探讨了人工智能系统如何在基于连续向量的运算中实现传统认知科学所定义的符号结构。研究人员利用名为DISCOVER的分析方法,证明了包括大语言模型(LLMs)在内的多种模型,其内部表示都可以被数学上的张量积表示(TPRs)精确近似。通过在算术、逻辑、代码和语言等典型符号领域进行实验,研究发现这些模型在处理信息时,实际上是隐性地将填充物(元素)与角色(位置/结构)结合在一起。这种近似方法不仅在多种架构和任务中表现出极高的准确性,还允许研究人员通过精确干预模型内部表示来引导其行为。总之,该研究为调和现代人工智能的向量本质与人类智能的符号逻辑提供了一个关键的科学视角。
该论文通过创新的解释方法,探讨了人工智能领域的经典谜题——绑定问题(Binding Problem):即神经网络如何仅通过连续向量来表示和处理复杂的、结构化的符号信息。
核心观点
- 涌现符号结构假设(Emergent Symbolic Structure Hypothesis): 尽管人工神经网络(包括大语言模型)的显式表示是连续的高维向量,但它们的内部特征在深层中隐式地实现了符号结构。模型通过无监督地学习,在内部自发收敛出了一套类似于认知科学中张量积表示(Tensor Product Representations, TPRs)的数学框架。
- 多架构与大规模的通用性: 这种隐式符号结构的形成具有高度的普适性。它不仅存在于简单任务训练的多层感知机(MLP)、循环神经网络(GRU)中,也广泛存在于标准 Transformer和瓶颈 Transformer(Bottleneck Transformer)中。更重要的是,它在大规模、通过自然语言数据训练的 7 个主流开源大语言模型(LLM)中同样自发涌现。
- 因果行为控制与功能等价: 利用DISCOVER方法,研究者可以用一个完全透明、可解释的闭式 TPR 代数方程来逼近并替代神经网络中的黑盒向量表示。实验证明,替代后模型的行为几乎不发生改变,并且通过对该 TPR 方程的符号级编辑(成分手术),能因果地、精准地操控神经网络的输出行为。
- 系统性的变量绑定: 神经网络中的位置(角色,Roles)和具体词汇(填充物,Fillers)并不是以孤立、原子的“概念对”形式存储的(例如“cat-as-subject”),而是采用了系统性的绑定机制。这使得 DISCOVER 能够完美泛化到其在训练期间从未见过的“新填充物-新角色”组合。
- 科学哲学上的极限主义(Limitivism): 在认知科学中“消去主义”(完全用连接主义替代符号)和“实现主义”(认为大脑只是符号系统的硬件实现)的长期争论中,本论文支持极限主义观点。即神经网络在极限状态下逼近精确的符号系统,但在实际运行中,它们只是近似地、带有一定容错(或噪声)地实现了符号表达,这让模型兼具了符号的系统性与连续特征的统计模糊性。
关键数据与实验结果
论文设计了极其详尽的实验,在字母列表处理、大语言模型上下文重构、以及大语言模型复杂符号计算三个层面上提供了坚实的数据支撑:
1. 字母列表操纵任务(复制/逆序/交叉合并)
- 超高拟合准确率:在对 MLP、GRU、Transformer 的特征向量逼近中,双向位置角色方案(Bidirectional Role Scheme)表现最为优异。除了逆序瓶颈 Transformer 达到了最低的平均近似准确率97.3%外,其余所有架构和任务的拟合精度都超过了 99%。
- 无结构任务的对照:当任务变为完全不依赖输入顺序的字母排序(Alphabetical Sorting)时,模型退化为使用无结构的词袋(Bag-of-words)表示,证明了结构编码是由任务的结构化需求驱动的。
2. 大语言模型(LLM)句末句号向量解码
研究人员分析了7 个 LLM(包括 Gemma-3-27b, GPT-2-XL, GPT-OSS-20b, Pythia-12b, Qwen3-14b, OLMo-2-13B, Llama-3.1-8b)在不同深度的句号 Token 向量对前面句子的编码能力:
- 主宾结构完美重构:对于“主语-动词-宾语”(SVO)结构的句子,用 DISCOVER 构建的 TPR 逼近向量喂入句号解码器,在所有 LLM、所有层上均达到了100% 的完美解码准确率。
- “符号净化”效应(Limitivism 的强力证据):在复杂句子重构中,使用 DISCOVER 的 TPR 逼近向量作为输入,句号解码器输出的准确率竟然显著高于使用 LLM 原始激活向量。例如在 GPT-OSS 的中间层上,给解码器原始 LLM 向量的还原准确率为71%,而输入由 DISCOVER 纯化后的双向 TPR 向量时,还原准确率飙升至96%。这表明大模型内部的确以 TPR 结构存储信息,但夹杂了噪声,而 DISCOVER 完美提取并去除了这些高维噪声。
3. GPT-OSS 的 4 大符号领域与因果干预
研究人员耗费了超过 3000 个 GPU 小时(在 H100 和 H200 上)对 GPT-OSS 展开了极其密集的剖析:
- 任务特异性表示的拟合:在算术、三段论、代码执行、被动语态转换、时态变形和疑问句转换 6 大任务上,任务特异性(Task-specific (all))角色方案拟合精度最高,其与 GPT-OSS 自身表现的差距最大仅为 2.36%(算术任务中)。
- 成分手术(Causal Interventions)的高精确度:
- 横跨 6 个任务的31 种因果干预实验(如通过修改向量直接在模型内部将
3 + 6 * 8篡改为8 + 6 * 3)平均行为控制准确率达到了90.3%。 - 具体到某些任务:算术干预准确率为97.8%;在时态变形任务中,移动句中的修饰成分,其形容词移动准确率为98.0%,介词短语移动准确率为89.2%,关系从句移动准确率为95.8%。
- 横跨 6 个任务的31 种因果干预实验(如通过修改向量直接在模型内部将
- 正则化对 OOD 泛化的绝对影响: 在验证模型是否具有系统性的变量绑定时,引入L2,1L2,1 正则化对提升未见过的“填充物-角色”组合泛化表现起到了决定性作用。例如,在 Interleaving 任务的瓶颈 Transformer 中,正则化使未见对的泛化准确率从54% 提升到了 97%;在 Llama-3.1(第16层)的句子实验中,正则化更是将准确率从0% 暴拉至 90%。
https://arxiv.org/html/2608.29530v1