news 2026/8/18 14:22:41

Reasoning with Latent Thoughts — On the Power of Looped Transformers——基于潜在思维的推理:论循环Transformer的力量

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Reasoning with Latent Thoughts — On the Power of Looped Transformers——基于潜在思维的推理:论循环Transformer的力量

《Reasoning with Latent Thoughts: On the Power of Looped Transformers》的核心是系统性地论证了循环Transformer(Looped Transformer)在推理任务上的巨大潜力,并挑战了“强大推理能力必须依赖海量参数”的传统观念。

以下是文章的全面总结与核心观点概括:

1. 核心主张(四大论点)

论文通过理论分析和大量实验,提出了四个环环相扣的核心主张:

  • 主张1:许多推理问题“要深度,但不要参数量”。 像加法、多步回溯、数学推理这类任务,本质上是迭代算法,因此用同一组参数(小模型)循环执行多次(大深度)就能高效解决,无需增加参数总量。

  • 主张2:在语言模型中,循环模型具有“偏向推理”的归纳偏置。虽然循环模型的困惑度(Perplexity)和记忆型任务(如闭卷问答)表现不如同FLOPs的大模型,但它在推理型任务(如数学题、开卷问答、推理基元)上的表现却出奇地好,甚至能超过同FLOPs的大模型。

  • 主张3:循环模型能生成“潜在思维”并模拟CoT。循环的每一次迭代都相当于一次隐含的“思维步骤”,且可以并行处理多个潜在思维。理论上,循环模型可以用 T 次循环精确模拟 T 步的思维链(CoT)推理。

  • 主张4:受循环启发的正则化能提升推理能力。通过正则化让普通模型的各层权重趋于相似(即逼近循环模型),可以在不牺牲困惑度的前提下,继承循环模型的推理优势。

2. 实验验证与关键发现

3. 理论支撑(第5节)

  • 群组合问题:证明了一个1层循环Transformer用 ⌈log⁡2n⌉ 次循环就能最优地解决n个群元素的组合问题,深度上界与非循环最优模型一致。

  • 通用模拟定理:任何具有 R 个不同层的非循环Transformer,都可以被一个1层循环Transformer模拟,且深度相同、参数量更少。

  • p-hop问题:结合上述定理,证明循环模型可以在 O(log⁡p) 深度内解决p-hop问题,匹配非循环模型的理论下界。

  • 模拟CoT:严格证明循环模型可以通过掩码机制,在 m 次循环中精确模拟 m 步的思维链推理。

4. 主要贡献与创新点

  1. 视角转换:将循环模型从“参数共享的压缩技术”重新定位为“实现深度推理的自然范式”。

  2. 实证发现:首次在大规模语言模型上系统揭示了循环模型在推理与记忆任务上的显著表现差异。

  3. 理论奠基:为循环模型在若干代表性推理任务上的深度最优性提供了严格证明。

  4. 实用工具:提出了一种简单有效的正则化方法,可直接应用于现有模型提升推理能力。

5. 局限与未来方向

  • 推理范围有限:实验主要覆盖了符号推理、数学和结构化任务,对更开放的常识推理、多模态推理的适用性尚待验证。

  • 归纳偏置的根源:为何循环或权重共享会带来“偏向推理”的归纳偏置,目前仍是一个开放问题。

  • 潜力展望:作者认为循环模型是“推理时扩展”(Inference-time Scaling)的一种极具前景的实现方式,未来或可像CoT一样,通过增加循环次数来动态提升模型在困难问题上的表现。

这篇论文有力地证明了“深度”和“参数量”可以解耦——通过循环利用同一组参数,小模型也能获得大深度带来的推理能力,并在理论和实验上为“循环模型即潜在思维”这一观点提供了坚实支撑。这里是自己的论文阅读记录,感兴趣的话可以参考一下,如果需要阅读原文的话可以看这里,如下所示:

摘要

大型语言模型已展现出卓越的推理能力,且规模定律表明,大量的参数,尤其是沿深度轴的参数,是其主要驱动因素。在这项工作中,我们提出了一个更强的主张——许多推理问题需要较大的深度,但不一定需要大量参数。这为循环模型在推理方面开辟了一个新的应用。首先,我们表明,对于许多合成推理任务,如加法、pp -跳归纳和数学问题,一个 k 层Transformer循环 L 次的性能几乎与一个 kL 层的非循环模型相匹配,并且显著优于一个 k 层模型。理论结果进一步证实了这一点,表明许多此类推理问题可以通过迭代算法解决,因此可以使用具有近乎最优深度的循环模型有效解决。也许令人惊讶的是,这些好处也转化到了语言模型的实际设置中——在许多下游推理任务上,一个 k 层循环 L 次的语言模型可以与一个 kL 层的语言模型竞争,甚至更好。事实上,我们的实证分析揭示了一个有趣的现象:循环模型和非循环模型表现出的扩展行为取决于它们的有效深度,类似于思维链(CoT)推理的推理时扩展。我们通过证明循环模型隐式地生成潜在思维,并且可以用 T 次循环模拟 T 步CoT,进一步阐明了与CoT推理的联系。受这些发现的启发,我们还提出了推理与记忆之间一个有趣的二分法,并设计了一种基于循环的正则化方法,在这两方面都有效。

1 引言

语言模型在解决需要强大推理能力的问题上显示出巨大潜力,例如数学、编程、常识推理和逻辑谜题(Brown et al., 2020; Team et al., 2023)。这激发了人们对开发技术以改进更难题目的推理能力的兴趣(Wei et al., 2022b),并启发了关于Transformer如何执行推理的理论研究(Feng et al., 2024; Sanford et al., 2024a)。推理能力通常在更大的语言模型中涌现(Wei et al., 2022a)——这与各种规模定律(Kaplan et al., 2020; Hoffmann et al., 2022; Allen-Zhu & Li, 2024)相一致,这些定律表明语言模型的性能非常依赖于模型大小(即参数数量),而与其他架构设计选择的关系较小。然而,最近的工作开始质疑这一观点。Ye等人(2024)认为,推理的规模定律更为微妙,除了参数数量外,深度也非常重要——在相同的参数数量下,更深但更窄的模型更好。这与传统规模定律的智慧有所偏离,但直觉上是合理的,因为推理问题通常需要多步骤的组合思维,因此深度可以发挥关键作用。

在这项工作中,我们提出了一个更强的主张——虽然深度很重要,但许多推理问题不一定需要大量参数。如何用大深度但少参数来解决推理问题?我们认为循环模型非常适合这一点,其中相同的函数,使用少量参数进行参数化,被迭代地应用于输入。这引出了我们的第一个重要主张:

主张1:许多推理问题需要深度但不一定需要参数。也就是说,它们可以通过循环模型解决。

主张2:对于语言建模,循环模型具有偏向于良好推理的归纳偏置,尽管其困惑度和记忆能力不如等FLOP的非循环模型。

对于上述主张,我们再次在因果语言建模上训练一个 (k⊗L) 循环模型,并将其与等参数 (k⊗1) 和等FLOP (kL⊗1) 非循环基线进行比较。虽然循环模型比等参数基线有所改进,但也许并不令人惊讶的是,它的困惑度最终比等FLOP基线差,因为困惑度强烈依赖于参数数量。然而,下游评估揭示了一个有趣的趋势:循环模型倾向于改进需要推理的任务,其程度远大于记忆任务。具体来说,循环模型的推理性能更接近等FLOP基线,有时甚至超过它,尽管参数少了 LL 倍且困惑度更差。预训练指标和下游指标之间的这种对比行为近来已成为研究课题(Saunshi et al., 2022; Liu et al., 2023),并归因于不同架构和训练算法引入的归纳偏置。我们的实证分析还揭示了一个有趣的现象:下游任务的准确性随有效深度的对数而扩展。特别是,更多的循环会提升性能,并且循环的相对益处对于需要更多推理的任务更高。这在概念上类似于CoT的推理时扩展,但以循环为核心组件。为了进一步阐明循环模型与CoT的这种有趣关系,我们提出以下主张。

主张3:循环模型生成潜在思维,并且理论上可以模拟CoT推理。

请注意,CoT推理通过在答案之前生成多个思维令牌,为模型提供了更多时间和计算资源,并推动了像O1和DeepSeek的R1这样的“思考”模型的推理时扩展范式(Guo et al., 2025)。我们对CoT推理做了一个观察——它本质上是一个每次迭代生成1个思维令牌的循环模型。然而,循环模型似乎强大得多,因为它们可以在每次迭代中生成多个潜在思维。我们将这种直觉转化为一个关于循环模型如何模拟CoT推理的理论结果。

受这些发现的启发,我们提出了一种正则化方案,旨在利用循环模型向推理的归纳偏置。这引出了我们的最终主张:

主张4:受循环启发的正则化可以利用这种归纳偏置来实现更好的推理。

在这些主张的背景下,我们具体介绍本文的贡献如下:

  • 在本文中,我们研究了循环模型——具有权重共享的多层模型——及其在推理中的作用。特别地,我们将 k 层模型循环 L 次(表示为 (k⊗L))与等参数的 (k⊗1) 非循环模型(k 层)和等FLOP的 (kL⊗1) 模型(kL 层,参数多 L 倍)进行比较。

  • 我们在第2节中对合成推理任务(如加法、p -跳归纳和GSM风格的数学应用题)进行了实验。对于这些任务,我们惊讶地发现,尽管参数少得多,等FLOP的循环模型几乎可以匹配或超越非循环模型。支持这些实验的是,我们在第5节中提出了理论结果,解释了为什么循环模型能够以近乎最优的深度解决此类问题。

  • 在第3节中,我们在10亿参数规模上训练了用于因果语言建模的循环模型。在这里,我们表明循环模型具有在推理基准上表现良好的归纳偏置,尽管其困惑度要差得多。这一发现是新颖的,因为大多数关于循环的先前工作更关注困惑度指标而非下游推理任务。我们通过可视化训练过程中困惑度与下游性能的关系图来验证这种归纳偏置。此外,我们表明循环模型在各种基准上随着循环次数的增加表现出良好的扩展行为,类似于CoT推理。最后,我们表明循环模型与草稿本结合可以模拟思维链推理。

  • 受这种归纳偏置的启发,在第4节中,我们提出了一种鼓励各层之间更相似的正则化方法。我们发现使用这种正则化进行训练继承了循环模型向推理的归纳偏置,而不影响困惑度。

2 简单推理任务上的循环模型

2.1 简单推理问题的实验

表2:左图。符号化的 i-GSM 问题及其解答。右图。第2节中 i-GSM 任务上循环和非循环模型的准确率。 (k⊗L) 循环模型显著优于等参数 (k⊗1) 模型,并且与非循环等FLOP (kL⊗1) 模型表现一样好。

3 使用循环模型进行语言建模

在本节中,我们预训练并评估用于因果语言模型的循环模型。我们在Pile数据集(Gao et al., 2020)的250B个令牌上训练模型,并针对大多数实验使用24层10亿参数模型,其动机来自Tay等人(2022)中的设置(更多详情请参见附录A.2)。

3.1 10亿参数语言建模实验

评估指标。我们在训练完成后评估模型的困惑度指标。由于越来越多的证据表明,困惑度虽然在训练中非常有用,但却是衡量模型质量的一个狭窄指标,我们还跟踪更全面的下游评估(Liang et al., 2023)。因此,我们在4个重要方面评估模型:闭卷问答、开卷问答、数学应用题和推理基元。这些总共包含19个不同的任务。

表3:在Pile数据集上训练的语言模型的下游评估。比较包括24层10亿参数基线模型、不同参数预算 kk 的等FLOP循环模型 (k⊗24/k),以及相应的等参数基线 (k⊗1)。下游评估是在4个任务组内对任务进行平均。我们还为每个 k 包含了 % Gap 指标,以衡量循环模型覆盖的等参数基线和等FLOP基线之间的差距(参见公式(1))。总体而言,循环模型在困惑度和闭卷问答(记忆基准)上表现较差,但对于需要推理的任务组(开卷问答、数学应用题), % Gap 要高得多。事实上,对于纯粹测试推理技能的推理基元,尽管参数少了 24/k× 倍,循环模型在所有 k 上都远优于10亿参数基线。

为了更好地理解对推理的影响,我们请读者注意表3中推理基元的评估。结果相当显著:对于所有 kk 值,(k⊗24/k) 循环模型在推理基元上都优于等FLOP基线 (24⊗1)。这先验地非常令人惊讶,因为这些是合成生成的任务,与预训练数据或模型架构无关。因此,解决这些任务必然需要从上下文中进行推理,记忆能力在这里无济于事。这些结果清楚地表明循环模型具有偏向于改善推理的偏置,尽管其困惑度和记忆能力较差。接下来,我们通过等值线图形式化这种向推理的归纳偏置。

3.2 向推理的归纳偏置

在本节中,我们通过绘制Saunshi等人(2022)引入的困惑度与下游指标等值线图来形式化归纳偏置。第3.1节表明循环模型在推理问题上具有高于预期的性能。然而,由于循环模型在困惑度上表现更差,很难在各模型之间进行直接比较。使模型间具有可比性的一种方法是查看它们在相同验证预训练损失下的下游性能(Liu et al., 2023)。Saunshi等人(2024)提议绘制训练过程中的预训练损失与下游指标的关系图,作为研究各种方法归纳偏置的一种方式。对于每个模型,我们从120k步开始,每20k步评估一次对数困惑度和下游指标。我们将这些值绘制在散点图中,并拟合一个线性函数,以对数困惑度和相应的下游指标分别为输入和输出。请参考图2和图7以查看两组等值线图。

发现。对于所有 kk 值,我们观察到以下情况:

(k⊗L) 循环模型和 (k⊗1) 基线的等值线图在闭卷问答任务上非常一致(如果外推的话)。这表明对数困惑度是基于记忆的任务的下游性能的一个非常强的指标。对于开卷问答和数学应用题,循环模型的等值线总是高于基线模型。这表明在相同的对数困惑度下,循环模型在这些需要更多推理的任务上往往具有更高的评估分数。对于推理基元,循环模型和基线模型之间存在显著差异。循环模型在训练的大部分时间点似乎都有良好的性能。

总的来说,这表明循环模型具有强烈的向改善推理的归纳偏置。

3.3 中间循环变体及其与渐进堆叠的关系

最近,Saunshi等人(2024)引入了一种用于训练语言模型的渐进堆叠(Gong et al., 2019; Reddi et al., 2023)方法,称为MidAS。该方法在训练过程中通过在每个堆叠操作中复制模型的某些层来逐渐增加模型深度。令人惊讶的是,他们发现MidAS不仅加速了预训练,而且在相同意义上改善了推理——在相同的困惑度下具有更好的推理能力,如图2所示。此外,该论文通过层复制操作建立了MidAS堆叠与循环模型之间的强联系,并推测这是这种归纳偏置的原因。我们前一节的结果为这一推测提供了令人信服的证据,表明循环模型也显示出非常相似的归纳偏置,从而进一步加强了堆叠与循环模型之间的联系。为什么会出现这种归纳偏置仍然是一个悬而未决的问题,我们相信理解这一点是未来研究的一个重要方向。

此外,受他们发现的启发,我们探索了中间循环(参见图1的说明)——一种循环变体,它在网络的起始和结束部分保持独立的层,并在中间块上执行循环。Saunshi等人(2024)的高级直觉是,第一层和最后一层在模型中扮演特殊角色,因此应与中间层区别对待。在表3中,我们报告了一种中间循环版本的结果,该版本与 (12⊗1) 基线等参数,与 (24⊗1) 基线等FLOP,就像 (12⊗2) 模型一样。总体而言,我们发现中间循环具有更好的困惑度和比默认循环 (12⊗2) 更均匀的改进(除了数学应用题),因此可能是一种更实用的循环方法。我们将最佳循环策略的探索留待未来工作。

图3:随着有效深度的增加,各任务组的扩展行为。蓝色曲线显示了使用 (4⊗D/4) 形式的模型,在参数不增加的情况下,性能如何随循环次数增加而扩展。橙色曲线可视化了 (D⊗1) 的扩展行为,后者通过增加新参数来增加深度。对于推理基元,循环模型的扩展与基线一样好,甚至更好,尽管参数少了 D/4 倍。

3.4 循环的扩展行为

表4:第4节介绍的正则化应用前后的24层10亿参数模型的结果。我们尝试了各种块大小 k,其动机来自表3中的循环模型设置。总体而言,正则化有助于保留向推理的归纳偏置,在数学应用题和推理基元上有显著改进,而困惑度几乎不受影响。

关于循环模型实际上可以模拟CoT推理。鉴于这种与CoT推理的联系,循环在更难的推理上能够良好扩展是可信的。我们相信,明确利用循环进行推理时扩展是一个非常 promising 的未来方向。

4 受循环启发的正则化

5 循环模型的理论分析

在本节中,我们提出理论结果以理解前几节中的现象——为什么参数很少的循环模型能够在推理问题上匹配等FLOP的非循环基线?虽然完整的理论具有挑战性,因为“推理”是一个非常宽泛的概念,但目标是提供一些直觉和对循环模型表达能力的正式化。首先,我们证明循环Transformer可以有效地解决群组合问题(加法问题的推广)。然后,我们展示一个非常一般性的结果,即具有很少不同层的非循环模型如何可以被循环模型模拟,且模型大小仅有小幅增长。这个结果随后被用来使用单层循环Transformer解决 p -跳问题。我们对群组合和 p -跳问题的构造在深度上接近最优,并且在参数上比非循环模型高效得多。

5.1 预备知识和符号

5.2 群组合问题

5.3 循环模型可以模拟非循环模型

我们的第二个理论结果表明,具有重复层的非循环Transformer可以被具有更少参数和相同深度的循环Transformer模拟。

5.4 循环模型可以模拟CoT推理

在第3.4节中,我们讨论了循环模型如何被视为在每次迭代中生成多个潜在思维。以下定理表明,可以使用 L 次循环的循环Transformer来模拟具有类似大小的另一个Transformer的 L 步CoT。

6 相关工作

推理被认为是智能和稳健模型的核心能力,因此在过去几年中受到了极大的关注。我们在这项工作中考虑的合成推理问题都已在Sanford等人(2024b);Ye等人(2024);Sanford等人(2024a);Nogueira等人(2021)的先前工作中使用,以理论分析Transformer的优势和局限性。人们还对Transformer在计算问题上的表示能力感兴趣(Liu et al., 2022; Strobl et al., 2023)以及思维链推理(Merrill & Sabharwal, 2023a; Feng et al., 2023; Li et al., 2024)。模型深度对性能的必要性已在小型模型(Liu et al., 2024)和推理(Chen & Zou, 2024; Ye et al., 2024; Petty et al., 2023)方面有所论述。在这项工作中,我们做出了更精细的观察,即尽管更大的深度是必要的,但这可以通过循环在有限的参数预算下实现。

Transformer模型中的循环自从(Dehghani et al., 2018; Lan et al., 2020)的工作以来就已被研究,他们分别展示了循环在监督学习任务和BERT预训练中的益处。循环也出现在(Schwarzschild et al., 2021; Bansal et al., 2022)中,研究了循环在某些算法任务上的外推特性。最近,Giannou等人(2023);de Luca & Fountoulakis(2024)研究了循环解码器模型的理论特性,并表明循环可以模拟任意图灵机。此外,Yang等人(2023);Gao等人(2024);Gatmiry等人(2024a;b)研究了循环模型作为模拟上下文学习迭代算法的一种方式。最近,Mohtashami等人(2023)引入了CoTFormer,试图改善循环语言模型的困惑度,而(Liu et al., 2024)探索了用于设备上LLM的延迟效率参数共享。相比之下,我们的工作侧重于循环令人惊讶的归纳偏置,以改善下游推理任务,并超越了算法和上下文学习任务。

不同的训练算法(例如梯度下降(Soudry et al., 2018))和架构选择(例如注意力(Edelman et al., 2022))已被证明具有某些隐式偏置。人们对预训练期间的这种归纳偏置越来越感兴趣(Saunshi et al., 2022; Liu et al., 2023)。最近,Saunshi等人(2024)显示了堆叠(Reddi et al., 2023)对改善推理的归纳偏置,并推测堆叠与循环模型的联系可能是造成这种情况的原因。我们的结果为这一假设提供了进一步的验证。

图4:左图。思维链推理可以被视为一个循环模型,每次迭代产生一个新的思维令牌。新令牌以红色突出显示。右图。循环模型可以并行生成多个潜在思维,并且理论上可以通过适当掩蔽更新来模拟CoT推理(见定理5.4)。

7 结论、局限性与未来工作

这项工作探索了“用于推理的循环模型”这一新方向。循环模型不仅能够以非常少的参数解决许多推理问题,而且它们还具有不成比例地改善语言模型推理性能(相对于记忆)的归纳偏置。关于循环模型表达能力的理论结果开始为其深度最优性提供一些线索。虽然我们在推理问题的一个子集上测试了循环模型,但一个自然的问题是这些结果是否适用于许多其他形式的推理(例如多模态和常识推理)。特别是,对推理问题本身进行简洁的形式化是一个有趣的未来方向。此外,在相同困惑度下改善推理性能的归纳偏置非常有趣,值得进一步探索。我们发现循环模型的扩展行为非常迷人,并且与潜在思维和CoT推理的联系开始为这种行为提供线索。我们希望这能激发未来探索使用循环模型进行更高效的推理时扩展,以帮助进行更深层次的推理。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/18 14:22:35

MySQL8.0.30升级8.0.46完整操作手册(含回滚方案)

一、前言 本次将MySQL8.0.30版本升级至8.0.46官方稳定版,核心目的是修复旧版本已知漏洞、优化数据库性能、提升系统稳定性与安全性,适配业务长期稳定运行需求。本次升级采用前置不停机准备短停机窗口升级的平滑升级方案,前期准备工作无需停机…

作者头像 李华
网站建设 2026/8/18 14:22:03

告别黑屏闪退!免费开源神器让童年老游戏在新电脑重获新生

告别黑屏闪退!免费开源神器让童年老游戏在新电脑重获新生 【免费下载链接】DDrawCompat DirectDraw and Direct3D 1-7 compatibility, performance and visual enhancements for Windows Vista, 7, 8, 10 and 11 项目地址: https://gitcode.com/gh_mirrors/dd/DDr…

作者头像 李华
网站建设 2026/8/18 14:06:52

TVA-World架构:AGI基础算法研究启示录(10)

前沿技术探索:TVA智能体(简称TVA)TVA智能体(亦称“AI智能体视觉”或“TVA视觉智能体”)是依托Transformer架构与“因式智能体”理论构建的系统级视觉技术框架。它融合深度强化学习(DRL)、卷积神…

作者头像 李华