一句话领会: 于场景之中, 那大模型并非仅仅是“去回答问题”, 而是得持续地规划, 去调用工具, 观察所产生的结果, 之后再接着继续进行决策。而TRACE试着要解决的也正是这一现实问题: 当预算处于固定状态时, 训练究竟应当把算力投放于哪些、哪一些中间步骤之上, 如此才能够产生出更多实用的成功/失败对比信号呢?
以搜索问答、函数调用、代码执行、数学解题类任务作为例子, 一个 Agent 常常不是一下子就得出答案, 而是要历经好多轮, 先是思索, 接着启动工具, 然后获取观察结果, 随后修正计划, 之后再次启动工具, 最终才能做出回答。
这类长程推理与 tool use 的训练难点在于:
若是仅仅去看终极答案究竟对不对, 那奖励信号将会极为稀疏, 要是每一次都鲁莽地提升数量, 费用又会迅速激增呢。
更麻烦的是,并不是所有 都有训练价值。
有着这样一些任务, 其难度是非常低的, 无论模型采用何种采样方式, 做出来的结果都是正确的;而另外一些任务, 难度极大, 模型无论怎样采样处理, 得出的结果都是错误的。前面所说的那些简单任务以及后面提到的那些困难任务, 都不容易去构建出“这条路径为何更具优势”的对比信号。真正具备价值的, 是处于相同的某一个或者相同的某一种中间状态之下的样本, 它们既存在成功的可能性,也有着失败的可能性。
换言之, Agent 的训练所需求的并非“更多随机试错”, 而是。
把有限的 预算,花在最容易产生成功/失败分歧的关键路口。
和腾讯混元团队联合的, 是由清华大学季向阳教授带领的团队, 他们提出了最新工作TRACE, 该工作即Tree for , 正是围绕这个问题, 提出了一套统一的预算分配框架。
TRACE的核心思想是, 在处于固定预算的情形下, 将采样从那种如同平均撒胡椒面般形式, 转变为优先去探索存在更强烈对比的root 与 , 以此促使终局奖励转化为更为密集的训练信号。那么Agent训练究竟为何会停滞在“无效”这种状况呢?
可验证奖励的强化学习, 也就是 RLVR, 成为了提升大模型推理能力的重要方法, 同时也成为了提升 Agent 能力的重要方法。
它具备很直接的优势, 许多任务存在这样的情况, 即不需要人工去撰写涵盖复杂过程的奖励, 只要最终的结果能够得到验证, 像数学题答案正确与否、工具调用结果是否成功、多跳问答有没有命中正确答案, 如此便能够给模型提供反馈。
但现实问题也非常明显: RLVR 很吃 。
于一般的数学推理当中, 模型极有可能会产生一段十分 的思维链;在该项任务里面, 模型还得与周遭环境相互作用, 去调用诸如检索器这般器材、执行器另外的、应用程序编程, 或者函数工具。每增添一回, 皆是一次完备的长链条采样。
过去很多方法主要在 层面做筛选:
这类思路确实有用,但在多轮 Agent 场景里还不够。
因为 Agent 的关键错误常常发生在中间步骤:
倘若预算仅仅于开头之处进行分配, 那么便会将同一条轨迹内部不一样的信息量之间的差异给忽略掉。
TRACE 的切入点正是这里:
不但得判定“哪些题目是值得去做的”, 而且得判定“在推行完何种步骤之后, 哪些中间状态是值得更进一步进行分叉探究的”。
TRACE:把Agent轨迹看成一棵树
于TRACE当中, 一条具备ReAct风格的Agent轨迹, 被拆解开来, 成为一系列的节点。
每个节点可以理解为一次完整的:
+ +
也就是:模型想了什么、采取了什么动作、环境返回了什么结果。
于此情形之下看 , 先前存在的那一条具备一定长度的 , 已然不复仅仅是单一的一个完整整体存在了 , 而是能够被视同为一棵树木之上的某一条道路可行走路径了。
TRACE框架进行概览如下, 首先运用相关方式给root进行打分, 接着生成bare, 之后针对轨迹中间部分进行打分, 并且将相应内容分配到最能够产生反事实成功或者失败对比的位置上。
这套流程可以分成三步。
第一步:全局 root 分配
TRACE 先从一批候选 中,预测每个 的成功概率。
要是存在一个, 其被预计为几乎必然会成功的情况, 那么继续进行采样的话, 意义是不大的;要是被预计为几乎必然会失败, 那同样很难去提供有效的学习信号。
真实应当予以分配更多份额的, 乃那等成功几率处在中间范围、极有可能出现既有成功的情形又有失败的状况的。
这里的目标不是简单挑题,而是判断:
把若干条 root 分配给这个, 其后它有没有机会形成混合结果呢?
动态决定每个在固定总预算情况下能从中获得多少条root的是TRACE, 预算为0的则会被直接跳过。
第二步:局部 扩展
当完成root之后, TRACE将会去查看,在每条轨迹当中的中间部分。
存在这样一个情况, 已经有了一个事实产生的结果, 那就是沿着原本的后续轨迹持续行进下去, 则最后会呈现成功或者失败两种状况。
这时 TRACE 会问:
要是我从这个处于中间的值的状态再次进行采样几条 , 是否存在能够翻转原本的结果的机会呢?
要是先前处于失败状态, 然而判定这个依旧具备较高的成功可能性, 那么在此处便极有继续分叉的价值;反之, 要是先前取得成功, 不过随后实际上并不很稳定的话, 同样是值得去探索的。
这一步, 将训练, 从那种, 仅仅是在题目开头进行试错的情况, 推进到了, 在关键决策节点去做反事实探索的阶段。
第三步:用树结构强化策略更新
在同一个状况之下, 存在成功以及失败这两类不同的后续分支了, 如此一来, 模型便获取到更具局部性的偏好信号了。
这比单纯告诉模型“整条轨迹最后错了”要有用得多。
因为同一个前缀始终维持原样, 没有改变, 唯有跟着的后续行动存在差别, 成功的情况与失败的情形相互比较, 便更加容易将指向精准定位到具体的决策之上。
这也是 TRACE 对 RL 的重要意义:
它把 -only 转化成了更密集的、近似 的偏好对比。
为什么 信息值得预测?
论文呈现出了这样一个直观的结论, 那便是, 并非属于被定义为的那种噪声片段, 相反的, 却是能体现为具备更多信息量范畴的状态。
在 Agent 持续进行工具调用、获取观察以及革新计划的进程当中, 它对于任务当下状况的认知愈发完备, 相较于仅仅审视原始的, 在目睹更深层次的之后, 模型针对成功概率的预估理应更为精确。
论文中的诊断实验也支持这一点。
从左边来看, 不同的 root 情形之下与各自相连的 node进行对比之时所体现出来的价值差异是极为显著的;在中间的表述里, 依据预测得出的对比价值分配相应预算这件事, 相较于仅凭借单一因素的方式, 能够更快速地捕捉那些奖励方面所形成的分歧状况;转向右边的情况, 伴随深度不断增加的过程当中, 针对 group 的预测误差呈现出逐步下降的态势。
这张图说明了三个关键信息:
首要的是, root以及的信息量呈现出高度的不均匀状态。随机进行均分预算的话, 将会造成大量的浪费。
第二, 高价值的事物, 常常只是占据着少数的部分。只要能够识别出这些具体的位置, 那么就能够更加快速地捕捉到成功与失败之间存在的分歧。
第三, 越往后推移, 所涵盖的交互历史越发丰富, 对于后续成功率做出的预测也就愈发准确。
若换一种说法来讲, 在多轮的 Agent 当中, 真正具有关键意义的训练对象并非仅仅只是 , 而是那整棵 tree 上而下的, 当前还处在“悬而未决”这种状态的那些节点。
实验怎么做?覆盖三类典型Agent任务
论文在三类多轮 场景上验证 TRACE:
数学推理: 于语料之上进行训练, 运用此方法后, 在诸如某此例、AMC23、某彼例、某此例等数学基准当中予以评估;多跳问答: 于某此训练, 评估某此例、某彼例、某此例, 与本地检索服务器相配合;函数调用: 在BFCL v4 multi - turn split之上开展训练, 评估包含Base、某此例、某彼例、Long等场景。
主实验将Qwen3-8B以及Qwen3-14B用作, 且把轻量级的Qwen3-0.6B当作。
对比方法包括:
关键点在于:
所有方法均采用相同——, 故而TRACE的收益主要源自“预算分配更为高明”, 并非偷偷使用了更多样本。
结果一:同样预算下,TRACE整体准确率更高
先看训练曲线。
在 BFCL v4 这三类任务当中, 在 Qwen3 - 8B 这个模型规模之下, 在 Qwen3 - 14B 这个模型规模之下, TRACE 在相同的情况下, 整体取得更高训练曲线。
从平均结果看,TRACE 在三类任务上都优于主要基线。
任务模型主要提升
数学推理(In- Avg)
Qwen3-8B
70.0
70.4
70.4
71.1
相比 GRPO +1.1
数学推理(In- Avg)
Qwen3-14B
73.5
73.9
74.0
74.9
相比 GRPO +1.4
Multi-Hop QA Avg
Qwen3-8B
48.5
48.9
49.5
50.6
相比 +1.1
Multi-Hop QA Avg
Qwen3-14B
51.2
51.5
53.0
54.0
相比 GRPO +2.8;相比 +1.0
BFCL Avg
Qwen3-8B
43.5
44.3
44.2
46.2
相比 GRPO +2.7;相比 +2.0
BFCL Avg
Qwen3-14B
46.1
45.9
46.6
48.0
相比 +1.4
尤其值得注意的是 Multi-Hop QA 和 。
这两类任务, 都更加贴近真实的 Agent, 这类任务需要进行检索, 需要组合信息, 需要调用工具, 还需要处理多轮的环境反馈。TRACE 针对这些任务所取得的提升, 表明“-level 预算分配”的确能够助力长程 Agent 的训练过程, 使其更有效地加以利用。
结果二:TRACE让“有效样本比例”显著提高
最终结果仅仅是准确率, TRACE更具核心性的中间一个指标是Ratio。
衡量这个指标的是,在一个训练批次里, 关于其数量的多少, 是那些-root组, 它们能够产出成功与失败相混合情况的。
简单说,它衡量的就是:
这些 到底有没有产生可学习的对比?
TRACE能够在三类全然各异的任务以及两种存在规模差异的模型状况下, 均产出更为可观的ratio, 这点清晰地表明, 相同额度的预算被成功转变为了量值更大的、并非处于退化状态的训练信号。
论文中特别提到,在 数学推理上:
这同样是TRACE所具备的核心价值, 其并非只是一味地去单纯追求多采样的状态形式, 而是要使得在采样数量相同的情况之下, 更具备产生“成功与失败”这种对比例结果的可能性。
对仅有的RLVR而言, 这般对比堪称至关重要。缘由在于, 当同一group内部全部正确或者全部错误之际, group很容易趋向退化;唯有呈现出混合结果, 优化器才更易于判定哪些分支格外值得去学习。
结果三:轻量 能可靠指导 root 和 分配
一个关键组件是TRACE, 它用一个共享, 同时评估root的条件成功概率, 还评估中间的条件成功概率。
这听起来可能有风险:
具备工具调用历史, 有着环境反馈, 存在中间行动那般的情况 , 与不是相同同一类的输入作对比 , 预测器能够把过去用于泛化吗? 能做到这样的泛化吗?
论文用 rank 做了诊断。
在于, 预测器于root层面, 能够学习到, 可用的难度排序。
处于同一水平 , 在中间位置, 其上同样能够保持正相关 , 这表明它并非仅仅是记住 , 而是已然学到了一种东西。
这组结果说明, 历史中确实包含可学习的局部不确定性。
也就是说, TRACE并非借助人工制定的规则予以判断: 何处具备值得进行分叉之条件, 而是凭借于训练进程里持续不断更新的事物, 来展开估计。
从这个状态继续走,后续结果还有多大机会发生翻转?
消融实验:root分配和分配都重要
论文于Qwen3 - 8B上开展了消融实验, 将Stage 1予以替换, 又把Stage 2替换成了。
49.5
42.8
49.8
49.1
50.0
47.3
(TRACE)
50.6
52.3
可以看到:
这表明, TRACE 的两级预算分配, 并非是重复的设计, 而是在不同的粒度层面上, 去解决不同的问题。
预算形状也重要:不是只看总数
论文还比较了不同 root 和 的组合。
一样是大概 2048 的预算, 1024 个 root, 每个有着比较浅的扩展, 相较于 512 个 root,每个有着更深的扩展, 其表现更为出色。
这表明, Agent 训练的发展受限之处, 并不仅仅在于“总数”这一方面, 而且还涵盖了预算所能涉及到哪些特定状态这一要点。
要是一开始的时候, root 所覆盖的范围太过狭窄, 那么到了后面, 即便再进行深入挖掘, 也极有可能仅仅是在为数较少的局部状态之中不断地反复探寻, 从而错失掉更多具备价值的训练样本。
换成Llama也有效:不是Qwen专属技巧
为了查验TRACE是不是仅仅适用于Qwen, 论文另外在Llama - 3.2 - 3B -上面开展了Multi - Hop QA实验。
对于 Llama - 3.2 - 3B 的 Multi - Hop QA 平均准确率状况而言, TRACE 相比于其提升达到 3.1 点, 这表明此方法具备一定程度的迁移性。那么额外开销是否很大呢? 答案是很小。
引入 和两级分配后,一个自然问题是:
会不会省下的 ,又被 开销吃掉?
论文在 上做了 wall-clock time 。
来自LLM的TRACE的主要耗时依旧存在, 并且;在Qwen3 - 8B上, + 的总开销大约是3.2%, 而在Qwen3 - 14B上, 其总开销约为2.3%。
具体来看:
原因是挺直观的, 模型但凡越大, 相应的价格也就越贵。不过TRACE所使用的, 依旧是较小的 Qwen3 - 0.6B, 所以相对应的开销, 就会被摊薄开来。
因此, TRACE是这样的情形, 它更像是在训练流程里添加了一个轻量“预算调度器”, 此调度设备的作用是以很小的调度成本, 来达成换取更多有效的结果。
从 看:TRACE到底把预算分到哪里了?
对 BFCL v4 这类函数调用任务而言, 轨迹是更长的, 并且中间的选择空间也是更明显的。
有关于论文的观察结果表现为, TRACE于Stage 1的时候, 并非仅仅单纯做“选择亦或放弃选择”如此绝对之事, 并且同时会对不同对象给予不同额度数量大小的那根本质有别之物。
阶段1根: 追踪会按照候选池的情况进行筛选, 之后会为之分配数量各异的根。
在第二阶段里, 追踪会将更多的情况分配至中间的位置, 并非毫无目的地去扩展所有的节点。
从相对位置观看, 处于第二阶段的TRACE呢, 似乎更为趋于在那般轨迹进行的过程之中段进而想去寻觅仍旧存在着不确定性的要点。
依照绝对的turn index去看, TRACE的情况呢, 其同样也展示体现出并非均匀的分配态势, 这表明了 -level它捕捉到了存在于不同决策深度方面的信息量之间的差异情况。
这对 tool use 任务尤其重要。
函数调用 Agent 出现错误这种情况, 并非通常是“最后一句话出了错”这种状况, 而是错误发生于某个中间环节, 这个中间环节存在 API 选择方面、参数构造之处或者观察解释环节。
倘若训练能够于这些位置进行分叉, 那么便会更易于将最终成功或者失败的反馈转换成局部可用于学习的信号。
TRACE真正带来的范式变化
TRACE 的意义不只是提出一个新的采样策略。
更重要的是,它把 RLVR 的采样问题重新定义了。
过去我们常问:
一个 要采多少条 ?
TRACE 把问题改成:
试问于那完整的 Agent 轨迹之树上, 究竟哪一些个 root 和 最具备持续探索的价值?
这对于未来更复杂的 Agent 系统很关键。
沿随着模型朝着浏览器操作、数据分析、代码执行、多工具协作以及长程规划迈进, 任务轨迹将会越发漫长, 进行单次作业相应的成本亦是随之愈发高昂。
在这种情况下,仅靠 很容易造成巨大浪费。
真正能够实现高效的训练, 是需要如同TRACE这般, 将预算投放至“最能够产生学习信号的位置”的。
总结
TRACE 可以概括为一句话:
借助轻量, 寻得最有可能生成成功与失败对比情况的root以及中间部分, 而后将固定的预算集中起来进行分配, 分配到那上面。
它解决的是 RLVR 中非常现实的问题:
依据实验所呈现的情况来看, 于数学推理、多跳问答、函数调用这三类任务范畴之内, TRACE 均能够在保持相同预算的条件之下, 获取到更高的准确率, 并且还能够使得 ratio 得到显著提高。特别是针对于 Qwen3 - 14B Multi - Hop QA 而言, TRACE 的平均准确率达到了 54.0, 较之于 GRPO 有 2.8 点的提升 ;在 Qwen3 - 8B 方面, ratio 从 26.8% 提升至 60.6%。
就正朝着真实工具调用去迈进, 且朝着长程规划发展的 Agent 而言, 这般的“预算分配能力”说不定会逐渐显得越发重要呢。
之所未来的关键并非仅仅在于使模型愈发善于思考, 还涵盖着让模型于训练之际更清晰地晓得: 应当于何处增加尝试的次数。
论文信息
论文标题: TRACE: A for
列表当中有作者, 作者是邹琦, 还有王云, 另外有曲江彩, 再有是蔡一秀, 之后是毛如鹏, 接着是徐鑫, 然后是刘铠, 再来是羊杨, 最后是季姬。
先说主要作者, 是邹鹤鸣, 他是季向阳教授团队的博士, 其研究范围涵盖大模型高效后训练、持续学习以及脑启发智能, 他致力于提高多轮交互式智能体在RL后训练中的采样–反馈效率和决策信用分配, 抑制自演进里的灾难性遗忘, 还基于脑启发机制探索更节省算力的前沿学习范式。并且他在ICML、ICLR等国际顶级会议以一作/共一姿态发表了多篇论文, 其工作贯穿算法创新与工程落地的全栈优化, 目前是腾讯混元大模型团队科研实习生。
单位: ;LLM ,
论文链接: