news 2026/7/28 20:12:51

多轮长时序规划的内在机理:单/多教师在线智能蒸馏的预训练到后训练全链路研究

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
多轮长时序规划的内在机理:单/多教师在线智能蒸馏的预训练到后训练全链路研究

多轮长时序规划的内在机理:单/多教师在线智能蒸馏的预训练到后训练全链路研究

arXiv原文链接:https://arxiv.org/html/2607.24720v1

摘要

多轮长时序规划是大模型智能体的核心基础能力,但业界尚未系统厘清模型从预训练到后训练全流程中长时序规划能力的生成、塑造与融合机制。现有基座模型基于不可控、无透明互联网语料训练,难以拆解规划能力的来源与优化路径。本文构建一套完全可控的多轮规划仿真环境,从**预训练、单教师后训练(GRPO/OPD)、多教师蒸馏(MOPD)**三个阶段系统性剖析长时序规划底层机理,完整覆盖对照实验、梯度动力学、参数演化分析:

  1. 预训练阶段:显式内部世界建模(状态转移思维链)相比直接动作预测具备更强泛化能力;仅学习原子技能无法自主组合成长时序任务,少量长轨迹样本即可激活组合泛化;次优轨迹会随时序累积误差,严重破坏长规划效果。
  2. 单教师后训练阶段:基于互信息区分通用规划范式(低互信息)任务专属规划知识(高互信息)。GRPO与在线智能蒸馏OPD存在明确适用区间:OPD在低质量预训练、长时序任务下有效范围更广;规划知识因样本特异性高,强化学习小幅更新无法完成跨任务迁移,强行蒸馏会破坏模型原有世界建模能力。同时从SVD梯度余弦相似度证明:长时序+低质数据下GRPO梯度噪声大、易梯度消失,OPD全程梯度方向稳定统一。
  3. 多教师在线蒸馏MOPD:多教师融合的核心机制是收敛至多教师共享规划范式分布。当各环境范式兼容共享时可实现跨域泛化;范式部分共享可支持持续学习;完全冲突范式会引发灾难性遗忘、跨域干扰。

本文提供完整可控实验环境、数据集、训练脚本,为通用智能体基座长时序规划能力迭代提供标准化理论与工程指导。
关键词:多轮交互、长时序规划、智能体、预训练、强化学习、GRPO、在线蒸馏OPD、多教师蒸馏MOPD

1 引言

随着基座模型向实体智能体演进,多轮长时序规划成为落地真实通用智能体的必备核心能力(OSWorld2、EdgeBench、Long-Horizon-Term-Bench、DeepPlanning等基准均证明当前模型长时序任务存在明显短板)。现有优化手段分为三阶段:

  1. 大规模预训练,从海量语料习得通用规划范式与任务知识;
  2. 强化学习后训练(GRPO/OPD),优化规划执行策略;
  3. 多教师模型蒸馏融合,整合多领域专家规划能力。

行业核心待解问题:如何在预训练、强化后训练、多教师蒸馏全链路系统性提升模型长时序规划能力?
现有模型训练依赖黑盒互联网数据,无法拆解能力生成逻辑,衍生三个基础研究子问题:

  1. 预训练:世界建模、原子技能、轨迹质量如何影响长时序规划习得?
  2. 单教师强化:GRPO与OPD分别适配何种规划范式/知识,各自适用边界?
  3. 多教师蒸馏:多域规划能力融合的生效条件、泛化与遗忘机制?

本文搭建专属可控规划仿真环境,隔离任务长度、数据质量、规划范式、任务知识四大变量,分三阶段完成对照实验,量化梯度、KL散度、参数PCA等指标,完整揭示长时序规划底层训练机理。

2 前置理论基础

2.1 智能体规划定义

给定初始状态s0s_0s0、目标ggg,智能体输出动作序列A={a1,a2...aT}A=\{a_1,a_2...a_T\}A={a1,a2...aT},执行后环境状态流转至满足目标的终止态sTs_TsT

  • 原子技能:单步子任务执行流程,存储为「任务描述-步骤序列」元组,可作为上下文输入或内置到模型思维链;
  • 世界模型:状态转移函数T(st,at)→st+1\mathcal{T}(s_t,a_t)\rightarrow s_{t+1}T(st,at)st+1,内置原子技能规则,可在模型内部模拟未来状态推演,无需真实环境交互。

2.2 单教师在线智能蒸馏 OPD

OPD在智能体自探索生成的轨迹上做蒸馏监督,对K轮交互轨迹自回归分解token级KL损失,提供稠密逐步梯度信号。
轨迹定义:τ=(g,s0,Y^1,s1...Y^K,sK)\tau=(g,s_0,\hat{Y}_1,s_1...\hat{Y}_K,s_K)τ=(g,s0,Y^1,s1...Y^K,sK)
每轮kkk内解码tokenttt,学生/教师分布:
pk,t≜πθ(⋅∣Hk,Y^k,<t),qk,t≜πteacher(⋅∣Hk,Y^k,<t) p_{k,t}\triangleq\pi_{\theta}(\cdot\mid H_{k},\hat{Y}_{k,<t}),\quad q_{k,t}\triangleq\pi_{\text{teacher}}(\cdot\mid H_{k},\hat{Y}_{k,<t})pk,tπθ(Hk,Y^k,<t),qk,tπteacher(Hk,Y^k,<t)
全局损失:
LAgent-OPD(θ)=Eτ∼πθ[∑k=1K∑t=1TkDKL(pk,t∥qk,t)] \mathcal{L}_{\text{Agent-OPD}}(\theta)=\mathbb{E}_{\tau\sim\pi_{\theta}}\left[\sum_{k=1}^{K}\sum_{t=1}^{T_{k}}D_{\text{KL}}(p_{k,t}\parallel q_{k,t})\right]LAgent-OPD(θ)=Eτπθ[k=1Kt=1TkDKL(pk,tqk,t)]

OPD两大实现范式
  1. PG式OPD:将KL对数差作为token级优势回报,使用策略梯度更新;
  2. GKD式OPD:直接最小师生token分布KL散度,不依赖采样回报。
三类OPD变体
  1. 采样Token OPD:仅对轨迹采样token计算损失,分PG/GKD两种近似;
  2. Top-k OPD:截断词表仅对top-k高概率token归一化计算KL;
  3. 全词表OPD:完整词表计算精确KL损失,无截断近似。

3 可控规划仿真环境(实验基座)

3.1 分层技能图构建

设计三大独立领域:奇幻炼金、畜牧养殖、电子组装;每领域构建多层有向合成技能图,节点代表物品,边代表合成规则(AND/OR逻辑配方),通过贪心最小化算法控制合成步骤复杂度。
合成逻辑通用形式:
v ⟺ (u1,1∧⋯∧u1,k1)∨⋯∨(um,1∧⋯∨um,km) v\iff(u_{1,1}\land\dots\land u_{1,k_1})\lor\dots\lor(u_{m,1}\land\dots\lor u_{m,k_m})v(u1,1u1,k1)(um,1um,km)

3.2 图转仿真环境映射

抽象技能节点映射为实体物品,区分训练/测试物品索引,测试集使用全新物品组合杜绝数据泄露。

3.3 任务难度分级

按合成最小步数分为短(1-5步)、中(6-8步)、长(≥9步)三类,初始库存混入干扰物品提升规划噪声。

3.4 数据集划分

预训练、后训练、测试集完全隔离;测试集使用从未见过的物品组合评估组合泛化。

3.5 评测指标

  • avg@8:8次独立采样平均通过率;
  • pass@8:8次采样中至少一次成功的任务占比;
  • 辅助指标:训练损失、KL散度、参数余弦相似度、梯度SVD子空间对齐度。

4 预训练:长时序规划能力的原生习得

本章从**数据格式(世界建模)、数据分布(原子技能组合)、数据质量(次优轨迹)**三个维度拆解预训练对长时序能力的影响。

4.1 世界建模对泛化的提升

核心设置

两组对照:

  1. 直接预测:模型仅输出动作,无状态推演思维链;
  2. 世界建模:CoT显式写出每一步状态变化,内置转移函数。
    模型基线:随机初始化Qwen2.5-100M,独立训练BPE分词器。
实验结论
  1. 全难度区间带世界建模模型avg@8、pass@8显著更高;长时序任务提升幅度最大(+45.8% avg@8);
  2. 直接预测训练前期收敛更快、token开销更低,但性能天花板极低;世界建模前期训练慢,最终泛化上限更高。

核心结论:内部世界建模是长时序组合泛化的核心基础,牺牲少量训练效率换取极强复杂任务适配能力。

4.2 原子技能无法自主组合泛化

变量控制

预训练数据按短/中/长轨迹比例划分多组对照(仅短、短+少量中、短+少量长、全时序混合)。

实验结果
  1. 仅训练短时序原子样本时,模型短任务通过率93.12%,中长时序任务近乎0;仅学会单步操作,无法自主串联多步骤;
  2. 仅混入5%长轨迹样本,中长期任务通过率大幅跳升(中任务pass@8从0.83%→51.88%)。

核心结论:原子技能无法自发组合成长时序规划;预训练必须混入少量长轨迹样本,激活多步串联推理能力。

4.3 次优轨迹严重破坏长时序规划

变量控制

预训练数据混合不同比例最优/次优规划轨迹(4最优、4最优4次优、4最优8次优)。

实验结论
  1. 短时序任务受次优数据影响轻微;
  2. 中、长时序任务性能断崖下跌,原因是长序列中错误步骤会持续累积放大,一旦前期决策偏移,后续所有操作全部失效;
  3. 单纯增加推理采样次数无法弥补次优预训练带来的底层能力缺陷。

5 GRPO与OPD后训练:规划能力定向塑造

本章通过互信息区分两类规划要素:

  • 规划范式P:跨任务通用推理骨架,KaTeX parse error: Can't use function '\(' in math mode at position 1: \̲(̲I(T;P)\)互信息低;
  • 规划知识K:任务专属合成配方,KaTeX parse error: Can't use function '\(' in math mode at position 1: \̲(̲I(T;K)\)互信息极高。

5.1 互信息理论定义

KaTeX parse error: Can't use function '\(' in math mode at position 2: \̲(̲I(T;P)\)=H(P)-H…
同一任务下,规划知识不确定性下降幅度远大于规划范式,因此KaTeX parse error: Can't use function '\(' in math mode at position 1: \̲(̲I(T;K)\) \gg \(…

5.2 规划范式的优化边界与梯度分析

5.2.1 准确率分区实验

划分三大优化区间:

  1. 无需优化区:各类范式性能接近,强化学习无收益;
  2. 有效优化区:范式性能差异大,RL可筛选最优推理骨架;
  3. 不支持区:长时序+稀疏回报下,GRPO信用分配失效。
    对照算法:多轮GRPO(仅最终二元奖励)、Top-k OPD(稠密逐步KL监督)
    核心数据结论:
  4. 高质量预训练(4Opt)场景,GRPO/OPD收益接近;
  5. 低质预训练(4Opt:4Sub / 4Opt:8Sub),OPD提升幅度远超GRPO;
  6. GRPO缺陷:长时序稀疏回报下梯度噪声大、甚至梯度消失;OPD全程梯度方向稳定,更新一致性更强。
5.2.2 梯度SVD余弦相似度分析

对模型权重更新矩阵做SVD分解,计算各阶段梯度主向量与最终收敛梯度的余弦相似度:

  1. GR在长时序+次优数据下,前期梯度与最终目标相似度极低,更新方向散乱;
  2. OPD全时序、全数据配比下梯度相似度维持高位,优化路径稳定。

小节结论:通用规划范式适配OPD做后训练,长时序低质场景优先选择OPD;GRPO仅适合短时序、高质量预训练数据。

5.3 任务专属规划知识蒸馏局限

核心现象:师生底层知识冲突时蒸馏失效

同一目标存在两套完全不同的合成路径(RecipeA / RecipeB):

  1. 学生预训练基于A,教师基于B,即便教师100%正确率,OPD训练后模型全域性能大幅下跌;
  2. 原因:OPD前期仅优化通用推理范式,后期强制替换专属任务知识,但RL梯度更新幅度太小,无法完全覆盖原有知识,造成新旧规则冲突,域内性能崩塌。
KL动态验证

训练前期模型优先对齐通用规划范式(KL快速下降);训练后期需要逐样本微调专属知识,KL下降停滞,无法完成知识替换。

小节结论:OPD仅适合师生底层规划知识同源场景;师生配方/流程完全不同时,蒸馏会破坏原有域内能力。

6 多教师在线蒸馏MOPD:多域规划能力融合

MOPD定义:串行使用多名域专家教师,依次对学生执行OPD蒸馏,目标是融合多领域规划能力,分为三大场景:

  1. 共享兼容范式:跨域泛化;
  2. 部分共享范式:持续学习;
  3. 无共享冲突范式:灾难性遗忘。

6.1 场景一:共享兼容规划范式(跨域泛化)

各领域教师底层推理骨架一致,仅物品合成知识不同。
实验现象:

  1. 仅用炼金教师训练,畜牧、电子领域未训练任务同步大幅提升;
  2. MOPD核心逻辑:反向KL会自动收敛至所有教师公共范式分布,不会逐一枚举所有教师特有模式;
  3. 前提:目标域预训练数据中必须存在对应基础范式,MOPD无法凭空生成从未见过的推理结构。

6.2 场景二:部分共享、存在冲突范式(持续学习)

各领域存在公共基础范式,同时各自包含专属分支推理逻辑。
实验现象:

  1. 学习新领域后,旧领域性能小幅下降但维持可用;
  2. 公共骨架保留,仅域专属分支被微调,可实现多任务持续学习。

6.3 场景三:完全无共享冲突范式(灾难性遗忘)

各领域推理逻辑完全互斥,无公共基础范式。
实验现象:

  1. 学习新教师后,之前领域性能断崖下跌;
  2. 模型过拟合最新教师独有的推理模式,覆盖原有全部规划逻辑。

6.4 MOPD参数动力学分析

PCA投影模型全部参数,对比Instruct基线、各阶段MOPD、独立教师模型距离:

  1. 所有MOPD中间检查点始终贴近原始基线模型;
  2. 每一轮教师蒸馏仅小幅调整参数,不会出现大规模权重偏移;
  3. 不同教师带来的更新方向差异大,因此可兼容多领域知识(无冲突场景下)。

7 相关工作

  1. 长时序智能体基准:OSWorld2、EdgeBench、Long-Horizon-Term-Bench、DeepPlanning等现有评测仅做效果对比,未可控拆解规划生成机理;
  2. 单/多轮OPD蒸馏:现有研究侧重单轮推理蒸馏,本文拓展至多轮交互智能体,系统对比GRPO与OPD边界;
  3. 多教师模型融合:MiMo、GLM、Nemotron等采用多教师融合,但未区分范式兼容/冲突三种场景,缺少底层参数与分布解释;
  4. 世界建模与组合泛化:过往工作验证世界建模收益,但未通过分层可控数据集量化次优轨迹、长样本占比带来的性能变化。

8 结论

  1. 预训练阶段:内置状态转移世界建模大幅提升长时序泛化;仅原子技能无法自主组合,少量长轨迹样本即可激活多步推理;次优轨迹会累积时序误差,严重损害复杂任务效果。
  2. 单教师后训练:规划范式(低互信息)适合OPD强化优化,长时序、低质预训练场景OPD优于GRPO;任务专属知识(高互信息)难以通过RL蒸馏替换,师生底层流程冲突会破坏原有域能力。
  3. 多教师MOPD:融合能力取决于各领域规划范式重合度;兼容范式实现跨域泛化,部分共享支持持续学习,完全冲突范式引发灾难性遗忘;MOPD仅收敛至多教师公共推理分布,无法生成预训练不存在的全新规划骨架。
  4. 工程落地指导:简单短时序任务可使用GRPO;长时序、数据质量参差不齐场景优先OPD;多域融合前需确认各任务底层推理范式是否兼容。

附录A 预训练完整配置

A.1 基础模型架构

基于Qwen2.5架构,100M参数

超参数取值
层数12
隐藏维度768
FFN维度3072
RoPE θ1e6
最大上下文2048
词表大小3000
精度bfloat16

A.2 环境技能图统计

三大领域统一层级结构,每层40分类、每类20实例,物品合成分1~5层,层数越高合成步骤越多。

A.3 数据集划分

预训练/后训练/测试严格分离,区分short/mid/long三档难度,提供完整样本数量、平均步骤统计表。

A.4 SFT语料配置

区分有无CoT思维链两大类数据集,统计输入、输出token均值,全部实验统一训练超参:batch=128、梯度累积2、lr=1e-4、余弦调度、9000步、bf16全参数微调。

资源汇总

  1. 论文HTML原文:https://arxiv.org/html/2607.24720v1
  2. 论文PDF:https://arxiv.org/pdf/2607.24720
  3. 项目主页:https://quester-one.github.io/PlanPhysWebsite/
  4. 完整实验代码仓库:https://github.com/Quester-one/PlanPhysCode
  5. 预训练/后训练模型权重:https://huggingface.co/MultimodalAgent/TianyiMen_PlanPhys_Models
  6. 全套合成规划数据集:https://huggingface.co/datasets/MultimodalAgent/TianyiMen_PlanPhys_Datasets
版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/7/28 20:11:59

计算机毕业设计之基于springboot的高校二手物品交易平台

由于移动应用技术的持续性的快速发展&#xff0c;现实生活中人们大多数都是通过移动手机、电脑等智能设备来完成生活中的事务。因此&#xff0c;许多的人工传统行业也开始与互联网结合&#xff0c;不再一味的依靠人工手动&#xff0c;努力打造半自动数字化甚至是全自动数字化模…

作者头像 李华
网站建设 2026/7/28 20:11:03

信息安全毕业设计选题指南与技术实践

1. 信息安全毕设课题概述作为计算机相关专业的毕业生&#xff0c;信息安全方向始终是毕设选题的热门领域。但很多同学在选题阶段常常陷入两难&#xff1a;既想选择有技术含量的课题&#xff0c;又担心难度过高无法完成。根据我多年指导毕业设计的经验&#xff0c;一个好的信息安…

作者头像 李华
网站建设 2026/7/28 20:09:46

程序员必知:LLM核心概念与工程实践指南

1. 为什么程序员需要理解AI底层逻辑&#xff1f;在ChatGPT掀起的技术浪潮中&#xff0c;AI已从实验室走向工程实践。作为每天与代码打交道的程序员&#xff0c;理解LLM&#xff08;大语言模型&#xff09;的底层机制不再是选修课&#xff0c;而是职业发展的必修技能。上周帮团队…

作者头像 李华
网站建设 2026/7/28 20:08:33

掌握提示工程三层法:像编程一样与AI对话,提升Claude输出质量10倍

为什么你精心设计的提示词&#xff0c;Claude 总是答非所问&#xff1f;为什么别人用同样的模型能写出高质量代码、生成复杂报告&#xff0c;而你得到的却是泛泛而谈的废话&#xff1f;问题可能不在于模型&#xff0c;而在于你与模型“对话”的方式。最近&#xff0c;前特斯拉A…

作者头像 李华
网站建设 2026/7/28 20:04:43

Matlab实现火星探测车不确定性感知路径规划

1. 项目概述&#xff1a;当行星探测车遇上不确定性在火星表面崎岖的地形上&#xff0c;一辆探测车正面临生死抉择&#xff1a;左侧是看似平坦却可能暗藏流沙的区域&#xff0c;右侧是坡度陡峭但地质稳定的岩石带。传统轨迹规划算法可能会选择左侧"平坦"路径&#xff…

作者头像 李华
网站建设 2026/7/28 20:03:42

详解变量提升和闭包的应用

文章目录堆栈内存变量提升带var和不带var的区别作用域链的拓展闭包什么是闭包闭包的应用堆栈内存 栈内存&#xff1a;作用域 提供一个供js代码自上而下执行的环境&#xff08;代码都是在栈内存中执行&#xff09;存储基本数据类型值释放&#xff1a;当栈内存被销毁&#xff0…

作者头像 李华