《Revisiting On-Policy Distillation: Empirical Failure Modes and Simple Fixes》对同策略蒸馏(On-Policy Distillation, OPD)进行了系统性的重新审视,从理论、实证到方法改进三个层面展开研究。以下是对其主要研究内容的全面总结:
一、研究背景与问题
同策略蒸馏(OPD)在LLM后训练中日益流行,因为它能利用教师模型对学生生成的轨迹(rollout)提供密集的token级监督。然而,当前主流的OPD实现采用采样token级估计器——即在每个训练步骤,仅用采样token上的教师-学生对数概率差来驱动更新。论文指出,这种简单实现存在严重脆弱性,具体表现为:
理论上有偏:token级OPD相对于序列级反向KL最小化是有偏的;
实践中不稳定:在长rollout上学习信号脆弱,容易出现重复、熵坍缩等退化现象。
二、理论分析:偏差-方差权衡
论文从理论上澄清了token级OPD与序列级OPD之间的权衡关系:
序列级估计器:将每个token更新与所有未来奖励耦合,更接近精确的轨迹级目标,但最坏情况方差上界为O(T⁴);
token级估计器:移除未来奖励耦合,因此有偏,但最坏情况方差上界仅为O(T²),显著更优。
论文通过一个双任务玩具实验验证了这一权衡:引入折扣因子γ在两者之间插值,发现γ越大(未来耦合越强),梯度方差越高,优化越不稳定,甚至导致策略在状态空间中漂移。这支持了一个实用设计原则:长时域训练应保持token级监督以控制方差。
三、实证分析:采样Token OPD的三种失效模式
论文通过数学推理实验(学生:Qwen2.5-7B-Instruct;教师:OpenThinker3-7B)识别出采样token OPD的三个反复出现的失效模式:
1. Token级监督高度不平衡
大多数采样token获得负奖励,优化被一小部分局部正token主导;
训练对高频填充词和短续写敏感,这些内容可能获得有利局部分数,但对轨迹级质量贡献甚微。
2. 教师指导在学生生成前缀上不可靠
在学生对常见但教师不常见的前缀上,高教师概率的token仍可能获得奖励,即使轨迹已漂移到重复、自重置推理或无意义续写;
两个放大因素:教师分布尖锐(适度不匹配产生大对数比率)和长rollout上教师-学生分歧增长。
3. Tokenizer或特殊token不匹配
不同tokenization下,相同原始文本被不同分割,学生生成的token在教师下可能不对应自然token;
单token比较将语义分歧与tokenizer不匹配混淆,扭曲奖励信号。
四、方法:教师Top-K局部支持匹配
针对上述失效模式,论文提出教师Top-K局部支持匹配(Local Support Matching, LSM):
核心思想:不再仅比较单个采样token,而是在每个前缀上,比较教师和学生在教师Top-K支持的token集合上的下一token分布;
实现方式:截断反向KL目标——在教师Top-K支持集内重新归一化教师和学生分布,计算局部反向KL;
配套稳定化措施:
支持集重归一化:防止梯度传播到支持集外,避免优化不稳定;
Top-p rollout采样:使轨迹更接近典型续写,提高教师信号可靠性;
特殊token掩码:减少tokenizer不匹配导致的假阴性。
该方法保留了token级更新的效率与方差优势,同时将单token点估计替换为分布级比较,使更新不再由单个采样token的对数比率符号和幅度决定。
五、实验结果
论文在三种设置中评估了局部支持匹配:
1. 单任务数学推理
采样token OPD将学生从28.2提升至36.4平均分;
加特殊token掩码后提升至40.7;
本文方法(无掩码)达到41.7,有掩码41.5,优于采样token OPD及其掩码变体。
2. 多任务智能体+推理训练(ALFWorld + 数学交替)
未掩码版本将平均匹配分数从34.8提升至41.7(+19.8%),同时保持有竞争力的ALFWorld性能;
掩码版本取得最佳ALFWorld分数97.7,但放弃部分数学提升;
局部支持匹配对推理侧特别有帮助,因为采样token信号更易受前缀漂移影响。
3. 单任务WebShop(较小学生模型)
成功率从50.0提升至57.8,表明方法可迁移到主要数学/智能体设置之外。
4. 消融实验
仅教师Top-K比较不足,需配合Top-p采样;
重归一化至关重要,移除会导致快速坍缩;
性能对支持大小不太敏感(K足够大时),但支持太小或rollout无约束时训练不稳定;
替代支持变体(学生Top-K、教师Top-K+采样token、EMA-PG校正)在多任务设置中表现较差,教师Top-K最为稳健。
5. 训练动态
更小的梯度范数和裁剪边界比例;
保持足够策略熵;
教师-学生对数概率差距更接近零,对齐更好。
六、讨论与局限性
论文坦诚指出:
支持集KL是截断目标:仅在教师Top-K支持内计算,引入偏差,改变期望取值位置;
训练-推理不匹配:rollout策略与训练引擎更新之间可能存在不匹配;
教师匹配仍是任务成功的非完美代理:局部教师偏好的续写即使整体轨迹已无帮助仍可能获得奖励;
与教师仍有明显差距:更好的局部监督只是蒸馏问题的一部分。
七、主要贡献
理论澄清:token级OPD有偏但方差缩放更优,适合长时域训练;
实证分析:识别采样token OPD的三种失效模式;
方法提出:教师Top-K局部支持匹配 + Top-p rollout + 特殊token掩码;
实验验证:在单任务数学、多任务智能体+推理、单任务WebShop上均优于基线,多任务平均提升+19.8%。
论文的核心观点是:token级OPD的方差优势值得保留,但标准采样token实现过于脆弱。通过将单token监督替换为教师Top-K支持集上的截断分布级比较,可以在保持局部更新效率的同时,显著提升优化稳定性和下游性能。这一简单修改为更稳定的同策略蒸馏提供了实用方案,同时也明确了教师匹配作为任务成功代理的局限性。这里是自己的论文阅读记录,感兴趣的话可以参考一下,如果需要阅读原文的话可以看这里,如下所示:
项目地址在这里,如下所示:
摘要
同策略蒸馏(On-policy distillation, OPD)在大型语言模型(LLM)后训练中日益广泛应用,因为它能够利用教师模型对学生 rollout 提供密集监督。然而,标准实现通常将分布匹配简化为采样 token 的对数比率,这会导致学习信号在长 rollout 上变得脆弱,因为其前缀会偏离教师的典型支持域。我们从理论和实现两个角度重新审视这一形式。理论上,token 级 OPD 相对于序列级反向 KL 最小化是有偏的,但其最坏情况方差上界显著更紧;一项受控合成研究进一步表明,更强的未来奖励耦合会增加梯度方差并破坏训练稳定性。经验上,我们识别出采样 token OPD 的三种失效模式:token 级监督不平衡、教师指导在学生生成前缀上不可靠,以及 tokenizer 或特殊 token 不匹配。这些发现促使我们提出教师 top-K 局部支持匹配,一种截断反向 KL 目标,在每个前缀上比较教师和学生分布在教师支持的 token 集合上的分布,并结合 top-p rollout 采样和特殊 token 掩码。在涵盖智能体和推理设置的单任务推理与多任务基准上,该目标提升了优化稳定性,并相较于标准采样 token OPD 基线取得 +19.8% 的性能提升,为更稳定的同策略蒸馏提供了实用方案。
1 引言
同策略蒸馏(OPD)正日益成为 LLM 后训练的常见组成部分,尤其是在推理和智能体模型中。Thinking Machines Lab(Lu & Lab, 2025)、Qwen3(Yang et al., 2025)、MiMo-V2-Flash(Xiao et al., 2026)和 GLM-5(Zeng et al., 2026)近期的公开报告表明,更广泛的趋势是转向对模型生成轨迹的监督,或密切相关的同策略变体,与离策略蒸馏和强化学习并列。通过在学生 rollout 上训练,同时用更强的教师模型评估它们,OPD 以相对较低的成本结合了同策略数据收集与密集 token 级反馈(Agarwal et al., 2024; Gu et al., 2024)。这一特性在实际后训练流程中颇具吸引力,因为训练效率至关重要,且模型通常需要跨领域和训练阶段组合或恢复能力(Xiao et al., 2026; Zeng et al., 2026; Wang et al., 2026a; DeepSeek-AI, 2026)。
当前 LLM 流程中的大多数 OPD 实现使用 token 级估计器,尽管它相对于序列级反向 KL 是有偏的(Lu & Lab, 2025)。一个基本原因是,序列级目标将每个 token 更新与许多未来奖励耦合,这在长时域设置中会使优化显著更嘈杂。我们将这一权衡明确化:token 级 OPD 移除了未来奖励耦合,因此是有偏的,但它具有更有利的最坏情况方差缩放。我们的玩具实验在经验上展示了相同模式,更强的未来耦合导致更高的梯度方差和更不稳定的优化。这表明长时域训练的实用设计原则:保持 token 级监督以控制方差。
在当前 LLM 流程中,这一 token 级目标通常通过采样 token 比较来实现:在每个训练步骤,更新由采样 token 上的教师-学生对数概率差驱动(Lu & Lab, 2025; Xiao et al., 2026)。这种实现简单高效,但一旦 rollout 变长,其学习信号就会变得脆弱。Gu et al. (2024) 报告了重复等退化输出,这与我们的观察一致。近期工作还报告了在某些情况下采样 token OPD 下的熵坍缩(Ko et al., 2026; Jin et al., 2026b)。更近期,有报告称全词表蒸馏在某些设置中优于采样 token 变体(Zhao et al., 2026; DeepSeek-AI, 2026),表明单 token 形式可能未充分利用有用的教师信息。
我们的经验分析表明,这种脆弱性源于若干反复出现的失效模式。特别地,我们识别出两个目标级问题:单 token 信号通常高度不平衡,且教师指导在学生生成前缀上可能变得不可靠。我们还观察到 tokenizer 或特殊 token 不匹配带来的额外实现级问题,这可能进一步扭曲单 token 比较。综合来看,这些结果指向一个实际问题:我们如何在保留 token 级 OPD 方差优势的同时,使其监督信号在实践中不那么脆弱?
上述分析表明对标准采样 token 目标进行有针对性的修改。我们将单 token 监督替换为教师 top-K 局部支持匹配,即在每个前缀上,在教师支持的 token 子集上比较教师和学生,而非仅在采样 token 上。我们将该目标实现为截断反向 KL,并结合 top-p rollout 采样和特殊 token 掩码。由此产生的更新保持局部且低成本,同时提供不那么脆弱的训练信号。
总体而言,我们的主要贡献如下:
我们阐明了 OPD 中的理论权衡:token 级 OPD 相对于序列级 OPD 是有偏的,但在序列长度上具有显著更好的最坏情况方差缩放,使其对长时域 LLM 后训练具有吸引力。我们提供了经验分析,说明采样 token OPD 在实践中为何不稳定,强调两个反复出现的目标级问题——单 token 监督不平衡和学生生成前缀上教师指导不可靠——以及 tokenizer 或特殊 token 不匹配带来的额外实现问题。我们提出教师 top-K 局部支持匹配作为采样 token OPD 的分析驱动修订,使用截断反向 KL、top-p rollout 和特殊 token 掩码实现,并表明在单任务数学推理和多任务智能体加推理训练中,它比采样 token OPD 产生更稳定的优化和更强的经验性能。
2 理解采样 Token OPD:权衡与失效模式
2.1 从反向 KL 到 token 级 OPD
γ=0 的情况恢复 token 级 OPD,而 γ=1 恢复因果序列级估计器。我们在双任务玩具实验中进一步验证这一权衡(图 1):更强的未来耦合导致显著更高的梯度方差和更不稳定的优化。这促使我们在本文剩余部分关注 token 级监督,其中主要问题变为如何在实际 LLM 设置中改进其局部训练信号。额外实验细节见附录 E。
2.2 采样 token OPD 在实践中为何脆弱
尽管 token 级 OPD 从偏差-方差角度看颇具吸引力,但标准采样 token 形式在实践中可能脆弱。我们分离出三种失效模式:(1) 高度不平衡的 token 级蒸馏信号,(2) 学生生成前缀上教师指导不可靠,以及 (3) tokenizer 或特殊 token 不匹配引入的扭曲。这些观察来自数学推理上的采样 token OPD 实验,使用 Qwen2.5-7B-Instruct(Qwen et al., 2024)作为学生,OpenThinker3-7B(Guha et al., 2025)(基于 Qwen2.5-7B-Instruct 构建的 SFT 模型)作为教师。
高度不平衡的采样 token 信号。在采样 token OPD 中,步骤 t 的更新由单个采样 token 上的对数比率驱动:
logq(yt∣ct)−logπθ(yt∣ct).
当学生比教师对采样 token 赋予更高概率时,会产生负奖励。如图 2 所示,大多数采样 token 获得负奖励。这使得优化被一小部分局部正 token 主导,因此训练对高频填充词和短续写敏感,这些内容可能获得有利的局部分数,但对轨迹级质量贡献甚微。
教师信号在学生生成前缀上可能变得不可靠。采样 token OPD 假设学生生成 token 上的教师概率是轨迹质量的有用代理。在学生对常见但教师不常见的前缀上,该代理变得不可靠。在这些区域,即使轨迹已漂移到重复、自重置推理或其他无意义续写,高教师概率的 token 仍可能获得奖励(图 3;附录 H)。这在 token 级教师一致性与轨迹级质量之间产生了目标不匹配。
我们假设两个因素放大了这一问题:尖锐的教师分布,其中适度的教师-学生不匹配可能产生大的对数比率值;以及长 rollout 上不断增长的教师-学生分歧。与这一观点一致,图 4 显示教师-学生差距的分布在序列后期变得更宽。
Tokenizer 和特殊 token 不匹配。采样 token OPD 使用教师分布比较学生生成的确切 token。当两个模型使用不同 tokenization 时,相同的原始文本可能被不同分割,因此学生生成的 token 在教师下可能不对应自然 token(Boizard et al., 2025; Patino et al., 2025; Minixhofer et al., 2025)。例如,学生可能将 'think>' 生成为 'think', '>',而教师期望 '<th', 'ink', '>'。那么 token '<' 从教师获得低概率,即使两个模型产生相同的语义内容。特殊 token 如序列结束标记也会出现类似不匹配。在这种情况下,单 token 比较将语义分歧与 tokenizer 不匹配混淆。由于监督应用于单个 token,这种不匹配会扭曲奖励信号。
这些观察促使我们超越单 token 监督:不是仅比较采样 token,而是在每个前缀上比较教师和学生在教师支持的下一 token 续写集合上的分布,同时保留 token 级更新以保持稳定性。
3 方法
我们的方法是对上述失效模式的直接回应:保留 token 级 OPD,但将单 token 监督替换为在每个前缀上教师选择的支持集上的分布级比较。这产生截断反向 KL 目标,保持局部更新的效率,同时减少对任何单个采样 token 的依赖。第 3.1 节介绍目标,第 3.2 节描述确保稳定训练的实际选择。
3.1 教师 top-K 局部支持匹配
3.2 实际稳定化选择
支持集重归一化。重归一化是必要的,因为目标在截断支持集而非全词表上评估。具体而言,我们在支持集内的 logits 上应用单独的 softmax,因此梯度不会直接传播到该集合外的 token。没有这一步,优化可能变得不稳定,因为支持集内的教师和学生概率质量无法直接比较。
Top-p rollout 采样。我们使用 top-p 采样生成 rollout。无约束采样偶尔会产生极低概率 token,造成教师信号信息量较低且优化不稳定的前缀。Top-p 采样使轨迹更接近典型续写,并使教师信号更可靠。
特殊 token 掩码。我们掩码有问题的特殊 token,以减少不兼容 tokenization 约定导致的假阴性。这是一个正交的实际修复:在我们的实验中,它显著帮助采样 token OPD,而我们的局部支持目标对其敏感度低得多。原则上,也可以合并多 token 标记变体或对等价 tokenization 求平均,但我们不追求这些 tokenizer 特定补救措施,因为掩码是最简单的模型无关校正。
4 实验
我们在三种设置中评估局部支持匹配:单任务数学推理(第 4.2 节)、数学和智能体任务的交替多任务训练(第 4.3 节),以及较小学生模型上的额外单任务智能体设置(附录 G.1)。我们还在第 4.4 节展示消融,并在附录 G.2 提供训练动态分析。
4.1 设置
我们在 ver-agent 框架(Feng et al., 2025)之上实现局部支持匹配,使用 Qwen2.5-Instruct 模型作为学生。我们考虑两种主要设置。第一种是单任务数学推理,其中 OpenThinker3-7B(Guha et al., 2025)作为教师,训练使用 DAPO-Math-17K(Yu et al., 2025)的英文部分,最大上下文长度为 16K。第二种是多任务设置,在数学推理和基于 ALFWorld(Shridhar et al., 2021)的多轮智能体任务之间交替批次。在此设置中,数学使用 OpenThinker3-7B(Guha et al., 2025)作为教师,而智能体侧使用发布的 GiGPO-Qwen2.5-7B-Instruct-ALFWorld 检查点(Feng et al., 2025)。
对于数学推理,我们报告五个基准上的 pass@1:Math500(Hendrycks et al., 2021)、AIME24(Zhang & Math-AI, 2024)、AIME25(Zhang & Math-AI, 2025)、Minerva(Lewkowycz et al., 2022)和 OlympiadBench(He et al., 2024)。对于 ALFWorld(Shridhar et al., 2021),我们默认报告成功率。在少数情况下,我们还报告数学基准上的 avg@32。更多实验设置细节见附录 F。
4.2 单任务数学推理
表 1 显示局部支持匹配在单任务数学推理中优于采样 token OPD。采样 token OPD 已将学生从 28.2 提升至 36.4 平均分,但仍显著低于教师。对采样 token OPD 应用特殊 token 掩码进一步将平均分提升至 40.7,表明 tokenizer 相关不匹配是失效的重要部分。
我们方法的两个变体在平均分上均优于采样 token OPD 及其掩码变体。这表明增益并非仅归因于不匹配处理,而是支持更强分布级蒸馏信号的作用。此外,掩码对我们方法的影响仅适度(41.7 对 41.5),与局部支持匹配对 tokenizer 不匹配不如单 token 监督敏感的观点一致。WebShop(Yao et al., 2022)上的额外证据见附录 G.1。
4.3 多任务智能体加推理训练
表 2 显示局部支持匹配在交替多任务训练中对两个任务族的影响不同。未掩码版本将平均匹配分数从 34.8 提升至 41.7(+19.8%),同时保持有竞争力的 ALFWorld 性能。掩码版本取得最佳 ALFWorld 分数 97.7,但放弃了部分数学提升。这一模式表明局部支持匹配对混合中的推理侧特别有帮助,因为采样 token 信号更易受前缀漂移影响;相比之下,掩码主要在此次运行中将权衡转向智能体任务。除评估性能外,我们的目标还产生持续更好的优化动态。我们将完整学习曲线和诊断图推迟到附录 G.2。
表 1:单任务数学推理结果。
| 方法 | Math500 | AIME24 | AIME25 | Minerva | OlympiadBench | Avg. |
|---|---|---|---|---|---|---|
| Qwen2.5-7B-It | 68.2 | 13.3 | 0.0 | 26.5 | 32.9 | 28.2 |
| OpenThinker3-7B | 92.2 | 53.3 | 40.0 | 39.0 | 55.6 | 56.0 |
| Sampled-token OPD | 80.0 | 10.0 | 16.7 | 32.4 | 43.1 | 36.4 |
| Sampled-token OPD w/ mask | 81.4 | 26.7 | 16.7 | 34.2 | 44.7 | 40.7 |
| Ours w/o mask | 80.4 | 23.3 | 26.7 | 34.2 | 43.9 | 41.7 |
| Ours w/ mask | 82.0 | 23.3 | 23.3 | 34.9 | 43.9 | 41.5 |
表 2:ALFWorld 和数学推理批次交替多任务训练结果。
| 方法 | ALFWorld | MATH500 | AIME24 | AIME25 | Minerva | OlympiadBench | Avg. |
|---|---|---|---|---|---|---|---|
| Qwen2.5-7B-It | 21.9 | 68.2 | 13.3 | 0.0 | 26.5 | 32.9 | 28.2 |
| GiGPO-Qwen2.5-7B-It-Alfworld | 95.3 | - | - | - | - | - | - |
| OpenThinker3-7B | - | 92.2 | 53.3 | 40.0 | 39.0 | 55.6 | 56.0 |
| Sampled-token OPD | 90.6 | 74.8 | 13.3 | 13.3 | 32.1 | 40.5 | 34.8 |
| Sampled-token OPD w/ mask | 93.8 | 76.0 | 20.0 | 13.3 | 33.5 | 40.4 | 36.6 |
| Ours w/o mask | 95.3 | 82.0 | 33.3 | 16.7 | 32.7 | 44.0 | 41.7 |
| Ours w/ mask | 97.7 | 79.0 | 20.0 | 16.7 | 34.6 | 42.5 | 38.6 |
4.4 消融
表 3 和图 6 表明增益来自若干设计选择,而非任何单一修改。仅教师 top-K 比较不足:rollout 策略还必须保持在稳定区域,添加 top-p 采样将最初较弱的 top-K 变体转变为更强配置。在相同 top-p rollout 条件下,教师 top-K 局部支持匹配仍将 AIME24 avg@32 从 21.6 提升至 23.6。截断支持集内的重归一化至关重要,移除它会导致快速坍缩。一旦 K 足够大,性能对确切支持大小不太敏感,但当支持太小或 rollout 完全无约束时,训练变得不稳定。
表 3:单任务数学训练下的组件消融。
| 方法 | AIME24 avg@32 |
|---|---|
| Qwen2.5-7B-Instruct | 10.0 |
| OpenThinker3-7B | 63.3 |
| Sampled-token OPD | 20.4 |
| Sampled-token OPD + top-p | 21.6 |
| Teacher top-K | 17.7 |
| Teacher top-K + top-p | 23.6 |
Top-K 支持变体。我们的主要实验在教师 top-K 支持上定义截断期望。替代目标可以在教师 top-K(用于主要结果)、学生 top-KK 或教师 top-K 增强学生采样 token 上计算期望。我们在表 4 中提供单任务和多任务设置下的初步比较。
表 4:单任务和多任务设置下的替代 top-K 支持变体。
(a) 单任务设置下的替代 KL 期望支持。
| 方法 | AIME24 avg@32 | MATH500 | AIME24 | AIME25 | Minerva | OlympiadBench | Avg. |
|---|---|---|---|---|---|---|---|
| teacher top-K | 23.6 | 80.4 | 23.3 | 26.7 | 34.2 | 43.9 | 41.7 |
| student top-K w/ sampled | 22.3 | 82.4 | 30.0 | 16.7 | 35.7 | 44.9 | 41.9 |
| teacher top-K w/ sampled | 22.4 | 81.6 | 26.7 | 23.3 | 36.4 | 46.7 | 42.9 |
(b) 多任务设置下的替代 KL 期望支持。我们报告所有数学推理基准的 pass@1。最后一列仅平均 pass@1 指标。
| 方法 | ALFWorld | MATH500 | AIME24 | AIME25 | Minerva | OlympiadBench | Avg. |
|---|---|---|---|---|---|---|---|
| teacher top-K | 95.3 | 82.0 | 33.3 | 16.7 | 32.7 | 44.0 | 41.7 |
| student top-K w/ sampled | 95.3 | 65.6 | 10.0 | 10.0 | 25.0 | 31.6 | 28.4 |
| teacher top-K w/ sampled | 94.5 | 63.2 | 10.0 | 10.0 | 21.0 | 30.1 | 26.9 |
在单任务设置中,三个变体取得大致相当的结果。教师 top-K + 采样 token 变体取得最高平均 pass@1 分数,而学生 top-K 在若干单个基准上表现有竞争力,原始教师 top-K 在三个变体中给出最佳 AIME24 avg@32。多任务结果不太一致。在该设置中,原始教师 top-K 变体显著优于其他两个替代方案,而学生 top-K 和教师 top-K + 采样 token 变体在数学基准上大幅退化。因此,我们将这些结果视为支持构造重要的证据,但不过度解读变体之间的排名。
总体而言,这些结果表明 KL 期望计算位置的选择可能以非平凡方式产生影响,尤其是在多任务设置中。我们将其视为部分消融和初步探索,并在附录 A 中讨论可能原因,包括支持集构造和剩余离策略效应。
5 结论
本工作从理论和实现角度重新审视了 LLM 后训练中的同策略蒸馏(OPD)。我们的理论分析表明 token 级 OPD 为何是长时域训练的有吸引力近似:它相对于序列级反向 KL 是有偏的,但避免了未来奖励耦合,并具有显著更好的最坏情况方差缩放。同时,我们的经验研究表明,标准采样 token 实现可能提供脆弱监督,因为其信号不平衡,在学生漂移前缀上可能保持误导,且对 tokenizer 或特殊 token 不匹配敏感。教师 top-K 局部支持匹配通过保留局部 token 级更新,同时将单 token 监督替换为截断分布级比较,解决了这些问题。在单任务数学推理和交替智能体加推理训练中,这一简单修改改善了优化稳定性和下游性能,优于采样 token OPD,同时也阐明了教师匹配在何处仍是任务成功的非完美代理。