一、研究背景与挑战
核心问题:现实任务中,LLM常需处理预训练时未见过的新知识(如产品文档、实验报告)。这种“即学即用”的能力被称为上下文学习(Context Learning)。但现有模型在这方面表现不佳。
现有方案的局限:一种直观思路是“技能增强”——从上下文中提取规则和流程,写成自然语言的“技能”指导模型。但这面临两大障碍:
人工成本过高:长而专业的内容,人工提炼技能耗时费力,难以规模化。
缺乏外部反馈:不像数学或编程能自动验证答案对错,这类任务没有自动反馈信号来判断技能质量。
二、提出的方法:Ctx2Skill框架
针对上述挑战,作者提出了Ctx2Skill,这是一个完全自动化、无需人工标注和外部反馈的自我演进框架。其核心设计包含两部分:
1. 多智能体自我对弈循环(Self-Play Loop)
框架中五个角色协同工作,通过“对抗”来共同进步:
挑战者(Challenger):负责根据上下文生成测试任务和详细的评分标准,专门“刁难”推理者。
推理者(Reasoner):在自身技能集的指导下,尝试解决这些任务。
评判者(Judge):严格评判推理者的答案是否通过所有标准,将结果分为“失败”和“成功”。
提议者与生成者(Proposer & Generator):这是演进的关键。失败案例被用来更新推理者的技能(补充缺失知识),成功案例则被用来更新挑战者的技能(让它下次出更难的题)。双方通过这种“失败驱动”的文本编辑,无需修改模型参数即可共同进化。
2. 跨时重放机制(Cross-Time Replay)
在自我对弈中,可能出现“对抗性崩溃”——挑战者出的题越来越偏,推理者的技能也过度专精于这些怪题,导致泛化能力下降。
为解决此问题,该机制在每一轮都会收集“最难失败题”和“最简单成功题”作为代表。
对弈结束后,它会用这些代表题重新评估历史上每一版的技能集,最终选出在困难和简单任务上表现最均衡的那一版技能,确保技能的通用性。
三、实验与主要结果
研究在权威的上下文学习基准(CL-bench)上进行了评估,涵盖四类复杂任务。
显著提升模型性能:Ctx2Skill为不同的骨干模型(如GPT-4.1, GPT-5.1)带来了持续且显著的提升。例如,它将GPT-4.1的解题成功率从11.1%提升至16.5%,将GPT-5.1从21.2%提升至25.8%。
优于基线方法:相比“直接让模型生成技能”或“简单切分文档生成技能”的方法,Ctx2Skill的优势非常明显,尤其是在需要深度推理的任务上。
技能质量更高:评估显示,Ctx2Skill生成的技能在忠实度、清晰度、有效性等维度上均优于对比方法,且更具可读性和可重用性。
技能可迁移:实验还发现,由强模型(如GPT-5.1)生成的技能,可以直接帮助弱模型(如GPT-4.1)提升性能,展示了其良好的迁移性。
四、研究贡献与意义
提出全新框架:首次实现了在无任何人工监督和外部反馈的情况下,为复杂上下文自动构建高质量技能集。
解决核心难题:有效应对了上下文学习中技能构建的两大瓶颈(成本高、无反馈),并设计了机制防止自我对弈中的“对抗性崩溃”。
实用性强:生成的技能是自然语言形式,易于理解和修改,且可作为插件即插即用地提升任意模型的上下文学习能力,具有很高的实用和推广价值。
总的来说,这篇论文提供了一个“以技能为媒介,让模型教会自己如何学习新知识”的自动化解决方案,为提升LLM在真实世界复杂场景下的适应能力开辟了一条新路径。这里是自己的论文阅读记录,感兴趣的话可以参考一下,如果需要阅读原文的话可以看这里,如下所示:
摘要
许多现实世界的任务要求语言模型(LM)对超出其参数化知识的复杂上下文进行推理。这需要上下文学习(context learning),即语言模型直接从给定的上下文中学习相关知识。一个直观的解决方案是推理时的技能增强(inference-time skill augmentation):从上下文中提取相应的规则和过程,形成显式的自然语言技能。然而,为上下文学习场景构建此类技能面临两个基本挑战:为冗长、技术密集的上下文进行人工技能标注的成本过高,以及缺乏用于自动化技能构建的外部反馈。在本文中,我们提出了 Ctx2Skill,一个自我演进的框架,能够在无需人工监督或外部反馈的情况下,自主地发现、改进和选择特定于上下文的技能。其核心是一个多智能体自我对弈循环(multi-agent self-play loop),其中挑战者(Challenger)生成探测性任务和评分标准(rubrics),推理者(Reasoner)在演进中的技能集指导下尝试解决这些任务,而中立的评判者(Judge)则提供二元反馈。关键地,挑战者和推理者都通过积累的自然语言技能进行演进:专用的提议者(Proposer)和生成者(Generator)智能体分析失败案例,并将其综合成针对双方的有针对性的技能更新,从而实现自动化的技能发现和改进。为了防止因日益极端的任务生成和过度 specialized 的技能积累而导致的对抗性崩溃(adversarial collapse),我们进一步引入了跨时重放(Cross-time Replay)机制,该机制为推理者一方识别出在代表性案例上实现最佳平衡的技能集,确保技能演进的鲁棒性和泛化性。所得的技能可以插入任何语言模型,以获取更好的上下文学习能力。在来自 CL-bench 的四个上下文学习任务上的评估表明,Ctx2Skill 一致性地提高了各种骨干模型的求解率,例如,将 GPT-4.1 从 11.1% 提升至 16.5%,将 GPT-5.1 从 21.2% 提升至 25.8%。
1 引言
当前的语言模型(LM)在处理其相关知识在大规模预训练期间已存在的问题上表现出色 [5, 27, 39],例如竞赛级别的数学问题 [14] 和竞争性编程挑战 [17]。然而,许多现实世界的任务要求语言模型从复杂的上下文中学习,并利用新知识而非参数化知识进行推理和有效解决 [26, 36, 47]。先前的工作将这种能力称为上下文学习 [12]。有效的上下文学习使模型能够超越其预训练知识进行推理,并通过直接从丰富的上下文信息中学习来解决复杂的、特定领域的任务,这与人类的方式非常相似。例如,它允许语言模型快速利用以前未见过的产品文档来生成逐步的操作流程或排查问题。
尽管上下文学习在解决现实世界任务中扮演着核心角色,但在当前研究中它却 largely 被忽视了 [16]。一个关键障碍是现实世界上下文的多样性:上下文知识可以通过书籍、实验数据和搜索结果等形式传达,这使得上下文学习从根本上变得困难。一个直观的范式是推理时的技能增强 [3],即从上下文中提取规则和过程,形成编码了可重用过程知识的自然语言技能。这种方法在许多智能体任务中已被证明是有效的 [42, 49, 37],例如编码智能体 [24]。然而,该范式在上下文学习场景中面临两个基本挑战。具体来说,(1)人工技能标注的 prohibitive 成本:现有的智能体技能库主要通过人工标注构建 [18, 20, 41]。然而,这种范式在上下文学习场景中行不通,因为上下文是冗长的、技术密集的和领域特定的。策划高质量的技能需要标注者完全内化复杂的、多章节的文档,这一过程既在认知上要求高,在经济上也不可行,使得人工策划的技能构建在大规模上不切实际。(2)自动化技能构建缺乏外部反馈:与可以通过执行反馈或与标准答案比较来评估技能质量的编码或数学推理等可验证任务 [7, 31] 不同,上下文学习任务缺乏自动反馈来评估提取的技能是否忠实地、完整地捕获了特定于上下文的知识。仅给定了上下文,没有外部反馈信号来告知生成的技能是否有用,或者关键知识是否被遗漏。这种无反馈的特性使得自动化的技能构建流程不适用 [1, 44, 46]。总之,这些挑战凸显了对一个自动化框架的需求,该框架能够在无需依赖人工标注或外部反馈信号的情况下,从上下文中发现技能。
在本文中,我们提出了 Ctx2Skill,如图 1 所示,它被设计为通过技能优化的自我对弈,直接从复杂上下文中自主发现、改进和选择技能,既不需要人工标注,也不需要外部反馈。Ctx2Skill 的核心是一个多智能体自我对弈循环 [10, 22, 48, 21],包含两个竞争但共同演化的角色:一个挑战者(Challenger)智能体,它基于上下文及其技能集生成一批任务和相关的评分标准(rubrics)[15],旨在探测深层的上下文理解;以及一个推理者(Reasoner)智能体,它阅读上下文并在其当前技能集的指导下尝试解决这些任务。Ctx2Skill 的核心思想是两个智能体通过迭代更新各自的技能集而非模型参数来共同演化。具体来说,一个中立的评判者(Judge)智能体根据每个评分标准评估推理者的回答,产生是否通过的反馈。关键地,挑战者和推理者都通过积累的自然语言技能进行演进:失败的案例被路由到推理者侧的专用提议者(Proposer)和生成者(Generator)智能体,以诊断缺失的上下文知识并相应地更新技能;而容易被解决的案例则被路由到挑战者侧,以加强其任务和评分标准的生成策略,确保持续的对抗压力。更新后的技能被延续到下一次迭代,使得双方能够通过失败驱动的文本反馈不断共同演化,而无需任何参数更新。此外,我们识别出这种多智能体自我对弈循环中的一个关键风险,即对抗性崩溃现象(adversarial collapse phenomenon):随着迭代的进行,挑战者可能生成日益极端的任务,而推理者的技能则过度专精于这些病态案例,导致冗余的技能积累,从而损害泛化能力。为了解决这个问题,我们进一步提出了一种跨时重放机制(Cross-time Replay mechanism),该机制选择在代表性案例上实现最佳性能平衡的技能集,确保技能演进的鲁棒性和泛化性。在推理时,所得特定于上下文的推理者技能可以被插入任何 LM,以增强其在相同上下文上处理任意任务(包括在自我对弈循环中未见过的任务)的上下文学习能力。
我们在来自 CL-Bench [12] 的四个上下文学习任务上评估了 Ctx2Skill,包括领域知识推理、规则系统应用、过程任务执行和经验发现与模拟。Ctx2Skill 在所有四个类别和多个骨干模型上一致性地提高了求解率:例如,它将 GPT-4.1 [29] 从 11.1% 提升至 16.5%,GPT-5.1 [27] 从 21.2% 提升至 25.8%,GPT-5.2 [27] 从 18.2% 提升至 21.4%,表明自主发现的特定于上下文的技能提供了显著且可泛化的增益。
图 1:Ctx2Skill 的示意图。它被设计用于从上下文中提取规则和过程,形成自然语言技能,而无需人工标注和外部反馈。
2 相关工作
上下文学习。当前的语言模型在那些相关知识点在预训练期间已存在的任务上表现出色 [9, 27, 33, 34]。然而,许多现实世界的任务要求模型从复杂上下文中学习并利用新知识进行有效推理,这种能力被称为上下文学习 [12]。这种上下文学习能力在实践中至关重要:医生查阅新发布的临床指南来调整治疗方案,工程师阅读文档来执行程序,研究人员从实验数据中归纳模式以形成假设。然而,先前的工作发现,语言模型尚未掌握这种能力 [12]。核心困难在于上下文知识涵盖多种格式,从书籍到实验数据集,且相关的规则和过程常常是隐式嵌入的,需要深度理解而非表面检索。Ctx2Skill 直接针对这一挑战,通过自主地从上下文中发现可重用的、特定于上下文的技能,使任何语言模型都能更好地从复杂上下文中学习和推理。
语言模型的技能。技能是编码可重用过程知识的自然语言模块,用于在推理时增强语言模型 [2, 3],技能增强已在多种智能体任务中得到广泛验证 [32],例如编码 [24] 和网页导航 [42]。早期的技能库主要通过人工标注构建 [18, 19, 20, 41],这虽然有效但难以扩展,尤其是在上下文学习场景中,上下文是冗长的、技术密集的和领域特定的。最近的工作已转向自动化技能构建。AutoSkill [44] 从交互轨迹中提取可重用的行为作为生命周期内的版本化构件,AutoRefine [30] 将智能体轨迹转换为可重用的专业知识。CoEvoSkills [45] 生成多文件技能包并通过生成器-验证器协同演化进行改进,而 EvoSkill [1] 执行失败驱动的改进,形成结构化的技能文件夹。SkillX [40] 将智能体轨迹蒸馏成层次化的技能知识库,并通过执行反馈迭代改进它们。然而,这些方法依赖外部反馈信号 [25],如执行反馈、与标准答案比较或任务完成奖励,来评估和改进技能质量,而这些在上下文学习场景中是不可用的,因为没有自动反馈。另一条研究路线试图将技能内化为模型参数。SKILL0 [23] 使用上下文强化学习(RL)来吸收技能,SkillRL [43] 通过 RL 指导的从教师轨迹中蒸馏,构建层次化的技能库。这些方法需要参数访问,使其不适用于闭源模型,并且牺牲了自然语言技能文档的可解释性。在本文中,我们提出了 Ctx2Skill,一个自我演进的框架,旨在直接从复杂的上下文中发现和演进技能,这不需要人工标注、外部反馈和参数更新。
3 方法
3.1 概述
上下文学习任务 [12] 要求语言模型利用来自长而技术密集的上下文中的上下文知识,进行有效推理和解决问题。一个直观的上下文学习任务范式是推理时的技能增强,即从上下文中提取相应的规则和过程,形成自然语言技能。然而,将这一想法转化为一个有效的框架面临两个困难:(1)人工技能标注的成本过高,以及(2)自动化技能构建缺乏外部反馈。在本文中,我们介绍了 Ctx2Skill,如图 2 所示,这是一个自我演进的框架,能够在无需人工监督或外部反馈的情况下,自主地发现、改进和选择特定于上下文的技能。其核心是一个技能优化的自我对弈循环(§ 3.3),共同演化两个竞争方:挑战者在其自身技能集的指导下,用任务和评分标准探测上下文;推理者在其当前技能集下解决这些任务;中立的评判者返回二元判决,将每个结果路由到特定侧的提议者-生成者对,后者诊断暴露的弱点并相应编辑该侧的技能,使得双方无需人工标注或外部反馈即可共同演化。此外,这个自我对弈框架中的一个关键风险是对抗性崩溃(adversarial collapse):挑战者可能生成日益极端的任务,而推理者的技能过度专精于这些病态案例,导致冗余的技能积累,从而损害泛化能力。为了解决这个问题,我们进一步提出了一种跨时重放机制(§ 3.4),该机制选择在代表性案例上实现最佳性能平衡的技能集,确保技能演进的鲁棒性和泛化性。通过这种方式,Ctx2Skill 自主构建特定于上下文的技能,这些技能可以在推理时插入任何 LM,以增强上下文学习能力,而无需参数更新。
图 2:Ctx2Skill 的概述。(a) 在自我对弈循环中,挑战者生成任务和评分标准,推理者尝试解决它们,评判者将结果路由以更新挑战者和推理者的技能。(b) 跨时重放机制重新评估历史推理者技能候选者在代表性任务上的表现,为未见过的下游任务选择最平衡的技能集。
3.2 问题定义
3.3 Ctx2Skill 框架
为未见过的上下文 C 构建技能集面临两个障碍:人工阅读 C 并写下其上下文知识的成本高昂,并且没有外部反馈信号能告诉我们一个提议的技能是否忠实且有助于 C。为了解决这两个问题,Ctx2Skill 运行一个多智能体自我对弈循环,仅从上下文 C 中自主发现和改进特定于上下文的技能。
3.4 跨时重放机制
§ 3.3 中详述的 Ctx2Skill 框架有意通过更新 SC 来跨迭代加强挑战者,随着推理者的改进而维持对抗压力。然而,这种设计引入了一个我们称之为对抗性崩溃(adversarial collapse)的内在张力。随着迭代的进行,挑战者生成日益极端的任务,这些任务集中在推理者的残余弱
4 实验
在本节中,我们进行实验和分析,以展示 Ctx2Skill 的优势。
4.1 设置
评估。上下文学习是一个新兴的研究课题,旨在要求语言模型从未见过的上下文中学习,并利用超出预训练期间获得的新知识进行推理和解决任务 [12]。这远远超出了主要测试检索或阅读理解的长上下文任务 [6, 35],以及模型通过指令和示例学习简单任务模式的上下文学习任务 [11]。我们选择 CL-bench [12] 进行评估,它包含 500 个复杂上下文、1,899 个任务和 31,607 个验证评分标准,全部由经验丰富的领域专家精心制作。每个任务都被设计为,解决它所需的新内容都包含在相应的上下文中。这些数据分布在四个类别中:领域知识推理、规则系统应用、过程任务执行和经验发现与模拟。评分是严格的“全有或全无”:只有当所有评分标准都通过时,任务才被认为已解决。我们报告每个类别和整体的求解率。评分标准级别的评分遵循原始基准协议,该协议采用 GPT-5.1 作为 LLM-as-a-judge 验证器 [50];该验证器的交叉验证器和人工一致性均超过 90% [12]。
基线。我们首先评估一组前沿 LM,包括 GPT-4.1 [29]、GPT-5.1 [27]、GPT-5.2 [28]、Claude Opus 4.5 [4]、Gemini 3 Pro [8]、Kimi K2.5 [38] 和 DeepSeek V3.2 [9]。对于支持思考模式的模型,我们使用默认的推理努力。对于基于技能的方法,我们智能体都使用 GPT-4.1),而评判者使用 GPT-5.1,与 CL-bench 评估协议 [12] 一致。由于 API 预算限制,我们没有探索更大的 N 或 M;尽管如此,最有效的技能集通常选自早期迭代(§ 4.3),并且每轮 M=5 个任务为提议者提供了足够的案例来综合有意义的诊断模式。
表 1:Ctx2Skill 的主要结果。我们报告了 CL-bench 上四个任务类别的任务求解率。相同骨干模型内的最佳结果以粗体标出。∙∙ 表示使用推理时增强的方法,∙∙ 显示无技能时的推理结果。红色和绿色分别表示相对于无技能模型的性能提升和下降。
| 模型 | 总体 (%) | 领域知识推理 (%) | 规则系统应用 (%) | 过程任务执行 (%) | 经验发现与模拟 (%) |
|---|---|---|---|---|---|
| 前沿 LMs | |||||
| GPT-5.1 | 21.1 | 22.4 | 21.0 | 22.8 | 13.6 |
| Claude Opus 4.5 | 21.0 | 23.7 | 19.0 | 22.6 | 15.1 |
| Kimi K2.5 | 19.2 | 19.1 | 19.4 | 21.3 | 14.4 |
| GPT-5.2 | 18.2 | 19.5 | 18.0 | 19.1 | 12.1 |
| Gemini 3 Pro | 15.8 | 15.5 | 17.7 | 16.4 | 10.1 |
| DeepSeek V3.2 Thinking | 13.2 | 13.6 | 13.8 | 14.2 | 8.0 |
| GPT-4.1 | 11.1 | 10.6 | 14.8 | 10.4 | 4.6 |
| 基于 GPT-4.1 的方法 | |||||
| Prompting | 12.3 (+1.2) | 12.4 (+1.8) | 12.3 (-2.5) | 13.9 (+3.5) | 8.2 (+3.6) |
| AutoSkill4Doc | 13.2 (+2.1) | 13.3 (+2.7) | 13.1 (-1.7) | 15.0 (+4.6) | 8.7 (+4.1) |
| Ctx2Skill | 16.5 (+5.4) | 16.8 (+6.2) | 17.6 (+2.8) | 17.6 (+7.2) | 9.7 (+5.1) |
| 基于 GPT-5.1 的方法 | |||||
| Prompting | 22.1 (+1.0) | 24.7 (+2.3) | 21.1 (+0.1) | 22.4 (-0.4) | 15.5 (+1.9) |
| AutoSkill4Doc | 22.7 (+1.6) | 25.3 (+2.9) | 21.5 (+0.5) | 23.1 (+0.3) | 16.0 (+2.4) |
| Ctx2Skill | 25.8 (+4.7) | 27.9 (+5.5) | 24.9 (+3.9) | 26.9 (+4.1) | 19.1 (+5.5) |
| 基于 GPT-5.2 的方法 | |||||
| Prompting | 19.1 (+0.9) | 19.6 (+0.1) | 18.3 (+0.3) | 22.6 (+3.5) | 11.1 (-1.0) |
| AutoSkill4Doc | 19.7 (+1.5) | 20.5 (+1.0) | 18.8 (+0.8) | 23.0 (+3.9) | 11.6 (-0.5) |
| Ctx2Skill | 21.4 (+3.2) | 22.2 (+2.7) | 20.4 (+2.4) | 25.4 (+6.3) | 12.6 (+0.5) |
将 Ctx2Skill 与两个基线进行比较:(1)Prompting直接提示 LM 读取上下文 C 并在单次传递中生成技能集;生成的技能随后在推理期间被预先附加到 LM。(2)AutoSkill4Doc是专为文档级上下文设计的 AutoSkill [44] 的变体:它将上下文 C 划分为不同的窗口,识别每个窗口内的独立技能,并跨窗口重组技能以产生技能集。两个基线在技能生成和推理时使用与 Ctx2Skill 相同的骨干模型:例如,所有基于 GPT-4.1 的方法都使用 GPT-4.1 进行技能构建和评估,确保公平比较。
实现细节。我们对每个上下文运行 N=5 轮自我对弈迭代,每轮 M=5 个任务。挑战者、推理者、提议者和生成者都使用与相应系列相同的骨干模型(例如,基于 GPT-4.1 的方法中所有四个
表 2:生成技能的质量评估。我们使用 GPT-4.1 作为评判者,从五个维度评估技能:简洁性、忠实度、清晰度、有效性和可重用性。每个维度的最佳结果以粗体标出。
| 模型 | 简洁性 | 忠实度 | 清晰度 | 有效性 | 可重用性 | 平均 |
|---|---|---|---|---|---|---|
| 基于 GPT-4.1 的方法 | ||||||
| Prompting | 81.2 | 79.7 | 80.0 | 83.3 | 84.7 | 81.8 |
| AutoSkill4Doc | 81.3 | 81.4 | 92.4 | 88.7 | 87.2 | 86.2 |
| Ctx2Skill | 85.2 | 84.8 | 96.2 | 90.5 | 92.5 | 89.8 |
| 基于 GPT-5.1 的方法 | ||||||
| Prompting | 80.7 | 88.5 | 94.1 | 94.6 | 95.3 | 90.7 |
| AutoSkill4Doc | 82.0 | 89.1 | 94.2 | 96.0 | 96.0 | 91.5 |
| Ctx2Skill | 82.6 | 93.9 | 98.1 | 96.7 | 96.9 | 93.6 |
| 基于 GPT-5.2 的方法 | ||||||
| Prompting | 80.5 | 84.4 | 92.0 | 90.4 | 92.0 | 87.9 |
| AutoSkill4Doc | 82.2 | 87.0 | 94.0 | 92.2 | 93.0 | 89.7 |
| Ctx2Skill | 85.1 | 89.6 | 96.5 | 94.7 | 94.4 | 92.0 |
4.2 结果
表 1 展示了在 CL-bench 上的主要结果。上下文学习对于当前的前沿 LM 仍然具有挑战性:即使表现最好的模型 GPT-5.1,也仅达到 21.1% 的整体求解率。Ctx2Skill 在所有三个骨干模型上一致性地提高了求解率,将 GPT-4.1 从 11.1% 提升至 16.5%(+5.4%),GPT-5.1 从 21.1% 提升至 25.8%(+4.6%),GPT-5.2 从 18.2% 提升至 21.4%(+3.2%),在所有四个类别上都大幅优于 Prompting 和 AutoSkill4Doc。增益在过程任务执行和经验发现与模拟上尤为显著,这些任务需要对上下文进行更深入的程序性和归纳性推理。相比之下,两个基线只提供了适度的改进,并且偶尔会在个别类别上造成性能下降(例如,Prompting 在 GPT-4.1 上的规则系统应用下降了 2.5%),这表明单次技能提取对于复杂的上下文知识来说是不够的。值得注意的是,带有 Ctx2Skill 技能的 GPT-4.1 (16.5%) 超过了一些更强的无技能前沿模型,例如 Gemini 3 Pro (15.8%),这表明特定于上下文的技能可以弥合显著的能力差距。除了求解率,我们还使用 GPT-4.1 作为评判者,在五个维度上评估生成技能的内在质量(表 2)。Ctx2Skill 在所有三个骨干模型上都取得了最高的平均分,在 GPT-4.1、GPT-5.1 和 GPT-5.2 上分别优于 AutoSkill4Doc 达 +3.6、+2.1 和 +2.3,其中在忠实度和清晰度方面的改进最为显著。这些结果表明,迭代的自我对弈循环产生的技能不仅改善了下游推理,而且以结构良好、人类可读的形式呈现上下文知识,便于检查、编辑和重用。
4.3 分析
消融研究。我们在 GPT-4.1 和 GPT-5.1 上对 Ctx2Skill 的每个组件进行了消融实验(表 3,消融研究块)。移除挑战者技能演进导致了最大的性能下降,证实了持续的对抗压力对于推理者逐步发现上下文知识至关重要。跨时重放机制是第二个最有影响力的组件:没有它,最后一轮的技能会遭受对抗性崩溃。在跨时重放内部,困难探测集的贡献大于简单探测集,移除拉普拉斯平滑也会导致性能下降。将提议者和生成者合并为单一智能体导致了适度但持续的下降,支持了将诊断与技能具体化分离的做法。我们还考察了 CL-bench 的所有子类别在 GPT-4.1 上的影响(图 3)。Ctx2Skill 在绝大多数子类别上都提高了求解率,在工作流编排上增益尤其大 (+11.8%)。
变体设计测试。我们在 GPT-4.1 上检查了三种替代设计(表 3,变体设计测试块)。仅失败者技能更新 (Loser-Only Skill Update)每轮只更新失败的一方;0.5% 的下降
表 3:Ctx2Skill 的分析结果。我们报告了在不同消融设置、变体设计等条件下,CL-bench 上四个任务类别的任务求解率。每个分析块内的最佳结果以粗体标出。∙ 表示使用推理时技能增强,∙ 表示无技能时的推理结果。
| 模型 | 总体 (%) | 领域知识推理 (%) | 规则系统应用 (%) | 过程任务执行 (%) | 经验发现与模拟 (%) |
|---|---|---|---|---|---|
| 消融研究 | |||||
| 基础模型 - GPT-4.1 | 11.1 | 10.6 | 14.8 | 10.4 | 4.6 |
| Ctx2Skill - GPT-4.1 | 16.5 | 16.8 | 17.6 | 17.6 | 9.7 |
| - 无跨时重放机制 | 14.7 | 15.1 | 14.9 | 16.1 | 9.2 |
| - 无解耦提议者和生成者 | 15.9 | 15.9 | 16.7 | 17.4 | 9.7 |
| - 无挑战者技能演进 | 13.8 | 13.9 | 13.9 | 15.7 | 8.7 |
| - 无简单探测集 | 15.7 | 15.7 | 16.3 | 17.4 | 9.7 |
| - 无困难探测集 | 15.2 | 15.6 | 15.6 | 16.5 | 9.2 |
| - 无拉普拉斯平滑 | 15.5 | 15.7 | 16.0 | 17.2 | 9.2 |
| 基础模型 - GPT-5.1 | 21.1 | 22.4 | 21.0 | 22.8 | 13.6 |
| Ctx2Skill - GPT-5.1 | 25.8 | 27.9 | 24.9 | 26.9 | 19.1 |
| - 无跨时重放机制 | 23.0 | 25.6 | 22.0 | 23.3 | 16.0 |
| - 无解耦提议者和生成者 | 25.1 | 27.0 | 24.5 | 25.9 | 18.6 |
| - 无挑战者技能演进 | 22.5 | 25.0 | 21.3 | 23.1 | 16.0 |
| - 无简单探测集 | 24.2 | 26.7 | 23.6 | 23.9 | 18.0 |
| - 无困难探测集 | 24.7 | 26.8 | 24.0 | 25.2 | 18.0 |
| - 无拉普拉斯平滑 | 25.2 | 27.0 | 24.7 | 25.9 | 19.1 |
| 变体设计测试 | |||||
| 基础模型 - GPT-4.1 | 11.1 | 10.6 | 14.8 | 10.4 | 4.6 |
| Ctx2Skill - GPT-4.1 | 16.5 | 16.8 | 17.6 | 17.6 | 9.7 |
| 仅失败者技能更新 | 16.0 | 15.9 | 16.9 | 17.6 | 9.7 |
| 联合结果技能更新 | 15.5 | 15.7 | 16.0 | 17.2 | 9.2 |
| 在公式 (4) 中使用加法评分 | 15.9 | 16.6 | 17.1 | 16.5 | 8.2 |
| 跨时重放机制的效果 | |||||
| 基础模型 - GPT-4.1 | 11.1 | 10.6 | 14.8 | 10.4 | 4.6 |
| Ctx2Skill - GPT-4.1 | 16.5 | 16.8 | 17.6 | 17.6 | 9.7 |
| 使用第 1 轮技能 | 15.9 | 15.9 | 16.7 | 17.4 | 9.7 |
| 使用第 2 轮技能 | 15.6 | 15.7 | 16.2 | 17.2 | 9.7 |
| 使用第 3 轮技能 | 15.6 | 15.7 | 16.2 | 17.2 | 9.7 |
| 使用第 4 轮技能 | 15.2 | 15.6 | 15.6 | 16.5 | 9.2 |
| 使用第 5 轮技能 | 14.7 | 15.1 | 14.9 | 16.1 | 9.2 |
| 技能可迁移性测试 | |||||
| 基础模型 - GPT-4.1 | 11.1 | 10.6 | 14.8 | 10.4 | 4.6 |
| 使用 GPT-5.1 技能的 GPT-4.1 | 16.1 | 16.6 | 17.2 | 17.2 | 8.2 |
| 使用 GPT-4.1 技能的 GPT-4.1 | 16.5 | 16.8 | 17.6 | 17.6 | 9.7 |
| 基础模型 - GPT-5.1 | 21.1 | 22.4 | 21.0 | 22.8 | 13.6 |
| 使用 GPT-4.1 技能的 GPT-5.1 | 23.1 | 24.9 | 22.4 | 24.1 | 16.5 |
| 使用 GPT-5.1 技能的 GPT-5.1 | 25.8 | 27.9 | 24.9 | 26.9 | 19.1 |
图 4:跨时重放选中的迭代分布。** 我们报告了在所有上下文中,最终技能集从每一轮选出的上下文数量。
技能可迁移性测试。我们调查了由一个骨干模型生成的技能是否能使不同的骨干模型受益(表 3,技能可迁移性测试块)。将 GPT-5.1 生成的技能应用于 GPT-4.1 获得了 16.1%,几乎与 GPT-4.1 自己的技能持平;反之,将 GPT-4.1 生成的技能应用于 GPT-5.1 获得了 23.1%,提升了 +2.0%,但明显低于使用 GPT-5.1 自身技能获得的 +4.6%。这种不对称性表明,更强的模型产生的技能能很好地迁移到较弱的模型,而较弱的模型缺乏发现能被更强模型利用的知识的能力。
案例研究。我们在附录 C 中进行了案例研究,以直观地展示 Ctx2Skill 的优势。
5 结论
我们提出了 Ctx2Skill,一个自我演进的框架,能够从复杂上下文中自主发现、改进和选择特定于上下文的技能,无需人工标注或外部反馈。通过技能优化的自我对弈循环,挑战者和推理者通过失败驱动的文本编辑共同演进其技能集,而跨时重放机制通过选择跨迭代最具泛化性的技能集来防止对抗性崩溃。在 CL-bench 上的实验表明,Ctx2Skill 在多个骨干模型和任务类别上一致且显著地提高了上下文学习性能,并且生成的技能是可跨模型迁移的。我们希望 Ctx2Skill 能为语言模型提供一种实用且可扩展的范式,使其能够熟练地从复杂、先前未见过的上下文中学习。