你有没有想过一个问题:一个每天都在跟外部世界打交道的AI,到底有没有从这些经历里学到东西?
现在的大语言模型早就不只是聊天机器人了。它们会调用工具、执行代码、跟各种环境反复交互,产生大量的行为数据。听起来这应该是个宝库,毕竟人类进步的一大动力就是从经验里吸取教训。但奇怪的是,几乎所有评测AI能力的基准测试,考的都是它在某一个瞬间的水平,像一张静态的成绩单,却从来不问一个更根本的问题:这个模型能不能靠自己积累的经验,变得比昨天更聪明?
字节跳动Seed团队联合M-A-P、TokenWave.AI搞了一个新基准,专门回答这个问题,名字叫S?Gym。这个名字里藏着三个S开头的能力:Self-Testing(自我测试)、Self-Judging(自我评判)、Self-Improvement(自我提升)。他们想搞清楚的是,AI能不能像人一样,先自己动手试一试,再回头判断哪些做对了哪些做错了,最后把这些判断转化成真正更好的行为。
这事儿说起来简单,做起来却处处是坑。
学习这件事,到底难在哪
杜威和科尔布这两位教育学家早就说过一个道理:经验本身不会自动变成知识,只有经过反思和重新应用,经验才能沉淀成能力。卡尔·波普尔讲科学进步时也是类似的逻辑:进步靠的是不断把猜想拿去接受检验,暴露错误。
这套逻辑放到AI身上同样成立。一个模型光是攒了一堆交互记录是没用的,它得先自己去试出一些有信息量的证据,然后判断哪些行为成功了、为什么成功,最后把这些判断真正转化成下一次决策的改变。这三步环环相扣,任何一环掉链子,整个链条就断了。
问题是,经验可以用完全不同的方式被"记住"。最直接的方式是**上下文学习**(In-Context Learning,简称ICL:不改变模型参数,直接把过去的交互记录塞进当前的对话上下文里,让模型"看着"这些记录做决策),把之前的对话历史原封不动地塞进上下文里,让模型下次决策时能"看到"这些记录。这种做法保留了细节,但会把上下文塞得满满当当。
另一种方式更聪明一点,叫**摘要记忆**(Summary Memory:把冗长的交互历史压缩成简洁的策略规则、常见错误和下次改进方向,类似于把一本书读薄成几条笔记),先让模型自己把冗长的交互历史提炼成几条策略规则、几个常犯的错误、几条下次该注意的方向。这就像看完一本厚厚的教材后自己整理出一页复习笔记。信息密度更高了,但也可能在压缩的过程中丢掉关键细节。
第三种方式最激进,直接对模型参数动手,叫**参数训练**(Parameter Training:把筛选过的高质量交互样本转化为监督微调数据,直接更新模型权重,让经验永久地"刻"进模型里)。相当于不是记笔记,而是直接把知识刻进脑子里,理论上更持久,但风险也最大,万一学进去的经验本身是错的呢?
这三条路子各有各的算盘。原始历史保留细节但占地方,摘要节省空间但依赖判断力,训练能长久保留但可能把错误也一起学进去了。研究团队想搞清楚:这三条路,到底哪条真的能让AI变强,又是在什么条件下能变强。
实验场是七款小游戏
S?Gym没有选那种复杂的现实任务,而是设计了七款文字类游戏,分别考察不同的能力:象棋式的隐藏规则推理、扫雷式的约束满足、一个叫Nullify的数值消除游戏、俄罗斯方块式的空间规划、贪吃蛇式的长时程控制、植物大战僵尸式的资源分配、还有一个叫"信任演化"的多智能体博弈游戏。
每款游戏都设计了两套配置:一套宽松的**探索配置**(Exploration Configuration:条件相对宽容的环境设置,比如更小的棋盘、更弱的惩罚、更多试错机会,用于让模型积累经验),允许模型多试几次、犯几次错也没关系;还有一套严格的**评估配置**(Evaluation Configuration:条件更苛刻的环境设置,用来检验模型积累的经验是否真的管用,而不是单纯记住了某个具体场景),规则更狠,用来真正检验模型学到的东西能不能扛得住实战。
这个设计其实藏着一个很关键的用心。如果探索和评估用的是同一套规则,模型完全可以靠死记硬背某个具体局面来"作弊",而不是真正理解了策略。就像老师出考试题,如果原题和平时作业一模一样,考的就不是理解力,是记忆力。S?Gym故意让评估环境比探索环境更严格,棋子从12个变成22个,扫雷从有两条命变成一碰雷就死,这样模型必须真正提炼出可迁移的规律,才能在更难的场景里站得住脚。
一整套流程分成五步:探索、判断、整合、更新、评估。模型先在宽松环境里自由试错,积累一批带着自我打分的交互记录;然后自己判断哪些是好经验、哪些是坏经验;接着按不同路径(原始历史、摘要、训练)把这些经验整合起来;再用整合后的经验更新自己(或者更新它能看到的上下文);最后拿到严格的评估环境里接受检验。
这里有个很巧妙的设计细节。在探索阶段,环境真实的验证结果(也就是那个"标准答案")是不告诉模型的,模型只能靠自己给自己打分。这样做的目的是把"模型自以为学到了什么"和"模型实际上学到了什么"这两件事分开来看,如果这两者对不上,就说明模型的自我判断能力本身有问题,而不是它学习能力有问题。这就像一个学生做完模拟题后不给标准答案,只让他自己估分,然后事后再拿真实分数一对比,就能看出这个学生到底有没有自我评估的眼光。
上下文记忆够用吗:七个模型的表现分化
研究团队测试了包括GPT-4o、GPT-4.1、o3-mini、Gemini-2.5-Flash、Gemini-2.5-Pro、GPT-5.5、Gemini-3.5-Flash在内的七款主流模型,让它们分别用"原始历史"和"摘要记忆"两种方式积累经验,然后在30轮探索过程中每隔3轮拿到严格环境里考一次。
结果挺有意思的:没有一款模型是全能冠军。
在原始历史模式下,Gemini-3.5-Flash在象棋任务上表现最强,在贪吃蛇和信任演化任务上进步幅度最大;而GPT-5.5则在扫雷、Nullify、俄罗斯方块这些"脆弱"任务上领先,在植物大战僵尸上进步最猛。换成摘要记忆模式,排名又变了:GPT-5.5变成了象棋、Nullify、俄罗斯方块的第一名,Gemini-3.5-Flash则继续保持在植物大战僵尸和信任演化上的领先。
这说明一件挺反直觉的事:模型本身有多强,跟它能不能有效利用自己的经验,是两回事。
更值得琢磨的是摘要记忆和原始历史谁更好用这件事。答案不是一边倒的。
Gemini-2.5-Flash用摘要记忆之后,扫雷任务的持续进步指标从0直接冲到7.79,植物大战僵尸从24.4飙到238.5。GPT-5.5的象棋成绩也在摘要模式下从0.47涨到16.84。这说明当经验能被压缩成一套稳定可复用的规则时,摘要记忆确实管用。
但反过来的例子也不少。GPT-5.5在植物大战僵尸上,摘要模式反而让进步指标从548.5跌到33.2。Gemini-3.5-Flash的象棋进步指标从12.28直接归零,信任演化任务从200跌到55。
这背后的逻辑其实挺清楚的。有些游戏靠的是一套抽象策略,比如信任演化博弈里"对方一直背叛就跟着背叛"这种规则,一旦提炼出来就能到处套用。但有些游戏,比如扫雷和贪吃蛇,成败取决于当前这一步棋盘上具体哪个格子是安全的、蛇头前面是不是有障碍物,这种信息高度依赖具体状态,一旦被压缩成几句笼统的建议,反而丢了最要命的细节。
**摘要记忆不是万能药,它是一种有选择性的压缩机制。**
这就好比你去徒步旅行前看攻略。如果路线固定、地形规律性强,比如"沿着河走就不会迷路",那看一份精简攻略就够了,不需要背下每一步的岔路细节。但如果是那种地形随时在变的丛林,比如今天下过雨这块地就是泥潭、那棵倒下的树昨天还没倒,你光记一句"注意脚下"根本没用,你需要的是逐条具体的现场记录。如果这时候还硬要压缩成几条通用建议,反而会让你在关键岔路口做出错误判断,因为那些真正决定生死的细节,早就在压缩的过程中被丢掉了。
参数训练:能治病,但也能致命
上下文层面的记忆终究是"外挂",真正让人好奇的是,如果直接把经验刻进模型参数里,会发生什么?
研究团队拿了一个80亿参数的模型Qwen3-8B做实验,让它经历20轮连续的训练检查点,第0轮是原始模型,第1到19轮是用探索经验持续微调后的版本。每一轮都拿到严格环境里跑一次七款游戏的评估。
结果堪称一部跌宕起伏的剧情。
在信任演化任务上,训练效果好得惊人。分数从0一路涨到最高30分,在19个更新检查点里有18个都超过了初始基线,平均分达到8.68。这说明博弈类任务里蕴含的策略确实能通过参数更新被稳定学进去。
但象棋和贪吃蛇的表现就没这么给力了。象棋在大多数检查点都停留在0分,只在最后一轮爬到了0.067,算是有微弱进步。贪吃蛇更是坐了过山车,在第8、12、15轮短暂达到1分,之后又跌回0,说明训练偶尔能发现一些好策略,但没能把它稳住。
扫雷、Nullify、俄罗斯方块这三款游戏在整个训练过程里干脆一分没涨过。研究者猜测可能是探索阶段成功案例太少,不足以撑起一个有效的监督信号,但这个猜想还需要更细致的轨迹分析来验证。
最戏剧性的是植物大战僵尸。原始模型的初始分数是23分,结果每一轮训练之后的分数都跌到了6分,而且持续了整整19轮都没回升。
**这意味着参数更新有可能把模型原本已经掌握的好行为直接覆盖掉。**
这一幕让人联想到一件很朴素的生活经验。假设你原本已经能熟练地骑自行车了,突然有人拿着一套"新手教学视频"逼你重新学一遍,如果这套视频质量参差不齐,甚至有几段教学动作是错的,你原本流畅的骑车技能反而可能被这些错误示范污染,变得比学习之前更差。参数训练就是这样一把双刃剑,如果喂给模型的探索经验本身质量不高、或者探索环境和评估环境差异太大、又或者模型自我打分本身就不准,那么这次"重新学习"很可能不是进步,而是一场退步。
自我打分靠谱吗:这才是真正的瓶颈
到这里就该问一个更根本的问题了:模型给自己打的分,到底准不准?
研究团队做了一次大规模的核验,覆盖七个模型、七款游戏、两种记忆模式,一共98次运行、超过11万6千个交互步骤。他们把模型自己打的分和环境真实给出的验证分数逐条对比。
结果显示,自我判断的可靠性参差不齐。植物大战僵尸、贪吃蛇、俄罗斯方块、扫雷、Nullify这几款游戏的"事件一致性"(也就是模型判断"这步是好是坏"跟真实结果是否一致)都还不错,但这个高一致性很大程度上是因为大部分交互本来奖励就是零,猜零蒙对的概率天然就高。
真正能反映校准精度的是**归一化平均绝对误差**(NMAE:衡量模型自我打分的数值和真实奖励数值之间的偏差程度,数值越低说明模型的打分越精准)。俄罗斯方块和Nullify的NMAE很低,说明模型不仅能判断对错,连打分的力度都拿捏得比较准;但植物大战僵尸的NMAE却是所有游戏里最高的,尽管它的二元一致性看起来还不错。
这说明一件挺微妙的事:模型可能觉得"这一步应该是有用的",但对于这一步到底值多少分,估计得离谱。
象棋和信任演化是两个最惨烈的翻车现场。象棋的事件一致性几乎跟瞎猜差不多,而且模型的**过度自信率**(Over-confidence:模型自己打了正分,但环境实际给的是负分或零分的情况,反映模型"自我感觉良好"但实际做错了)特别高。这不难理解,象棋任务里模型要预测多枚棋子接下来的位置,只要有一两个棋子的坐标猜错了,整个答案就算失败,但模型自己可能觉得"我大部分都答对了,应该给个正分",这种局部正确和整体失败之间的落差,恰恰是自我评判最容易翻车的地方。
信任演化也是类似的情况,一致性弱、误差大、过度自信率高。
这些数据指向一个共同的结论:**当奖励依赖于隐藏的动态过程、对手的策略、或者需要精确预测多个对象的状态时,模型的自我判断能力就会明显下降。**
而当奖励来自一个能立刻观察到的局部结果时,自我判断反而相对可靠。
更让人意外的是接下来这个发现。研究团队把探索过程切成一个个时间段,逐段计算这段时间里的判断准确度,然后看这个准确度能不能预测下一次评估时的分数提升。结果整体的相关系数只有-0.01左右,几乎为零。也就是说,**一个模型即使在某段时间里判断得特别准,也不代表它在下一轮评估里就会表现得更好。**
这个结果乍一听有点反常识,但细想其实很合理。判断准只是第一步,光是知道"哪一步做对了"是不够的,还得知道"为什么对"、"这个道理能不能用到别的场景"、"下次遇到类似情况该怎么调整策略"。这就好比一个学生做完模拟题后,能准确判断出哪几道题做错了,但如果他不去分析错误背后的知识漏洞,只是记住"这道题我错了",那下次换一道类似但不完全一样的题,他大概率还是会栽在同一个坑里。**能识别对错,和能把对错转化成可复用的策略,是完全不同的两种能力。**
摘要真的能提炼出有用的经验吗
研究团队还专门扒出了一批具体的案例,看看什么样的摘要真的管用,什么样的摘要只是花架子。
有几个成功案例挺说明问题。GPT-5.5在信任演化任务里,摘要精准地提炼出"当对方的收益结构一贯偏向背叛时,就该持续背叛,不要做无谓的合作试探"这条规则,直接带来了66.89的进步指标提升。o3-mini在俄罗斯方块里学会了"同时观察当前方块和下一个方块,测试不同的旋转方式,优先消行,保持棋面低平不留孔洞",也带来了14.42的提升。Gemini-2.5-Flash在扫雷任务里总结出一套局部数字约束的推理规则,比如"扩展零区域、标记必然是雷的格子、揭开确定安全的格子",让进步指标涨了25.49。
但失败的案例同样典型,而且失败的原因惊人地一致:这些摘要说得都挺对,但都太笼统了,没法真正指导下一步的具体操作。
GPT-5.5在植物大战僵尸任务里总结出"优先生产阳光、早期布防、用坚果墙拖延时间、覆盖威胁车道",这些建议单独拎出来看每一条都是对的,但因为没有说清楚具体哪条车道现在最危险、当前阳光预算够不够,所以实际执行起来分数反而从38.67跌到32.33。Gemini-3.5-Flash在象棋任务上生成了一份详细的规则摘要,提醒自己"记住每个棋子的移动规律,提交答案前核实所有坐标",结果实际对局里却直接输出了END,颗粒无收,进步指标暴跌33.27。
**这些例子揭示了一个共同的道理:一份好的摘要,必须精确到能在新的具体场景里直接被执行,而不是停留在正确却空洞的原则层面。**
这让人想起职场里常见的一种现象。有的团队复盘会开完之后,得出的结论永远是"要加强沟通"、"要重视细节",这些话听起来无懈可击,但下次遇到具体问题的时候,团队成员依然不知道该怎么办,因为这些结论没有落到"在什么场景下、遇到什么信号时、具体该做哪个动作"这个颗粒度上。真正有用的复盘,得像那份俄罗斯方块的摘要一样,"同时看当前和下一个方块,测试旋转角度,优先消行",每一步都能直接对应到下一次的实际操作,而不是停留在"要打得更好"这种正确的废话上。
写在后面
读完这篇研究,最触动我的不是某个具体的实验数字,而是那个几乎为零的判断-改进相关系数。这个发现挺颠覆认知的,我们通常默认"知道自己错在哪"是变强的前提,但这篇论文用数据说明,知道错在哪和真正变强之间,隔着一条巨大的鸿沟,这条鸿沟不是靠更准确的打分就能填平的。
还有一个细节值得单独说说:植物大战僵尸那次训练崩溃,初始23分掉到6分,而且是持续19轮都没能恢复。这种"一次训练就永久性损伤"的现象,某种意义上比那些没有进步的任务更值得警惕,因为它说明参数训练这条路不是"最差情况下原地踏步",而是真的存在"越训越差"的可能性,而且这种损伤是有惯性的,不会自己修复。
这让我想起一个可能有点跳跃但确实真实的联想:这跟人在遭遇一次重大失败后陷入某种思维定式、之后每次决策都被那次失败过度影响,其实是同一种机制。模型如果把一次探索里质量不高的经验当成了普遍规律去学习,它接下来的所有行为都会被这个错误的规律带偏,而且很难靠自己纠正回来,除非有一个外部的、独立的信号能提醒它"你学错了"。
这篇论文没有回答的问题,恰恰是我觉得最值得继续追问的:既然自我判断本身就不够可靠,那AI要靠什么样的机制才能识别出自己判断错了?这可能需要一种更高层的元认知能力,不仅要判断"这一步做得对不对",还要判断"我判断这一步对不对的方法,本身靠不靠谱"。这听起来有点像套娃,但恰恰是真正的自我改进绕不开的一层。
Q&A
Q1:S?Gym是什么?
A:S?Gym是字节跳动Seed团队联合M-A-P、TokenWave.AI推出的一个交互式基准测试,专门用来评估大语言模型能否通过自我测试、自我评判把交互经验转化为真正的自我提升,覆盖象棋、扫雷、俄罗斯方块等七款文字游戏。
Q2:摘要记忆和原始历史哪种方式让AI进步更快?
A:没有绝对的答案,取决于任务类型。当经验能被压缩成稳定可复用的策略规则时,比如信任演化博弈、俄罗斯方块,摘要记忆效果更好;但当成败依赖具体状态细节时,比如扫雷、贪吃蛇,原始历史往往比摘要更管用。
Q3:AI能靠参数训练稳定变强吗?
A:不稳定。实验中Qwen3-8B在信任演化任务上训练效果很好,但在植物大战僵尸任务上出现了持续19轮的负迁移,分数从23跌到6且没有恢复,说明训练效果高度依赖任务、探索经验质量和自我判断的可靠性。