部署后的大模型Agent能自己改错提升性能吗?
你有没有发现,现在基于大模型的智能 Agent 部署后就一直“原地踏步”:明明已经积累了一堆失败交互轨迹,比如调用工具错格式、走流程丢状态、重复踩同一个坑,却没法自己根据这些失败自动改进运行逻辑。
之前想要优化 Agent,要么改大模型本身的权重,对推理部署成本要求很高;要么靠人工写固定的改进规则,或者让大模型prompt改harness,但效果忽上忽下甚至越改越差。来自上海交通大学和小红书的研究团队提出了全新思路:让专门的“harness工程师”从失败轨迹里学习,直接改Agent的运行时逻辑,不用动目标Agent的权重就能稳定提升性能。
论文技术速览
▌核心贡献:首次提出基于在线强化学习的失败条件可执行运行时Harness学习编辑方法
▌性能指标:原生Qwen3.5-9B成功率从44.3%提升至53.6%(+9.3pp)|目标微调后再提5.0pp
▌代码状态:已开源
▌技术谱系:固定规则Harness优化 → 固定编辑器Harness搜索 → 在线强化学习训练编辑器
Agent进化赛道上,被忽略的关键环节
大模型Agent要持续自我进化,其实有两个可以优化的地方:一个是改决策核心大模型的权重,另一个是优化大模型外面的“ harness”——也就是负责组装上下文、转发工具调用、校验动作、出错恢复的整套运行逻辑。相同的大模型权重,换个好的harness,性能能差出一大截。
一开始大家优化harness都是靠固定规则,比如统一加个Self-Refine自我反思步骤,结果实验发现这个规则在三个基准测试里全都是降性能。后来有工作让强模型当编辑器改harness,但编辑器本身是固定不动的,改完好不好全看碰运气,收益不稳定,有时候甚至改完更差了。还有一些工作只优化prompt、记忆这类单一组件,没法全生命周期改整个现有运行时。
那能不能专门训练一个“harness工程师”,让它根据目标Agent的失败轨迹,学怎么改可执行的运行时,改完好不好用实际跑出来的结果说了算?这就是Harness-R1要解决的核心问题。
分离训练:9B工程师改harness,目标Agent冻住不碰
Harness-R1的核心设计非常巧妙:把“改harness的工程师”和“做任务的目标Agent”完全分开,全程只训练工程师,目标Agent的权重一动不都动,相当于专门训练一个AI给另一个AI修bug改流程。
我们可以把这个过程类比成:餐厅里目标厨师炒菜手艺不变,我们专门训练一个配菜流程设计师,厨师每次炒失败菜,设计师就根据失败记录改配菜、出餐的流程,改完让厨师重新炒同一批菜,好吃不好吃直接给设计师打分,只改设计师的设计能力,不改厨师的手艺。
图2:Harness-R1整体框架:收集目标Agent的失败轨迹打包,工程师生成可执行补丁修改运行时四个生命周期节点,补丁装好后目标重跑任务,结果反馈用来训练工程师。
具体来说,整个方法分为两个核心部分:
1. 可干预的运行时生命周期钩子
Harness-R1允许工程师在目标Agent运行时的四个节点加修改钩子,完全不碰目标Agent本身的权重:
回合初始化:设置起始上下文和回合状态
决策前:在目标做决策前给上下文加检索引导、接口约束
动作前:在动作发给环境前做规范化、重写或者拦截无效动作
反馈后:拿到环境反馈后检查轨迹,卡住的时候触发恢复
所有补丁都会先做有效性校验,无效补丁不会生效,不会把整个Agent改崩。
2. 两阶段训练:冷启动SFT + 基于结果的GRPO优化
冷启动监督微调(SFT):先让强教师大模型根据失败轨迹生成合格的harness修改,过滤掉无效补丁后做成微调数据集,初始化工程师模型,让工程师先学会怎么出格式正确、能运行的补丁。
基于结果的分组相对策略优化(GRPO):从SFT初始化的策略开始,对每个失败包采样8个候选补丁,每个补丁装好后让目标Agent重跑同一批任务,按照任务结果算奖励,同一个失败包的8个候选做奖励归一化得到优势,再用 clipped 代理损失更新工程师参数,全程只有工程师参数更新,目标一直冻结。
三大基准测试验证:性能提升稳定可靠
我们来看Harness-R1在WebShop、ALFWorld、DBBench三个经典交互式Agent基准上的实验结果:
表1:三大基准的主实验结果,Score是整形奖励,Succ.是任务成功率,Avg.是三个基准成功率的等权重平均。
图1:三个基准的匹配基线奖励变化,菱形是等权重平均值,固定Self-Refine在三个基准上都降低了奖励,现有其他编辑器收益不稳定。
从主结果可以得到三个核心结论:
训练过的工程师提升远优于其他方法:原生Qwen3.5-9B目标Agent,Harness-R1把平均成功率从44.3%拉到53.6%,涨了9.3个百分点,比只做SFT的工程师高7.1个百分点,也比最强的固定大模型编辑器GLM-5.2的48.8%高4.8个百分点。而固定方法Self-Refine反而降了2.5个百分点,证明固定规则远不如学习出来的编辑策略可靠。
工程师和目标Agent可以共同进化:如果先把目标Agent做微调,平均成功率已经升到59.2%,再针对这个微调后的目标训练专门的Harness-R1工程师,还能再涨5个百分点到64.2%,说明哪怕目标已经升级了,harness编辑还是能带来额外收益,二者可以共同进化。
图3:跨目标泛化的成功率提升,所有 unseen 目标的平均提升都是正的。
泛化能力极强:训练好的工程师直接用在20个训练时没见过的目标模型上,平均成功率涨了7.06个百分点,63组目标-基准组合里56组都有提升,所有目标的平均提升都是正的。对于没见过的任务,用10个失败生成的补丁,能让1270个留存任务平均涨8.9±1.5个百分点,而大模型固定编辑器反而会降性能,说明结果驱动训练出来的编辑能力比单纯堆模型尺度更可靠。
图4(a):稀疏失败证据下对留存任务的泛化结果,Harness-R1在所有随机种子上都能实现正提升,远优于大模型固定编辑器。
最后做消融实验看哪个生命周期节点改了最有用:去掉动作前置校验会降3.9个百分点,去掉反馈后恢复会降3.3个百分点,说明动作管控和失败恢复是harness提升的核心,而且不同环境的核心节点不一样,Harness-R1能自动学习适配,这也是固定规则做不到的。
学AI大模型的正确顺序,千万不要搞错了
🤔2026年AI风口已来!各行各业的AI渗透肉眼可见,超多公司要么转型做AI相关产品,要么高薪挖AI技术人才,机遇直接摆在眼前!
有往AI方向发展,或者本身有后端编程基础的朋友,直接冲AI大模型应用开发转岗超合适!
就算暂时不打算转岗,了解大模型、RAG、Prompt、Agent这些热门概念,能上手做简单项目,也绝对是求职加分王🔋
📝给大家整理了超全最新的AI大模型应用开发学习清单和资料,手把手帮你快速入门!👇👇
学习路线:
✅大模型基础认知—大模型核心原理、发展历程、主流模型(GPT、文心一言等)特点解析
✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑
✅开发基础能力—Python进阶、API接口调用、大模型开发框架(LangChain等)实操
✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用
✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代
✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经
以上6大模块,看似清晰好上手,实则每个部分都有扎实的核心内容需要吃透!
我把大模型的学习全流程已经整理📚好了!抓住AI时代风口,轻松解锁职业新可能,希望大家都能把握机遇,实现薪资/职业跃迁~