此前绝大多数 Agent 开发者会忽视 Harness 调度层,一味堆基座大模型,最近人们发现大模型 Agent 的表现并不只看基座模型,中间那层把模型、提示词、工具、记忆和控制流串起来的运行时 Harness 才是关键。它决定了任务怎么拆、工具怎么调、决策怎么流转。
可眼下市面上几乎所有 Agent 框架(LangChain、AutoGen、Claude Code、DeerFlow )的 Harness 全靠人工静态开发,换模型、工具、领域就要重写脚手架,轨迹数据也无法用于自动优化。
更麻烦的是提示词、工具封装、重试、记忆全搅在同一条代码里,改一处容易牵一发动全身,跨场景复用只能复制粘贴。
更致命的是二者优化互不连通:Harness 产出的轨迹白白浪费,模型提升也无法同步更新调度,双重性能天花板难以突破。
为解决这一问题,来自小米的研发团队Darwin Agent Team 提出了一套将 AI Agent 的运行时框架“代码化、可组合、可观测、可演化”的工程系统:HarnessX。
在五个基准测试(ALFWorld、GAIA、WebShop、tau^3-bench 和 SWE-bench Verified)中,HarnessX 平均涨幅为 +14.5%(最高可达 +44.0%);同场景下基座模型越弱,提升幅度越大,弱模型Qwen 在 ALFWorld 从 53% → 97%,强模型 Sonnet 4.6 仅提升 11.2%/9.7%/10.9%。
论文标题:
HarnessX: A Composable, Adaptive, and Evolvable Agent Harness Foundry
论文链接:https://arxiv.org/abs/2606.14249
github链接:https://darwin-agent.github.io/HarnessX/
01
可像搭乐高一样随便拼的Harness
研究团队把 Harness 当成能像乐高积木一样随意拆装的“一等公民”,即能序列化、能哈希、能直接替换。最小积木块是 Processor,八个生命周期钩子把控制点卡死,再配上九维行为分类,把模型选择、上下文、记忆、工具、沙箱、奖励、安全、追踪到训练桥接全覆盖。
想加功能、换逻辑、删组件?就像搭乐高一样直接安全插拔,冲突自动拦住,其他代码一行都不用动。
02
会自己看轨迹越跑越聪明的
AEGIS进化引擎
HarnessX 的核心,就是让 AEGIS 自己“看轨迹、学教训、越跑越聪明”。它把 Harness 演化直接映射成强化学习MDP:当前配置加历史轨迹库是状态,安全编辑(加工具、改提示、重构流程)是动作,任务得分加完整轨迹是奖励。
四阶段流水线全由同一个元大模型驱动,先压缩海量原始轨迹抓关键故障,再规划哪些坑踩过、哪些方向还没试,接着生成类型安全的候选 Harness 修改方案。
最后 Critic 盯着奖励欺骗(reward hacking),确定性闸门强制“新方案不能让任何已解决任务变差”,进而解决灾难性遗忘。
再配上变体隔离,多套 Harness 并行跑、任务自动路由,改一类任务绝不会把另一类搞崩。
03
模型与Harness一起越变越强的闭环
Harness 演化和模型 RL 训练共享同一个回放缓冲区:Harness 这边用 AEGIS 做无参数符号化编辑,模型这边用跨 Harness 的 GRPO 做参数微调。
同任务下不同脚手架跑出来的轨迹放一组比相对优势,模型就能学会在各种执行流程里都能找到最优策略,而不是死磕单一固定套路。离线复用轨迹,几乎零额外环境交互成本,Harness 和模型可以在同一闭环中共同提升。
04
性能评估
(1)实验配置
在 GAIA、ALFWorld、WebShop、τ³-Bench 和 SWE-bench Verified 上,用 Claude Sonnet 4.6、GPT-5.4 和 Qwen3.5-9B 作为任务模型,固定用 Claude Opus 4.6 做元进化,任务智能体分三档覆盖强弱模型:Claude Sonnet 4.6、GPT-5.4、Qwen3.5-9B,对比 Static Harness 和 Claude Code SDK,最多跑 15 轮(连续 3 轮没提升就提前停),用 Pass@2 成功率来衡量。
(2)核心结果
如表4所示:在仅进化 Harness(模型冻结)的主实验中,15 组「模型 + 基准」实验中 14 组性能提升,平均绝对提升 + 14.5%,最高提升 44.0%;
如表5所示:在针对同模型(GPT-5.4)同数据集(GAIA)的消融实验1中,全局单 Harness峰值 73.8%,最终跌至 49.5%,严重灾难性遗忘,总 token 消耗为143.7M;
变体隔离峰值最终 87.4%,无退化,token 仅 107.8M,算力节省 25%。
如表6所示:在针对AEGIS 四阶段 vs 单阶段 Claude Code SDK 进化器的消融实验2中,虽然最终精度差距极小(87.4% vs 86.4%),但 AEGIS 节省 14% token 消耗,轨迹压缩带来更高效率与可解释性。
如图5所示:在 GAIA 与 WebShop 数据集下,对比 “AEGIS” 与 “Co-Evolution” 两条曲线,单独进化调度框架最高仅达 37.4%、49.0%;
启用联合优化后峰值分别上涨至 41.7%、54.0%,充分验证协同闭环可解决单一优化存在的性能上限瓶颈。
05
展望
目前这套方案已经在同分布任务上验证了 Harness 可组合、轨迹驱动自动进化以及与模型协同优化的可行性,展现出打破传统静态脚手架双重天花板的潜力。
不过局限也很明显:
1)进化过程只在同分布任务上做过测试,域外泛化能力尚未验证;
2)当前主要面向文本离散动作的 Agent,对连续控制或多模态场景的支持还是空白;
3)整个进化引擎高度依赖能力较强的元模型,成本与可及性仍有约束。
未来如果能补上跨域泛化实验、扩展到更丰富的动作空间,并降低对超强 LLM 的依赖,这条路径有望真正把 Agent 的运行时层从“手工搭建”推向“持续自我进化”。
学AI大模型的正确顺序,千万不要搞错了
🤔2026年AI风口已来!各行各业的AI渗透肉眼可见,超多公司要么转型做AI相关产品,要么高薪挖AI技术人才,机遇直接摆在眼前!
有往AI方向发展,或者本身有后端编程基础的朋友,直接冲AI大模型应用开发转岗超合适!
就算暂时不打算转岗,了解大模型、RAG、Prompt、Agent这些热门概念,能上手做简单项目,也绝对是求职加分王🔋
📝给大家整理了超全最新的AI大模型应用开发学习清单和资料,手把手帮你快速入门!👇👇
学习路线:
✅大模型基础认知—大模型核心原理、发展历程、主流模型(GPT、文心一言等)特点解析
✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑
✅开发基础能力—Python进阶、API接口调用、大模型开发框架(LangChain等)实操
✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用
✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代
✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经
以上6大模块,看似清晰好上手,实则每个部分都有扎实的核心内容需要吃透!
我把大模型的学习全流程已经整理📚好了!抓住AI时代风口,轻松解锁职业新可能,希望大家都能把握机遇,实现薪资/职业跃迁~