本文深入浅出地介绍了大模型在行动与反馈闭环中的应用,以及为何多数应用停留在简单动作上。文章提出了“harness engineering”(驾驭工程)这一概念,详细解析了编码 agent 的三张核心图:架构、时序、控制逻辑,并以 Claude Code 为例进行拆解。此外,还探讨了如何通过控制逻辑实现人对模型的干预,以及当前已收敛和未收敛的技术要点。对于想要学习大模型并提升其应用能力的读者来说,本文提供了宝贵的见解和实用指导。
近两年,agentic 成了 AI 圈最热的词。它的核心,是让大模型走出一问一答:调用工具 → 观察结果 → 决定下一步——行动与反馈构成闭环。靠这个闭环,模型第一次能替人做事,而不只是回答问题。
但多数应用停留在网页会话、读文件、跑命令、查资料、写文档这类简单动作上,面对复杂些的实际问题就无从下手:改了不该改的文件;上下文塞爆,越聊越糊涂;跑了半天,token 账单先到了;最尴尬的一种——让它清理后台进程,它把自己杀了(后面讲这个真实事故)。
这个落差,不在大模型本身不够聪明,而在模型的支撑系统。由此,最近一年工程圈多了一个新词:harness engineering。harness 本义是马具——把马力变成拉力的那套缰绳、轭具和车架。模型是马,harness 是驾驭它的整套装置,本文姑且译作
驾驭工程。
要看懂任何一个编码 agent——Claude Code、Codex CLI、OpenCode、Gemini CLI——三张图就够了:架构(谁在做事)、时序(何时发生、如何衔接)、控制逻辑(人如何介入)。本文以 Claude Code 为例拆这三张图,但结论对整类工具成立:它们的骨架是同一副。
一、架构:谁在做事
回答:谁在做事,靠什么相连。
先立一句总纲:模型出主意,程序干活。
云端的大模型是个无状态的推理引擎。它没有记忆——每一轮都"失忆重读"你发给它的全部内容;它没有手脚——碰不到你的文件系统,一条命令也执行不了。它唯一会做的事:读入一大段文字,输出一段文字,或者输出一个"我想调用某工具"的意图。
本地程序(harness)负责其余一切:读配置、拼请求、真正执行工具、管理进程和权限。
图 1 · 架构:谁在做事,靠什么相连
两个虚线区域是物理边界:左为本地电脑,右为云端。harness 左栏是内容资产——被程序扫描、被模型阅读的文件;右栏是运行机件——真正做事的机器。所有"智能"都在右上角的无状态大模型里,所有"能力"都在程序及其下游。一条阅读窍门:凡是紫色出现的地方,就有模型在参与判断——右上的大模型如此,权限闸门里的 auto 分类器小框也如此。会话存储中检查点与转录默认保留 30 天(可调),记忆文件则持久不清理。文件何时被装箱发送,见图 2;人握着哪些旋钮,见图 3。
这张图上有三件事值得停一下。
第一,harness 内部分两栏,性质完全不同。左栏是内容资产:记忆(Memory)、技能(Skills)、子代理定义(Agents)、插件(Plugins)——全是文件,自己不做事,等着被读。由于既要同程序交互、又要同模型交互,这些文件有个共同的对偶结构:上半段的元数据给程序读(决定何时加载、给谁用),正文给模型读(真正的指令)。右栏是运行机件:权限闸门、Hooks 引擎、子代理孵化器、调度器——全是程序逻辑,真正做事的机器。
第二,紫色的读法。图里凡是出现紫色,就有模型在参与判断。右上角的大模型是紫的;权限闸门里嵌着一个紫色小框——auto 档的闸门里坐着一个分类器小模型,专门替你审每个动作放不放行。这是把"模型"用在"管模型"上。
第三,子代理孵化器值得单独记一笔。它开出一个全新的循环:全新的上下文、裁剪过的工具集,分身独立干活,只把蒸馏后的报告交回来。一次真实测量:子代理调查代码时烧了 38k token 的上下文,主对话只收到一份几百字的报告——中间过程一个字都不占主对话的地方。这是对抗上下文膨胀最有效的一招。
二、时序:何时发生、如何衔接
回答:一次会话里,什么先发生、什么后发生。
架构图是静态的。真正的机制藏在时序里。
图 2 · 时序:一次会话里,何时发生什么
四条泳道:用户、程序、MCP 服务器、大模型。红色虚线框住两个关键区间——启动(只发生一次,配置清单就此定格)与循环(装箱 → 发送 → 意图 → 闸门 → 执行 → 回填,直到模型输出纯文本)。由这张图可直接推出三件事:① 上下文会膨胀——历史每轮全量重发;② 规则文件每轮生效——每轮都重新装箱;③ 改配置要重启——清单在启动时已定格。⚓ 标注的是 hooks 的主干挂载缝隙(全部约 30 个);📸 是每条消息的自动检查点;✋ 是计划模式的人审闸。
看懂这张图的钥匙是"装箱"。每一轮,程序都把三件行李打包发给模型:① 系统提示词(内置指令 + 你的规则文件 + 记忆)、② 全部对话历史、③ 全部工具定义。模型对世界的全部认知,就是这三件行李——多一个字都没有。
由此可以推出(不是背出)三个日常现象:
上下文会膨胀。
行李②每轮全量重发,工具结果不断写回历史,包越来越沉。这是长会话变贵、变慢、变糊涂的机制根源。
规则文件每轮生效。
CLAUDE.md 这类文件被拼进行李①,每轮都重新装箱——所以改了立刻管用。
改配置要重启。
工具清单、hooks 清单在启动时一次性定格(图里的红框"阶段一")。会话中途新增的配置,这个会话看不见。
图里那些 ⚓ 锚点,是 harness 暴露的缝隙:执行工具之前(PreToolUse)、之后(PostToolUse)、模型说"我做完了"的时候(Stop)……约 30 个位置,每个都能插入一段你写的确定性脚本,这就是 hooks。
讲个真实事故,说明缝隙为什么重要。让 agent 清理一个后台进程,它执行了pkill -f 模式串——而这个模式串恰好出现在它自己所在的命令行里,于是命令把自己所在的进程杀了,会话当场退出(exit 144)。怎么防?把"别这么干"写进规则文件,是劝说——进的是行李①,模型通常会听,但不保证。在 PreToolUse 这个缝隙插一段脚本,解析命令、检测自匹配、直接拒绝并给出替代写法,是强制——程序层执行,模型绕不过去。劝说会失效,强制不会。这个区分是 harness 工程里最值钱的一条。
三、控制逻辑:人如何介入
回答:从"教它"到"锁死它",人有哪些控制手段。
前两张图讲机器怎么转。第三张图讲人怎么管。
图 3 · 控制逻辑:人握着哪些旋钮
八条层带从上到下:控制手段离模型越来越远、强制力越来越硬(左侧箭头即此轴)。层带颜色表示作用侧:紫=模型侧、蓝=程序侧、绿=OS 侧、琥珀=用户参与/劝说;右侧标注每层回答的问题,以及它对应图 1 的哪个构件、图 2 的哪个时刻。两极:⓪ 是"劝说"(改内容,模型可以不听),hooks 是"强制"(程序执行,模型绕不过)——hooks 贯穿各层,所以不单列;中间各层是劝说与强制之间的刻度。③ 里的紫色小框再次提示:auto 档的闸门里坐着一个分类器小模型。
八层旋钮,其实是一根轴:从劝说到强制。
最软的一端是 ⓪ 内容层:改 CLAUDE.md、记忆、技能,等于改写模型每轮读到的东西——教它,但它可以不听。往下逐渐变硬:② 计划人审(Plan Mode)让它先出方案、你批准了才动手,批准之前写入被硬阻断;③ 执行闸门给出六档权限模式,从 manual(逐条问你)到 bypassPermissions(全放行),中间还有 dontAsk 这样为无人值守设计的档——注意它的语义是"不问即拒",不是"不问即做"。最硬的一端是 ⑥ OS 层:沙箱直接在操作系统上划白名单,权限规则之下再设一道物理防线。
单独说一下 ④ 调度层,它藏着一笔明白账。让模型每隔几分钟醒来检查一次部署状态,每次唤醒都是一次完整的推理调用,带着全部行李——这叫模型起夜,很贵。换成调度器的 Monitor:程序盯着输出流,一行匹配的日志都没有就什么也不做,事发那一刻才叫醒模型——程序值班不要钱。同一件事,成本差一个数量级。判断标准就一句话:静默期谁在值班?
四、站在 2026:哪些定了,哪些没定
已经收敛的:
agent 循环同构。
装箱 → 发送 → 意图 → 执行 → 回填,所有主流 CLI agent 都是这一个循环。这是方法论里最通用的一层。
工具总线收敛到 MCP。
这套外接工具协议已被 OpenAI、Google 等采纳,跨工具通用性最好。
上下文文件正在收敛到 AGENTS.md。
Codex CLI、OpenCode 等用这个开放约定;Claude Code 用 CLAUDE.md,Gemini CLI 用 GEMINI.md——名字不同,机制相同:进行李①的劝说层。
审批与沙箱思路一致。
Codex CLI 的 suggest / auto-edit / full-auto 档位,与六档权限模式是同一根轴;沙箱用 Linux Landlock / macOS Seatbelt,与 bubblewrap 思路相同——权限之下再设 OS 防线。
还没收敛的:
hooks 机制各家差异大。
缝隙暴露多少、能不能拦截改写,没有统一约定。
子代理与多代理编排百花齐放。
从单 agent 分身到编排几十上百个 agent 的工作流,各家路线分歧最大。
迁移到任何一个新 harness,问三个问题就能摸清底细:行李①②③分别在哪配置?闸门怎么设?哪些逻辑跑在程序侧、不经过模型? 这三问,就是本文的全部内容压缩成一行。
五、结尾:下一层杠杆
harness 解决的是单回合的问题:安全、高效、可控地跑完"装箱 → 意图 → 执行"这一圈。
但工程师真正想要的往往是:交个任务,拿回一个验证过的结果——中间的反复试错、跑测试、修失败,不需要人一步步推。那需要在 harness 外面再套一环:目标、验证、状态、停止条件。
那一环叫 loop 工程。下一篇讲。
如何学习大模型 AI ?
由于新岗位的生产效率,要优于被取代岗位的生产效率,所以实际上整个社会的生产效率是提升的。
但是具体到个人,只能说是:
“最先掌握AI的人,将会比较晚掌握AI的人有竞争优势”。
这句话,放在计算机、互联网、移动互联网的开局时期,都是一样的道理。
我在一线科技企业深耕十二载,见证过太多因技术卡位而跃迁的案例。那些率先拥抱 AI 的同事,早已在效率与薪资上形成代际优势,我意识到有很多经验和知识值得分享给大家,也可以通过我们的能力和经验解答大家在大模型的学习中的很多困惑。我们整理出这套AI 大模型突围资料包:
- ✅ 从零到一的 AI 学习路径图
- ✅ 大模型调优实战手册(附医疗/金融等大厂真实案例)
- ✅ 百度/阿里专家闭门录播课
- ✅ 大模型当下最新行业报告
- ✅ 真实大厂面试真题
- ✅ 2026 最新岗位需求图谱
所有资料 ⚡️ ,朋友们如果有需要《AI大模型入门+进阶学习资源包》,下方扫码获取~
① 全套AI大模型应用开发视频教程
(包含提示工程、RAG、LangChain、Agent、模型微调与部署、DeepSeek等技术点)
② 大模型系统化学习路线
作为学习AI大模型技术的新手,方向至关重要。 正确的学习路线可以为你节省时间,少走弯路;方向不对,努力白费。这里我给大家准备了一份最科学最系统的学习成长路线图和学习规划,带你从零基础入门到精通!
③ 大模型学习书籍&文档
学习AI大模型离不开书籍文档,我精选了一系列大模型技术的书籍和学习文档(电子版),它们由领域内的顶尖专家撰写,内容全面、深入、详尽,为你学习大模型提供坚实的理论基础。
④ AI大模型最新行业报告
2025最新行业报告,针对不同行业的现状、趋势、问题、机会等进行系统地调研和评估,以了解哪些行业更适合引入大模型的技术和应用,以及在哪些方面可以发挥大模型的优势。
⑤ 大模型项目实战&配套源码
学以致用,在项目实战中检验和巩固你所学到的知识,同时为你找工作就业和职业发展打下坚实的基础。
⑥ 大模型大厂面试真题
面试不仅是技术的较量,更需要充分的准备。在你已经掌握了大模型技术之后,就需要开始准备面试,我精心整理了一份大模型面试题库,涵盖当前面试中可能遇到的各种技术问题,让你在面试中游刃有余。
以上资料如何领取?
为什么大家都在学大模型?
最近科技巨头英特尔宣布裁员2万人,传统岗位不断缩减,但AI相关技术岗疯狂扩招,有3-5年经验,大厂薪资就能给到50K*20薪!
不出1年,“有AI项目经验”将成为投递简历的门槛。
风口之下,与其像“温水煮青蛙”一样坐等被行业淘汰,不如先人一步,掌握AI大模型原理+应用技术+项目实操经验,“顺风”翻盘!
这些资料真的有用吗?
这份资料由我和鲁为民博士(北京清华大学学士和美国加州理工学院博士)共同整理,现任上海殷泊信息科技CEO,其创立的MoPaaS云平台获Forrester全球’强劲表现者’认证,服务航天科工、国家电网等1000+企业,以第一作者在IEEE Transactions发表论文50+篇,获NASA JPL火星探测系统强化学习专利等35项中美专利。本套AI大模型课程由清华大学-加州理工双料博士、吴文俊人工智能奖得主鲁为民教授领衔研发。
资料内容涵盖了从入门到进阶的各类视频教程和实战项目,无论你是小白还是有些技术基础的技术人员,这份资料都绝对能帮助你提升薪资待遇,转行大模型岗位。