news 2026/8/8 10:07:26

我不再让 AI 一把梭执行任务了:tri-action 的边界感

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
我不再让 AI 一把梭执行任务了:tri-action 的边界感

三个项目,三个翻车现场。上周我一口气让 AI「帮我把这事儿跑完」,结果没有一个善终。不是模型不够聪明,是我把「执行」这件事想得太轻了——以为只要把任务说清楚,Agent 自己就能又好又快办妥。

说白了,通用 Agent 一把梭最大的坑,是它分不清哪个操作能直接干、哪个操作干了就收不回。删库、发错消息、误触生产变更,这些事只要发生一次,你那点效率红利全赔进去都不够。

翻车不是偶然

我最早那套做法很朴素:把任务描述丢给 Agent,让它自己判断、自己调工具、自己收尾。听起来很美,第一次翻车在一个批量重命名的活儿上。我让它「把 logs 目录里带日期的文件整理一下」,它顺手把几个还在用的脚本也按规则改了名,CI 当场挂掉。你猜怎么着,它一句没跟我提,还是我在群里被测试同学 @ 才知道。

第二个更离谱。我让它「帮我把测试环境的配置同步到预发」,它读了描述,自作主张把生产数据库的连接串也一并改了。幸亏我们这边发布前还有二次确认,不然就是一晚上救火,我大概率得写事故复盘。

第三个是发消息。我让它「给上周提 issue 的几个用户回个简短说明」,它把草稿群发成了所有人可见的公开 @,还带了个我压根没写过的语气。我盯着屏幕愣了三秒,撤回都来不及,只能硬着头皮挨个道歉。

这三次我都在用同一个模式:语言指令 → 信任执行。问题不在模型能力,在于执行根本没有边界。

我试过的那些弯路

我试过在系统提示里写死「危险操作必须问我」。这玩意儿跟立规矩不写罚则一个样——模型心情好听一句,忙起来(或者它自认为忙起来)就跳过去了。软约束嘛,没有硬闸门兜着,全看它愿不愿意守。

我也试过把每一步都拆开人工点确认。跑下来发现跟我自己动手没区别,还慢三倍,纯纯的胶水流程。更别提有些任务本来就是长程多步的,逐步点头的体验烂到我想直接关掉对话。

我甚至想过干脆不让它执行、只让 AI 出方案。但有些活儿它就是得真跑,比如部署、定时清理、批量操作文件,光给方案不落地等于没说。出方案不执行和瞎执行,是两个极端,都不够用。

tri-action 把「执行」接住了

后来我把执行这块单独拆给 tri-action 管。它的逻辑跟通用「直接执行」不一样:它不是接到一句话就去调工具,而是先读 tri-intent 的快照,把意图认准是 I14(操作执行),再走一条固定链路——解析、校验、分级、确认门、执行、返回。意图识别这一步它自己不做,直接吃上游结论,所以不会临场重新理解你的需求。

关键在「分级」。tri-action 把每个操作按风险打到四个等级,这是我踩坑之后才觉得香的设计:

  • L0 只读:查数据、搜东西、读文件,不产生副作用,直接跑。
  • L1 可逆:建草稿、设提醒这种能撤的,直接跑。
  • L2 不可逆:删文件、提交表单、发消息,得先给你看操作清单和影响范围,你点头才动。
  • L3 高风险:资金交易、生产变更、批量删除,除了清单还得附不可逆说明和风险评估,确认过了才执行。

我当初特别讨厌那种「AI 默默把事办了还以为帮你省心」的设计。tri-action 反过来,L2/L3 不给你确认门它是不会动的,这是铁律。而且失败不擅自重试——这一点我踩过坑才懂,重复扣款、重复发送这种事,自动重试一次就够你喝一壶。不可逆操作失败后它只把原始错误甩回来问你,绝不自己再来一遍。

我用它落地一份执行清单大概长这样:

# .tribro/actions/I14_20260211_143022_6a5c037d/task.yamlintent:I14operation:action:delete_files# 操作动作target:"./logs/archive/*"# 操作对象tool:filesystem# 目标工具params:older_than:"30d"dry_run:falserisk_level:L2# 不可逆:删除confirm_gate:required:truechecklist:# 操作清单-"删除 ./logs/archive/ 下 30 天前的文件"-"影响范围:仅归档日志,不含活跃日志"irreversible_note:"删除后不可恢复,请确认路径无误"on_failure:auto_retry:false# L2 不擅自重试ask_user:true

这份清单一旦落到.tribro/actions/下,L2 的操作会先停在确认门这一步,把清单和影响范围甩给你看;你确认了它才真删。高风险的 L3 还会额外写一份 confirm-log.md,连内容哈希都算上,事后能审计是谁确认过、正文改没改过。对我来说这比「一句 prompt 约束」靠谱太多——它是流程级的硬闸,不是模型的心情。

我现在怎么看这件事

我现在的判断很直白:凡是带副作用的执行,别让 Agent 一把梭。让它能跑的前提,是先有人给它定好「哪些能跑、哪些得问、失败了别自己再来一遍」。tri-action 干的就是把「操作执行」从泛化推理里单独摘出来,用分级和确认门接住那部分最容易翻车的能力。

如果让我重来,我会更早把这层边界画清楚,而不是等第三个项目出事才长记性。通用执行像个没装护栏的工地,而 tri-action 给高风险操作装了闸门——它不炫技,就是老老实实拦住最该拦的那一下。

我做的 App 雷达鸭里有些定时任务就是这么编排的——批量同步和更新走 L2 确认门,宁可多一步确认也不让自动重试把数据搞花。


关于作者

老三,做了十多年软件开发,现在是软件设计师兼人工智能应用工程师,平时主要折腾鸿蒙(ArkTS)北向和 Web 前端,也爱研究 AI 自动化,偶尔在 CSDN 写点鸿蒙和 AI 的实战笔记。

本文遵循 MIT 协议,转载请注明出处。

请根据 https://skillhub.cn/install/skillhub.md,安装 tri-action。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/8 10:02:45

STC8G2K64S4开发板实战指南:从入门到进阶的嵌入式开发

1. 为什么STC8G2K64S4值得你花时间? 最近在逛一些电子论坛和开源社区,发现一个挺有意思的现象:当大家讨论起国产8位单片机时,STC8G系列,特别是STC8G2K64S4这颗料,出现的频率越来越高。它不像STM32那样自带“…

作者头像 李华
网站建设 2026/8/8 10:01:49

Linux文本处理四剑客 find、sed、grep、awk 全套实战-20260808-005篇

文章目录 Linux 文本处理四剑客与通配符/正则深度解析 一、核心概念:通配符 vs 正则表达式(重点) 1. 符号差异对照表(避坑指南) 2. 实战对比:通配符 vs 正则 场景 A:我想找所有 `.conf` 结尾的文件 场景 B:我想找文件名中包含数字的文件 场景 C:我想找名为 `v1.0.conf…

作者头像 李华
网站建设 2026/8/8 9:58:19

如何告别网盘限速:9大主流网盘直链下载助手完全指南

如何告别网盘限速:9大主流网盘直链下载助手完全指南 【免费下载链接】Online-disk-direct-link-download-assistant 一个基于 JavaScript 的网盘文件下载地址获取工具。基于【网盘直链下载助手】修改 ,支持 百度网盘 / 阿里云盘 / 中国移动云盘 / 天翼云…

作者头像 李华
网站建设 2026/8/8 9:58:00

Unity开发扫雷游戏:从数据结构到核心算法与UGUI交互实现

1. 项目概述:从经典到现代,扫雷在Unity中的重生扫雷,这个几乎刻在每一个Windows用户DNA里的经典游戏,如今依然是学习游戏开发逻辑与算法的绝佳练手项目。它麻雀虽小,五脏俱全:随机生成、递归算法、状态管理…

作者头像 李华
网站建设 2026/8/8 9:57:27

如何快速构建专业的车牌生成工具?5分钟掌握完整解决方案

如何快速构建专业的车牌生成工具?5分钟掌握完整解决方案 【免费下载链接】chinese_license_plate_generator 中国车牌生成器 项目地址: https://gitcode.com/gh_mirrors/ch/chinese_license_plate_generator 在车牌识别算法训练、交通管理系统开发和测试数据…

作者头像 李华
网站建设 2026/8/8 9:51:27

如何用JX3Toy轻松玩转剑网3:新手必读的终极自动化指南

如何用JX3Toy轻松玩转剑网3:新手必读的终极自动化指南 【免费下载链接】JX3Toy 全功能减负工具 项目地址: https://gitcode.com/GitHub_Trending/jx/JX3Toy 还在为剑网3中复杂的技能循环和重复操作烦恼吗?JX3Toy为你提供了一套完整的自动化解决方…

作者头像 李华