Agent-S 智能体框架完整指南:从一句需求到自动点击、计算与出图
【免费下载链接】Agent-SAgent S: an open agentic framework that uses computers like a human项目地址: https://gitcode.com/GitHub_Trending/ag/Agent-S
Agent-S 智能体框架是一个开源项目,让你用一句大白话指挥计算机:你说"帮我算总销售额、算月均并出图",它就自己打开表格、点按钮、写代码做计算、生成图表。下面跟着一个真实任务,把这套框架由哪几个模块协作完成讲清楚,最后给你一份可直接上手的路径。
场景:把「算销售额、出图」整句交给它
这一节先建立画面感:你只负责提需求,剩下的拆解、点击、计算它自己来,你几乎不用动手。
假设你的屏幕上已经打开了一个记账表格,你对 Agent-S 说:"帮我计算总销售额、平均月销售额,并生成一个可视化图表。"从这一刻起,任务就进入一条流水线:它先想起"在表格里做过类似的求和任务",再决定先算总额、再算月均、最后插入图表,最后把每一步变成真实的鼠标点击和键盘输入。
上图展示了 Agent-S 处理"算销售额、出图表"任务时的整体分工:从记忆检索、任务规划到计算机接口的执行闭环
大脑拆任务:Worker 把一句话变成下一步动作
这一节讲"谁在指挥",和你有关的是:它不会一口气想太多,而是每步只决定一个动作,跑得快也好定位问题。
在最新一代 S3 里,指挥者是一个叫Worker的模块(见 gui_agents/s3/agents/worker.py)。它拿到你的指令和当前截图后,每轮只输出一个"描述性动作",比如"点工具栏上的插入图表图标"。S3 特意去掉了层层规划的结构,用更扁平的方式换取更短的推理时间——这也是它更快的原因之一。
上图是 Agent-S 的协作环路:Worker 生成动作、交互层执行、经验回写记忆,再由管理器把知识反哺给规划
手眼配合:ACI 把「点这个按钮」翻译成真实点击
这一节讲"怎么落到屏幕上",和你有关的是:你不用给坐标,用一句"哪个按钮"就行,定位交给专门的视觉模型。
真正动手的是一套叫 Agent-Computer Interface(ACI)的接口,在 Linux 桌面里对应OSWorldACI(见 gui_agents/s3/agents/grounding.py)。它把自然语言描述变成坐标:你写"窗口右上角的菜单按钮",一个视觉定位模型(推荐 UI-TARS-1.5-7B)就返回该点的(x, y)。常用动作都封装成好读的方法,例如agent.click()、agent.type()、agent.drag_and_drop()、agent.hotkey()、agent.scroll()。需要选中一段文字时,它还会调用 OCR(基于 Tesseract)把屏幕上的词定位出来,再做精确的划选。
会写代码的第二只手:call_code_agent 负责计算与批量数据
这一节讲它为什么算得准、改得快,和你有关的是:求和、批量填数这类活儿它不靠鼠标一格一格点,而是直接写代码。
S3 里Worker和"代码手"配合干活:当任务涉及计算、过滤、批量改数据时,它调用call_code_agent把一个专门的代码智能体(见 gui_agents/s3/agents/code_agent.py)拉出来。这个智能体在后台按"最多 20 步"的预算,一步步写 Python 或 Bash 去改文件,跑完交回一份"完成 / 失败 / 超预算"的报告。改完文件后,它还会提醒你关掉应用再重新打开确认效果——因为它只改内容,界面刷新要靠 GUI 验证。对 LibreOffice 表格,它甚至有一条直达的set_cell_values通道,绕过鼠标直接写单元格和公式。
少踩坑靠这两件事:逐步反思 + 程序化记忆
这一节讲它怎么不出错、怎么越用越顺,和你有关的是:它每做一步都回头检查,且带着一整套"操作守则"。
一是逐步反思:每轮由一个反思模型看着"动作前 / 后"的截图,判断这步有没有进展、是不是在原地打转,再把结论喂回给Worker,避免重复无效点击。二是程序化记忆:所有操作规范集中在 gui_agents/s3/memory/procedural_memory.py,里面写明了"何时用 GUI、何时用代码、代码改完要重新打开文件核对"等守则。另外,它还有一个轻量知识罐save_to_knowledge,能把任务中途看到的关键文本存下来,供后续步骤复用。
成绩到底怎么样:OSWorld 上 72.6% 怎么来的
这一节只看带场景、有对比的硬数据,避免空喊数字。
在 OSWorld(一个在真实桌面里完成操作任务的基准)上:单独运行的 Agent S3 在 100 步内做到 66%,已经超过此前的最高纪录 63.4%(GTA1 搭配 GPT-5);再加上 Behavior Best-of-N(跑多次让裁判挑最好的轨迹),成功率升到72.6%,超过了人类约 72% 的基准线。在跨平台泛化上,它同样有效:WindowsAgentArena 上从 50.2% 提到 56.6%(选 3 次结果中最好),AndroidWorld 上从 68.1% 提到 71.6%。
上图为 OSWorld 上各方案的对比:Agent S3 结合 Behavior Best-of-N 达到 72.6%,越过约 72% 的人类水平线
接下来你可以做什么
这一节给你一份可执行路径,照着走就能跑起来。
- 装依赖:
pip install gui-agents即可,不改源码也可以跑;若要在 Linux 上用 OCR,再brew install tesseract。 - 配模型:把
OPENAI_API_KEY等写到环境里(支持 OpenAI、Anthropic、Gemini、vLLM、Open Router 等,见 models.md);另需一个定位模型,推荐 UI-TARS-1.5-7B,坐标尺寸设 1920×1080。 - 跑起来:用命令行工具
agent_s,带上--provider、--model、--ground_url、--ground_model等参数;需要写代码执行时加--enable_local_env(注意它会在本机运行代码,务必只在可信环境开启)。推理主循环可参考 gui_agents/s3/cli_app.py。 - 换个环境验证:想放进 OSWorld 评测,按 osworld_setup/s3/OSWorld.md 部署;想跑 Windows 场景,看 WAA_setup.md。
安全提示:Agent-S 会执行代码来控制你的电脑,且代码智能体用的是你本人的权限,处理敏感文件或陌生任务时,建议在沙箱里跑。
【免费下载链接】Agent-SAgent S: an open agentic framework that uses computers like a human项目地址: https://gitcode.com/GitHub_Trending/ag/Agent-S
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考