UI-TARS Desktop:10 分钟装好并跑通第一个 GUI 自动化任务
【免费下载链接】UI-TARS-desktopThe Open-Source Multimodal AI Agent Stack: Connecting Cutting-Edge AI Models and Agent Infra项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS-desktop
周五下午,你盯着 17 条待办,第一条写着“登录管理后台导出上周订单数据”。你索性在输入框里敲下“打开内部 CRM,找到最近 7 天的订单并导出为 CSV”。屏幕上的光标亮起来,鼠标自己动了起来——这就是 GUI 自动化桌面应用 UI-TARS Desktop 干活的樣子。
🧠 30 秒看懂核心循环:截图、模型、执行
UI-TARS Desktop 的原理很直白:每一轮它先截屏,把画面交给视觉语言模型(VLM,能看图并输出结构化指令的大模型)。模型回一句“点击 (320, 188)”这样的指令,本地执行器(Operator,真正驱动鼠标键盘的模块)完成这个动作,然后再截一次图,如此循环,直到任务完成或主动报错。
| 项目 | 要求 | 备注 |
|---|---|---|
| UI-TARS Desktop | macOS 10.15+ 或 Windows 10+ | 单显示器环境,多显示器可能导致任务失败 |
| 浏览器(仅浏览器模式) | Chrome / Edge / Firefox 任一 | 配合 Use Local Browser 模式使用 |
| 模型服务 | OpenAI 兼容的 API 端点 | 自部署 UI-TARS-1.5,或用火山引擎的 Doubao-1.5-UI-TARS |
核心交互就是界面中央那个输入框:
敲一句话,整个循环就开始转。
💻 三步装完并打开第一个界面
macOS
- 获取安装包:从项目 releases 页下载最新版 .dmg;装有 Homebrew 的话直接执行:
brew install --cask ui-tars- 把 UI TARS 拖进 Applications 文件夹。
- 授予两项权限:系统设置 > 隐私与安全性中,为 UI TARS 开启辅助功能和屏幕录制。
Windows
- 双击
UI.TARS-x.x.x.Setup.exe安装。 - 若弹出“Windows 已保护你的电脑”提示,点“更多信息”再选“仍要运行”。
⚙️ 四个参数填对,模型连接一次通过
打开应用设置页,按下表填写:
| 参数 | 格式约束 | 示例值 |
|---|---|---|
| VLM Provider | 必须选与模型匹配的预置项,决定动作解析格式 | Hugging Face for UI-TARS-1.5 |
| VLM Base URL | HuggingFace 部署必须以 /v1/ 结尾;火山引擎按控制台给的端点原样填 | https://your-endpoint.huggingface.cloud/v1/ |
| VLM API KEY | 纯字符串,首尾不留空格 | hf_xxx |
| VLM Model Name | 与端点里的模型名逐字一致 | doubao-1.5-ui-tars-250328 |
填完点“Check Model Availability”,看到通过提示说明链路已通。
首次启动的主界面是三栏布局:左侧会话历史、中间任务输入、右侧设置与报告入口。
🎯 跑两个实战任务:先计算器,再跨应用
先在启动页选模式:桌面任务选 Use Local Computer,网页任务选 Use Local Browser。
让计算器算道题
“打开计算器,计算 (123+456)×7,并告诉我结果”
执行链路:
- 启动计算器并等主界面出现
- 依次点击按键 123 + 456 ) × 7 =
- 读取结果栏数字并回复
预期产出:计算器结果栏出现 4107,会话里也给出同一个数字。
把网页标题搬进记事本
“用 Chrome 打开我指定的新闻站点,复制最新一篇的标题,再打开桌面记事本,把标题粘贴进去并保存为 today.txt”
执行链路:
- 启动 Chrome 并打开目标页面
- 定位最新一篇的标题
- 复制标题文字
- 切回桌面并启动记事本
- 粘贴并保存为 today.txt
预期产出:桌面生成含标题的 today.txt;任务结束后可下载完整报告(每步一张截图加动作记录)。
哪一步失败,先看报告里该步的截图,多半能分清是模型看错还是页面变了。
🧭 收尾:何时上远程,怎么避坑
远程执行器:手被占住时再用
内置 Remote Computer / Browser 模式让任务在云端机器上跑,不占你当前屏幕。适合:本机配置弱,或想一边干活一边让任务自己跑。不适合:涉及内部系统、敏感数据或长耗时任务——数据会经云端传输,且内置免费试用已转为自建部署(迁移说明见快速入门文档)。
预设模板:多套配置来回切时再用
Preset 把当前模型加参数组合存成模板,可一键导入。适合:已有两套以上都验证过的配置需要频繁切换。不适合:基础配置还没通过模型连通性检查时——先把参数调对,再谈保存。
本地与远程怎么选,一张表说清:
| 维度 | 本地 Operator | 远程 Operator |
|---|---|---|
| 执行位置 | 这台机器 | 云端机器 |
| 你的屏幕 | 被占用,可围观 | 不占用 |
| 敏感数据 | 留在本机 | 需上传云端,谨慎 |
| 上手门槛 | 要接好本地模型 | 一键试用,长期用需自建 |
三个最高频问题:
| 现象 | 根因 | 解法 |
|---|---|---|
| 模型连通性检查失败 | Base URL 少了 /v1/ 或模型名对不上 | 按参数表重填,再点 Check Model Availability |
| macOS 点了没反应 | 辅助功能或屏幕录制权限未开 | 隐私与安全性里都打开,重启应用 |
| 多显示器下动作跳错 | 目前仅支持单显示器 | 改接单显示器后重跑 |
行动建议:
- 先跑计算器任务,确认“截图、模型、执行”循环通了。
- 浏览器任务前先装好最新版 Chrome 或 Edge,并保持普通窗口而非全屏。
- 指令写具体:指明应用名、目标页面、期望产物,一个任务只给一件事。
- 跑完看报告,失败那一步对照截图判断,再决定是换指令还是换模式。
延伸材料:
- 快速入门
- 设置配置
- 预设模板
- SDK 开发文档
把“截图、模型、执行”这条链跑通之后,剩下的事就只有一句写得清楚的指令。
【免费下载链接】UI-TARS-desktopThe Open-Source Multimodal AI Agent Stack: Connecting Cutting-Edge AI Models and Agent Infra项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS-desktop
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考