UI-TARS-desktop 新手上手指南:三步配好模型,用自然语言操控电脑
【免费下载链接】UI-TARS-desktopThe Open-Source Multimodal AI Agent Stack: Connecting Cutting-Edge AI Models and Agent Infra项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS-desktop
把鼠标键盘交给模型:输入一句"打开 VS Code 并开启自动保存",UI-TARS-desktop 会自己移动鼠标、点进设置、改完参数后返回结果。这是一个开源的 GUI 自动化桌面应用,基于 UI-TARS 视觉语言模型,用自然语言操控本机电脑和浏览器。本文带你完成安装、授权、模型配置,并跑通第一条指令。
它能做什么,做不到什么
可以稳定完成的任务(均出自官方演示与文档用例):
- 改应用设置:打开 VS Code,把 Auto Save 的延迟改为 500 毫秒
- 浏览器查信息:打开 GitHub 指定仓库,查看最新 open issue 的标题
- 页面导航与表单填写:在浏览器中搜索、翻页、填写并提交表单
- 需要鼠标键盘的桌面操作:打开应用、新建文件夹、拖动文件
能力边界有两点:当前仅支持单显示器,多显示器环境可能导致任务失败;所有执行都依赖你配置好的 VLM(视觉语言模型)端点,模型不可用就无法操作。另外 Windows 版本尚未正式开放。
📦 安装到可运行
macOS 安装与授权
- 安装。已装 Homebrew 的,用这条命令即可:
brew install --cask ui-tars没有 Homebrew 就到 release 页面下载 dmg 手动安装。
- 把 UI TARS 拖入 Applications 文件夹:
在 系统设置 → 隐私与安全性 中授予两项权限:
- 辅助功能(Accessibility):允许控制鼠标键盘
- 屏幕录制(Screen Recording):允许截图识别界面
- 打开应用,出现欢迎页即安装完成。
Windows 安装进度
官方文档中 Windows 端仍标注 "Still to run",尚未正式开放。当前请优先使用 macOS 版本,发布进度见 快速开始文档。
⚙️ 三步配好模型,跑通第一条指令
第一步:部署 UI-TARS-1.5 模型端点
在 Hugging Face 的 Endpoint 目录中找到 UI-TARS-1.5-7B 模型,点击 "Deploy from Hugging Face",按页面指引完成部署,得到一个可访问的推理端点。中文用户也可以选火山引擎 Ark 上的 Doubao-1.5-UI-TARS,流程类似。
第二步:填写 VLM 配置,避开两个坑
部署完成后,在端点页面找到 Base URL、API Key、Model Name 三项,填入设置界面:
Language: zh VLM Provider: Hugging Face for UI-TARS-1.5 VLM Base URL: https://your-endpoint/v1/ VLM API KEY: your_api_key VLM Model Name: UI-TARS-1.5-7B⚠️ 两个高频坑位:
- Base URL 必须以
/v1/结尾,少了结尾斜杠会连接失败 - VLM Provider 要与模型匹配(UI-TARS-1.5 就选 "Hugging Face for UI-TARS-1.5"),选错会导致动作解析失败
保存后点击 "Check Model Availability",确认模型可用再往下走。
第三步:发出第一条指令
回到主界面,选择 "Use Local Computer"(本地计算机操作),输入指令开始任务:
帮我打开 VS Code,在设置中启用 Auto Save,并把自动保存延迟设为 500 毫秒执行过程会在界面里实时展示每步截图与动作,任务结束给出结果状态。
🖱️ 本地模式还是远程浏览器模式
| 对比项 | 本地模式(Computer / Browser Operator) | 远程浏览器模式(Remote Operator) |
|---|---|---|
| 执行位置 | 本机,需辅助功能与屏幕录制权限 | 云端浏览器,无需本地安装 Chrome |
| 数据去向 | 截图与操作全部留在本机 | 任务在服务商云端执行 |
| 适用场景 | 改本机应用设置、管理本地文件 | 需要干净的浏览器环境、跨设备复现 |
远程服务由火山引擎提供,曾有免费试用,停服与自建 OS Agent 的替代方案见 快速开始文档。另外注意:本地浏览器操作模式要求本机已安装 Chrome、Edge 或 Firefox 之一。
指令怎么写:对象、动作、完成标准
一条可靠指令通常包含三要素,缺任何一项都容易跑偏:
- 操作对象——正例:"在 GitHub 上打开 UI-TARS-desktop 仓库";反例:"帮我看看 GitHub"(没说哪个仓库、哪个页面)
- 具体动作——正例:"在搜索框输入 iPhone 15,比较前三个结果的价格";反例:"帮我查查价格"(查什么、怎么比都不明确)
- 完成标准——正例:"把 Auto Save 延迟改为 500 毫秒后回到主界面";反例:"把 VS Code 设置弄一下"(模型无法判断何时算完成)
进阶能力
- 导入预设:支持本地 YAML 与远程 URL 两种预设,导入时自动校验,远程预设每次启动自动同步;模板见 examples/presets/default.yaml,说明见 预设文档。
- 执行报告:每轮任务生成 HTML 报告,含逐步截图、动作记录与耗时统计,可下载或上传到自建存储。
- SDK:跨平台 GUI 自动化工具包,支持 Node.js 与浏览器运行,源码在 packages/ui-tars/sdk/,桌面、浏览器、安卓操作器在 packages/ui-tars/operators/,用法见 SDK 文档。
遇到问题怎么办
- 模型连通性检查不通过→ Base URL 未以 /v1/ 结尾,或 API Key 填写有误 → 回到端点页面逐项核对三项参数,重新保存后再点 Check Model Availability。
- 有输出但动作不执行→ VLM Provider 与所用模型不匹配,动作解析失败 → 改选与模型对应的 Provider(如 Hugging Face for UI-TARS-1.5)。
- 点击无反应或坐标偏移→ 辅助功能或屏幕录制权限未授予,或授权后未重启应用 → 到 系统设置 → 隐私与安全性 勾选权限,重启 UI-TARS 再试。
- 多显示器下任务失败→ 当前版本仅支持单显示器 → 切换到单显示器环境重新运行。
- 任务中途停止→ 达到 Max Loop 上限(默认 100 步)→ 把任务拆成更短的步骤,或在聊天设置里调大 Max Loop。
先按上面的步骤填好模型配置,点 "Check Model Availability" 确认通过,然后在本地计算机模式里输入这条指令:"帮我打开系统设置,把显示器亮度调到 50%"。跑通这一条,后面的浏览器任务与预设导入都可以按同样节奏推进。
【免费下载链接】UI-TARS-desktopThe Open-Source Multimodal AI Agent Stack: Connecting Cutting-Edge AI Models and Agent Infra项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS-desktop
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考