UI-TARS 桌面应用上手:从安装到跑通一个 GUI Agent 任务
【免费下载链接】UI-TARS-desktopThe Open-Source Multimodal AI Agent Stack: Connecting Cutting-Edge AI Models and Agent Infra项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS-desktop
UI-TARS 桌面应用是一个视觉语言模型驱动的 GUI Agent:你用一句自然语言下指令,它看屏幕、点鼠标、敲键盘,替你完成跨应用操作。读完本文,你能装好应用、配好模型,并让它替你在电脑上跑完第一个真实任务。
下载安装应用
这一节你要做的只有一件事:把应用装进系统,拿到一个能打开的窗口。
优先去 releases 页面下载对应系统的安装包,macOS 用户也可以直接用 Homebrew:
brew install --cask ui-tarsmacOS 安装时,把 UI-TARS 图标拖进 Applications 文件夹即可。
装完先别急着跑任务,去系统设置里开两个权限(这一步最容易漏):
- 「系统设置 → 隐私与安全性 → 辅助功能」:授权后它才能模拟鼠标键盘
- 「系统设置 → 隐私与安全性 → 屏幕录制」:授权后它才能截屏看懂界面
打开应用,看到欢迎页和左侧的「New Chat」按钮,就说明装好了。
如果你是想从源码构建自己的版本,也可以:
git clone https://gitcode.com/GitHub_Trending/ui/UI-TARS-desktop cd UI-TARS-desktop pnpm install pnpm run build配置视觉语言模型
应用本身不带"大脑",识别界面、决定动作都靠外部接入的视觉语言模型(VLM)。这一节你先选一家提供商,把连接信息填对。
点左下角的 Settings,打开 VLM Settings 面板:
四个参数都要填:Language(模型输出语言)、VLM Provider、VLM Base URL、VLM API Key,外加 VLM Model Name。以 Hugging Face 托管的 UI-TARS-1.5-7B 为例:
Language: en VLM Provider: Hugging Face for UI-TARS-1.5 VLM Base URL: https://xxx/v1/ VLM API KEY: your-api-key VLM Model Name: xxx两个高频坑先记住:Provider 要和你实际部署的模型版本对上,Base URL 要以 /v1/ 结尾。填完点「Check Model Availability」,弹出成功提示再保存。
微调任务行为参数
默认值先跑通,再按需微调。可调项不多,每个改它会影响什么:
| 参数 | 默认 | 改它会影响什么 |
|---|---|---|
| Language | en | 只改模型输出语言,不改应用界面 |
| Max Loop | 100 | 单轮任务最多执行多少步,任务越复杂给越大 |
| Loop Wait Time | 1000 毫秒 | 每步操作后等多久再截屏,动画慢的场景调大 |
不想逐个手填,可以在 VLM Settings 里点「Import Preset Config」,用 YAML 文件或 URL 一次性导入整套配置。
原理速览
不需要看源码,先记住这条链路就够用了:
你输入指令 → 模型看当前屏幕截图,决定下一步动作(点击/输入/滚动)→ 操作器在本机执行 → 截一张新屏幕图 → 循环,直到任务完成或触到 Max Loop 上限。
换句话说,它不依赖写死的坐标,每一步都是"看一眼、再决定"。这也解释了为什么界面上会实时显示每步截图——那就是模型正在做的判断依据。
场景演练
挑三个真实场景,看"你输入什么 → 它做了什么"。
场景一:改本地应用设置
- 你输入:帮我打开 VS Code,把自动保存延迟改成 500 毫秒
- 它做了:打开 VS Code → 进入设置页 → 搜索 auto save → 把 Delay 改成 500 → 回报完成
场景二:查网页信息
- 你输入:查一下 UI-TARS-Desktop 项目最新的一个 issue
- 它做了:打开浏览器 → 进入项目页 → 点开 issue 列表 → 把第一条的标题和内容读给你
场景三:浏览器内连续操作
- 你输入:打开浏览器搜索"多模态 AI Agent",把前三条结果标题记下来
- 它做了:启动默认浏览器 → 输入关键词搜索 → 逐条读取结果页 → 汇总返回
踩坑备忘
现象:执行任务时应用说看不到屏幕,或者操作总是落空。原因:macOS 的屏幕录制权限没开,它拿不到截图。解决:到「隐私与安全性 → 屏幕录制」勾选 UI-TARS,然后完全退出再打开应用。
现象:点「Check Model Availability」报连接失败。原因:Base URL 没以 /v1/ 结尾,或 API Key 填错。解决:回模型托管平台抄一遍连接信息,重点核对结尾的 /v1/。
现象:Provider 换成 1.5 之后,动作解析明显变差。原因:Provider 选项和实际部署的模型版本没对上。解决:把 VLM Provider 改回与部署模型匹配的那一项再保存。
现象:多块屏幕时点击坐标明显跑偏。原因:当前版本只适配单显示器环境。解决:任务期间只接一块屏,或先关掉副屏再跑。
现象:选 Browser Use 场景后没有浏览器被打开。原因:本机没装受支持的 Chrome、Edge 或 Firefox。解决:装一个稳定版浏览器,再重新发起任务。
延伸阅读
- docs/quick-start.md:完整快速入门,含 Hugging Face 与火山引擎两种接法,适合第一次部署模型的人
- docs/setting.md:全部配置项的详细说明,适合准备逐项调参的人
- docs/preset.md:预设配置的导入与管理,适合想团队共享同一套配置的人
- docs/deployment.md:模型自部署入口,适合想自己跑 UI-TARS-1.5 的人
- docs/sdk.md:UI-TARS SDK 手册,适合想自己写 GUI 自动化程序的人
- packages/ui-tars/sdk/:SDK 源码目录,适合想读实现细节的开发者
【免费下载链接】UI-TARS-desktopThe Open-Source Multimodal AI Agent Stack: Connecting Cutting-Edge AI Models and Agent Infra项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS-desktop
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考