news 2026/8/10 3:16:34

未来已来!Open-AutoGLM开启手机自动化新时代

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
未来已来!Open-AutoGLM开启手机自动化新时代

未来已来!Open-AutoGLM开启手机自动化新时代

1. 背景与技术演进

近年来,AI Agent 的发展正从“对话助手”向“行动执行者”跃迁。传统大模型擅长理解与生成语言,但无法直接与物理或数字环境交互。而 Open-AutoGLM 的出现,标志着 AI 开始具备操作真实设备的能力——它能通过自然语言指令驱动安卓手机完成复杂任务。

这一能力并非凭空而来。早在豆包手机引发热议之前,学术界已有大量关于“视觉-动作”闭环系统的研究。这类系统统称为Phone Agent,其核心目标是让 AI 具备“看懂屏幕、理解意图、规划路径、执行操作”的全流程能力。Open-AutoGLM 正是智谱基于 AutoGLM 架构推出的开源实现,首次将这一能力开放给开发者和普通用户。

与商业产品不同,Open-AutoGLM 不依赖定制硬件,而是通过 ADB(Android Debug Bridge)连接标准安卓设备,在通用计算平台上运行多模态模型进行决策控制。这种设计使得任何拥有电脑和安卓手机的用户都能快速搭建属于自己的“AI 手机助理”。

2. 系统架构与工作原理

2.1 整体架构解析

Open-AutoGLM 是一个典型的三层架构系统:

  • 感知层:利用视觉语言模型(VLM)对手机屏幕截图进行语义理解。
  • 决策层:结合用户指令与当前界面状态,生成可执行的操作序列。
  • 执行层:通过 ADB 发送底层命令,完成点击、滑动、输入等动作。

整个流程形成一个闭环反馈系统:每一步操作后都会重新截图并传入模型判断是否达成目标,若未完成则继续规划下一步。

[用户指令] ↓ [自然语言 → 意图解析] ↓ [ADB 截图 → 屏幕图像] ↓ [视觉语言模型 VLM 理解界面元素] ↓ [动作规划器生成操作序列] ↓ [ADB 执行 Tap / Swipe / Type ...] ↑___________↓ [等待响应 → 新截图 → 再次推理]

该机制赋予了系统强大的泛化能力,能够应对弹窗广告、UI 变更等非预期情况,远超传统脚本工具如按键精灵。

2.2 多模态理解的关键技术

系统的核心在于其使用的9B 参数量视觉语言模型 autoglm-phone-9b。该模型在训练阶段融合了大量“图文+动作”配对数据,即每张屏幕截图都标注了对应的操作标签(如Tap(坐标)Type("搜索关键词")),从而建立起从视觉信息到行为决策的映射关系。

例如,当模型看到如下界面:

[屏幕截图:美团首页,“附近美食”按钮高亮]

并接收到指令:“找一家评分高的火锅店”,模型会自动识别出“附近美食”为关键入口,并输出动作:

{"action": "Tap", "x": 540, "y": 800}

这种端到端的学习方式避免了规则引擎的硬编码限制,使 AI 能够适应不同 App 的 UI 风格和布局变化。

2.3 安全机制与人工接管

考虑到自动化操作可能涉及敏感场景(如登录、支付),系统内置了Take_over 机制。一旦检测到验证码输入框、密码字段或支付确认页,AI 将主动暂停执行,提示用户介入处理。

此外,所有操作均需显式授权,且可通过远程调试接口实时监控执行过程,确保透明可控。

3. 实践部署指南

3.1 环境准备

硬件要求
  • 控制端:Windows 或 macOS 电脑(建议 Python 3.10+)
  • 设备端:Android 7.0+ 手机或模拟器
  • 连接方式:USB 数据线 或 同一局域网 WiFi
软件依赖
  • ADB 工具包(来自 Android SDK Platform Tools)
  • Git(用于克隆仓库)
  • Python 包管理工具(pip)
ADB 配置步骤

Windows 用户

  1. 下载 Platform Tools 并解压。
  2. 将解压路径添加至系统环境变量PATH
  3. 打开命令行,输入adb version验证安装成功。

macOS 用户

export PATH=${PATH}:~/Downloads/platform-tools adb version

3.2 手机端设置

  1. 开启开发者模式
    进入“设置 → 关于手机”,连续点击“版本号”5次。

  2. 启用 USB 调试
    返回“设置 → 开发者选项”,勾选“USB 调试”。

  3. 安装 ADB Keyboard

    • 下载 ADBKeyboard.apk
    • 安装后进入“语言与输入法”设置,将其设为默认输入法。

此举允许 AI 通过 ADB 命令直接向应用输入文字,无需手动打字。

3.3 部署控制端代码

# 克隆项目仓库 git clone https://github.com/zai-org/Open-AutoGLM cd Open-AutoGLM # 安装依赖 pip install -r requirements.txt pip install -e .

3.4 设备连接方式

USB 连接
adb devices

输出应包含设备 ID 和device状态。

WiFi 无线连接

首次需使用 USB 连接启动 TCP/IP 模式:

adb tcpip 5555 adb disconnect adb connect 192.168.x.x:5555

此后可在同一网络下无线控制手机。

3.5 启动 AI 代理

命令行方式运行
python main.py \ --device-id <your-device-id-or-ip:5555> \ --base-url http://<server-ip>:<port>/v1 \ --model "autoglm-phone-9b" \ "打开抖音搜索抖音号为:dycwo11nt61d 的博主并关注他!"

参数说明:

  • --device-id:通过adb devices获取的设备标识
  • --base-url:云端推理服务地址(支持自建 vLLM/SGLang 服务)
  • 最终字符串:自然语言指令
Python API 调用示例
from phone_agent.adb import ADBConnection, list_devices conn = ADBConnection() # 连接远程设备 success, message = conn.connect("192.168.1.100:5555") print(f"连接状态: {message}") # 列出设备 devices = list_devices() for device in devices: print(f"{device.device_id} - {device.connection_type.value}") # 获取设备 IP ip = conn.get_device_ip() print(f"设备 IP: {ip}")

此接口适用于集成到更大规模的自动化平台中。

4. 应用场景与性能表现

4.1 支持的应用范围

目前 Open-AutoGLM 已适配主流安卓应用,涵盖多个生活场景:

分类支持应用
社交通讯微信、QQ、微博
电商购物淘宝、京东、拼多多
美食外卖美团、饿了么、肯德基
出行旅游携程、12306、滴滴出行
视频娱乐bilibili、抖音、爱奇艺
音乐音频网易云音乐、QQ音乐、喜马拉雅
生活服务大众点评、高德地图、百度地图
内容社区小红书、知乎、豆瓣

4.2 实测任务表现

以下为实测三个典型任务的表现:

  1. “打开高德地图找一家最近的火锅店”

    • 成功识别地图图标 → 启动应用 → 输入“火锅” → 排序距离最近 → 显示结果
    • 耗时约 110 秒
  2. “点一杯最便宜的瑞幸咖啡”

    • 进入美团 → 搜索“瑞幸” → 筛选价格最低饮品 → 加购 → 停止于结算页(需人工支付)
    • 耗时约 135 秒
  3. “找一篇西安一日游攻略”

    • 打开小红书 → 搜索关键词 → 浏览笔记列表 → 点击点赞最高的文章
    • 耗时约 98 秒

所有任务均顺利完成,期间遇到两次弹窗广告,AI 均能正确识别并关闭。

4.3 与传统脚本对比优势

维度按键精灵类脚本Open-AutoGLM
泛化性固定坐标,UI 变动即失效基于语义理解,适应多种界面风格
异常处理无法应对弹窗、加载失败等情况可动态调整路径,具备容错能力
开发成本每个流程需单独编写脚本自然语言驱动,零代码配置
可维护性修改 UI 后需重写脚本模型自动适应,无需人工干预

5. 本地化部署与高级用法

5.1 模型本地推理支持

除调用云端 API 外,Open-AutoGLM 支持本地部署模型,提升隐私安全性。官方推荐两种推理框架:

  • vLLM:高性能批处理推理引擎,适合 GPU 服务器
  • SGLang:轻量级推理框架,支持流式输出

⚠️ 注意:目前这两个框架对 macOS 支持有限,建议在 Linux 服务器上部署。

5.2 敏感操作保护策略

系统采用分级安全机制:

  • 对涉及账号、支付的操作自动触发Take_over
  • 所有操作日志可追溯
  • 支持设置白名单应用,限制自动化范围

5.3 远程调试与开发支持

通过 WiFi 连接,开发者可在办公室远程调试家中设备,极大提升开发效率。配合 CICD 流程,可实现自动化测试流水线。

6. 总结

Open-AutoGLM 的发布,意味着普通人也能构建属于自己的“AI 手机代理”。它不仅复现了豆包手机的核心功能,更以开源形式推动了整个 Phone Agent 领域的发展。

尽管当前仍存在一些局限——如执行速度不如人类熟练操作、无法捕捉“临时起意”的消费冲动——但它已在重复性任务自动化方面展现出巨大价值。未来随着模型轻量化和边缘计算能力提升,这类 Agent 完全有可能集成进手机操作系统本身,成为下一代智能终端的标准组件。

更重要的是,Open-AutoGLM 提供了一个清晰的技术范式:以视觉语言模型为大脑,以 ADB 为手脚,以自然语言为指令接口,构建真正意义上的“数字劳动力”。


获取更多AI镜像

想探索更多AI镜像和应用场景?访问 CSDN星图镜像广场,提供丰富的预置镜像,覆盖大模型推理、图像生成、视频生成、模型微调等多个领域,支持一键部署。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/6 2:41:56

通义千问2.5私有化部署测试:云端模拟环境,省去硬件采购风险

通义千问2.5私有化部署测试&#xff1a;云端模拟环境&#xff0c;省去硬件采购风险 在金融行业&#xff0c;数据安全和系统稳定性是头等大事。随着大模型技术的快速发展&#xff0c;越来越多金融机构开始探索将像通义千问2.5&#xff08;Qwen2.5&#xff09; 这样的先进语言模…

作者头像 李华
网站建设 2026/8/3 10:48:23

开箱即用!Whisper语音识别镜像快速体验指南

开箱即用&#xff01;Whisper语音识别镜像快速体验指南 1. 引言&#xff1a;多语言语音识别的工程化落地 在人工智能驱动的语音交互场景中&#xff0c;自动语音识别&#xff08;ASR&#xff09;技术正从实验室走向实际应用。OpenAI发布的Whisper系列模型&#xff0c;凭借其强…

作者头像 李华
网站建设 2026/8/1 8:24:15

RISC异常与中断处理:硬件响应机制全面讲解

RISC异常与中断处理&#xff1a;从流水线到系统调用的硬核解析你有没有想过&#xff0c;当你在嵌入式设备上按下一个按钮&#xff0c;或者操作系统突然响应一次系统调用时&#xff0c;CPU内部究竟发生了什么&#xff1f;这一切的背后&#xff0c;是异常与中断机制在默默支撑。它…

作者头像 李华
网站建设 2026/8/10 2:00:40

UI-TARS桌面版完整部署指南:从环境配置到高级功能实现

UI-TARS桌面版完整部署指南&#xff1a;从环境配置到高级功能实现 【免费下载链接】UI-TARS-desktop A GUI Agent application based on UI-TARS(Vision-Lanuage Model) that allows you to control your computer using natural language. 项目地址: https://gitcode.com/Gi…

作者头像 李华
网站建设 2026/8/8 22:40:35

SGLang结构化生成原理:有限状态机实现方式详解

SGLang结构化生成原理&#xff1a;有限状态机实现方式详解 1. 技术背景与问题提出 随着大语言模型&#xff08;LLM&#xff09;在各类应用场景中的广泛部署&#xff0c;推理效率和系统吞吐量成为制约其规模化落地的关键瓶颈。尤其是在多轮对话、任务规划、API调用等复杂场景下…

作者头像 李华
网站建设 2026/8/4 14:45:30

YOLOv8异常检测魔改:5块钱验证创新思路

YOLOv8异常检测魔改&#xff1a;5块钱验证创新思路 你是不是也遇到过这样的情况&#xff1f;作为博士生&#xff0c;研究方向是工业缺陷检测&#xff0c;手头有个不错的YOLOv8改进想法&#xff0c;但实验室GPU资源紧张&#xff0c;排队等一周都轮不到。导师又要求尽快出实验数…

作者头像 李华