📖标题:MobilePA-Bench: Benchmarking Mobile Planner Agents on Complex Real-World Tasks
🌐来源:arXiv, 2608.23035v2
🛎️文章简介
🔸研究问题:现有移动端智能体评测基准要么仅关注图形界面操作而忽视后台工具调用与长期规划,要么依赖离线静态匹配而脱离真实运行环境约束,如何全面评估移动规划智能体在复杂真实任务中的工具调用与规划能力?
🔸主要贡献:论文提出了MobilePA-Bench,这是一个交互式、有状态且以工具为中心的基准测试套件,用于评估移动规划智能体的工具调用和规划能力。
📝重点思路
🔸构建交互式有状态沙盒:开发了一个可执行的模拟环境,维护实时应用数据库并返回结构化反馈,涵盖13个功能域和212个真实移动工具,解耦了中心规划与底层视觉解析开销。
🔸定义四维核心能力评估:将评估维度划分为基础工具使用(处理多模态输入及系统约束)、子智能体协作(任务分解与委托)、记忆使用(检索用户偏好以解决隐式请求)和技能使用(调用预封装复合技能)。
🔸设计证据对齐的验证机制:根据任务完成语义将查询分为三类桶:工具调用桶(严格匹配序列)、状态变更桶(检查数据库最终状态差异)和智能体行为桶(评估交互合理性),确保评估的准确性与公平性。
🔸引入动态环境摩擦:在初始状态中注入参数缺失、权限限制和运行时错误等障碍,强制智能体观察动态反馈并进行实时计划修复,以测试其鲁棒性。
🔎分析总结
🔸前沿模型表现仍不可靠:即使是表现最好的模型整体加权得分仅为75.52%,表明当前大语言模型在严格的工具顺序、权限限制和意外运行时错误下性能急剧下降,尚不足以支持完全自主部署。
🔸记忆与协作是主要瓶颈:模型在基础工具使用上表现较好,但在子智能体协作和记忆使用方面存在显著短板,特别是检索和应用个性化上下文的能力远低于直接执行工具的能力。
🔸缺乏全能型规划器:不同模型在不同维度上各有优劣,没有单一模型在所有能力上均占主导,显示出高级编排能力与可靠端到端执行之间存在巨大差距。
🔸复合技能有助于减少错误:使用预封装的技能可以减轻长 horizon 规划中的错误累积,但前提是智能体能正确选择技能并执行下游动作,混合路由行为仍有改进空间。
💡个人观点
论文突破了传统GUI-centric或静态函数调用的局限,通过构建高保真的有状态沙盒,将记忆、技能和多智能体协作原生嵌入到真实的移动工作流中。