news 2026/10/2 6:57:23

WorldAuditBench:面向多模态智能体的交互式三维世界审计评测基准

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
WorldAuditBench:面向多模态智能体的交互式三维世界审计评测基准

WorldAuditBench:面向多模态智能体的交互式三维世界审计评测基准

arXiv编号:arXiv:2609.40325v1 [cs.AI]

摘要
交互式三维虚拟世界越来越多地被用于智能行为研究,如何高效识别仿真环境中的各类异常(物体漂浮、可穿透墙体、物体随视角消失等)成为重要课题。视觉‑语言模型(VLM)、视觉‑语言‑动作模型(VLA)等多模态AI系统具备自动化完成该任务的潜力。但三维世界审计任务复杂度很高,需要两项能力深度耦合:动作能力,在三维空间中导航,系统性高效搜索异常;视觉推理能力,理解环境,从多模态观测中识别异常。多模态智能体能否有效耦合这两项能力,利用视觉推理发现潜在异常、并通过动作完成验证,该问题尚未得到充分探索。
本文提出WorldAuditBench三维世界审计评测基准,基于Unreal Engine5与Three.js构建13个仿真环境,合计213项异常任务,覆盖5大类异常家族。本文设计两套评测范式对5个前沿模型开展评测:①VLM智能体:视觉推理直接指导动作选择;②两阶段VLA‑VLM流水线:VLA完成环境探索,后续交由VLM做离线异常识别。
实验结果显示:被测模型在两套范式下任务成功率区间为6.6%‑42.3%,远低于人类基线83.4%。通过世界审计任务,WorldAuditBench提供测试床,用于研究多模态智能体在交互式三维环境中如何实现动作与视觉推理耦合,同时揭示当前智能体在探索过程中证据收集、证据解读方面存在显著短板。

关键词
具身智能;三维仿真;多模态智能体;世界审计;异常检测;Embodied AI;评测基准

目录

  1. 引言
  2. 相关工作
  3. WorldAuditBench数据集
    • 3.1 数据集总览
    • 3.2 异常分类体系
    • 3.3 任务构建流程
  4. 审计任务的两种评测范式
    • 4.1 任务定义
    • 4.2 VLM‑ONLY 单模型审计范式
    • 4.3 VLA‑VLM两阶段审计范式
  5. 实验
    • 5.1 实验设置与评测指标
    • 5.2 主实验结果
  6. 消融实验
    • 6.1 影响审计性能的关键因素
    • 6.2 单场景多异常审计
    • 6.3 异常暴露与识别能力拆解
  7. 结论
  8. 附录简要说明

1 引言

交互式3D虚拟世界允许人类玩家与AI智能体探索、交互物体、完成仿真任务,被广泛应用于具身AI研究。然而仿真世界即便视觉上十分逼真,仍然会存在各类物理逻辑异常:椅子悬浮离地、实体墙体可以直接穿行、物体视角切换之后直接消失。这类缺陷会严重干扰智能体训练与评估,例如智能体依靠穿墙完成导航任务,此时不能认为导航算法具备真实可靠性。
检测这类环境缺陷不能只做静态画面查看;很多异常只有经过交互、多次变换视角之后才会显现。由此引出核心问题:多模态智能体是否可以自主完成三维世界审计,自动发现环境异常?

世界审计任务需要两项深度耦合的核心能力

  1. 动作能力:在有限预算下对大空间做系统性探索;
  2. 视觉推理能力:区分真正环境缺陷与单纯外观奇特;观测发现疑似异常后,主动选择动作进一步验证假设,最终确认缺陷是否真实存在。

示例:围栏视觉上是实体障碍物,但是碰撞存在bug。智能体需要导航靠近围栏,尝试向前穿行;对比穿行前后画面,确认自己直接穿过围栏没有被阻挡。整个流程:视觉推理建立“围栏应当阻挡移动”的预期,执行动作完成测试,利用观测得到碰撞失效的证据。

现有基准大多针对静态图片、预录视频做视觉推理,或是评测智能体完成指定任务;缺少针对交互式异常搜索审计的完整评测。

本文贡献:

  1. 构建WorldAuditBench交互式三维世界审计基准:13个仿真环境,213项任务,5大类异常,覆盖静态物理、交互物理、空间一致性、时间一致性、语义一致性;任务需要视觉检查、交互操作、多次对比观测才能定位异常。
  2. 对比两套审计范式:VLM‑ONLY(推理与探索同步进行)、VLA‑VLM两阶段(先探索后离线分析轨迹),研究动作与视觉推理耦合带来的性能差异。
  3. 对5个主流大模型开展评测;AI最高成功率仅42.3%,显著低于人类83.4%基线;通过消融拆解失败来源:异常无法被探索暴露、暴露之后仍然识别失败;同时验证记忆工具、任务提示、起始位置对结果的影响。

2 相关工作

  1. 静态/视频异常识别基准
    Video‑MME、GlitchBench、VideoGameQA‑Bench基于图片、预录视频识别游戏故障。这类数据集证据是预先提供给模型,模型只做被动问答,不需要主动执行动作去获取证据。

  2. 交互式具身仿真环境
    AI2‑THOR、Habitat、UnrealCV、SimWorld、UnrealZoo提供三维交互仿真;EmbodiedBench、OpenEQA评测交互式任务执行、信息搜集。FlySearch支持在三维环境寻找放错位置物体,但只针对视觉上一眼可见的物体错位。

WorldAuditBench区别:大量异常必须主动交互、改变视角、回访位置才可以显现;证据搜集本身是任务核心环节,而不是简单定位肉眼可见物体。

3 WorldAuditBench数据集

3.1 数据集总览

  • 环境数量:13套交互式3D环境,27个子场景;Unreal Engine5实现126个任务,Three.js实现87个任务。
  • 场景类型:室内、城市、历史古风、工业厂房、自然野外。
  • 全部213个任务每个任务植入1个目标异常;智能体以第一人称视角探索,完成异常识别并输出审计报告。

3.2 异常分类体系

五大异常家族,向下细分为15个子类别:

  1. 静态物理 Static physics:静态物体违背物理规则;物体悬浮、物体互相穿插、尺寸比例错误。
  2. 交互物理 Interactive physics:物体交互过程违背物理;墙体可穿透、物体接触之后出现反常运动。
  3. 空间一致性 Spatial consistency:物体外观随视角、观察位置发生不合理变化。
  4. 时间一致性 Temporal consistency:物体随时间发生无理由改变;物体消失、属性莫名变更。
  5. 语义一致性 Semantic consistency:物体配置与场景历史、功能设定互相矛盾。

部分异常单张截图即可识别;很大一部分异常必须通过交互、切换视角、回访位置才能暴露。

3.3 任务构建流程

任务分为三步构建:场景收集 → 任务制作 → 人工校验

  1. 场景收集:从公开资源获取13套三维环境,切分出27个独立子场景;限定可探索区域,设置智能体起始位姿。
  2. 任务制作:在无bug原始场景中人为植入异常:修改物体摆放、碰撞体、渲染外观、时序行为;同时标注真值异常类别,编写评测评分细则。
  3. 人工校验:独立评审人员手动运行任务,判断异常是否可观测;只有至少两名评审标记为Pass,任务才被采纳;Fail/Uncertain则迭代修改。

4 审计任务的两种评测范式

4.1 任务定义

智能体接收审计指令、场景上下文、初始第一人称RGB观测;在固定探索预算内完成交互,最终输出审计报告,描述异常并且附上支撑证据截图。
交互轨迹形式化定义:
τ = ( x , a 0 , o 1 , . . . , a T − 1 , o T , y ) \tau=\left(x, a_{0}, o_{1}, ..., a_{T-1}, o_{T}, y\right)τ=(x,a0​,o1​,...,aT−1​,oT​,y)

  • a t a_tat​:环境动作;o t + 1 o_{t+1}ot+1​:动作返回观测;y yy:最终审计报告。
    报告交由VLM‑as‑Judge裁判模型,对照评分细则判断任务是否成功。

可用工具集合:导航移动、视角转动、物体交互、等待时间、记忆工具(保存/回看历史帧、笔记)、异常报告工具。

4.2 VLM‑ONLY 单模型审计范式

VLM智能体边探索边推理:每一步结合已经收集的全部轨迹、当前画面,自主选择下一步动作。发现疑似异常就主动规划视角、交互操作开展验证;推理直接引导后续探索行为。
可以调用记忆工具,回看历史画面、查阅笔记;随时撰写、修订异常报告。

4.3 VLA‑VLM两阶段审计范式

探索和分析完全解耦:

  1. VLA模型先独立运行,完成环境探索,完整记录轨迹截图序列;探索阶段没有高层推理指导。
  2. 探索全部结束之后,将整套录制好的观测轨迹送入VLM做离线分析,输出异常审计报告。

关键短板:VLM只能使用已经录制好的固定画面,不能再发起新动作去验证猜想。

5 实验

5.1 实验设置与评测指标

被测模型:GPT‑6 Astra、Claude Opus 5、Gemini 3.8 Flash、Muse Spark 1.3、Qwen 3.8 Flash。

  • VLM‑ONLY范式:每个任务最多40步环境动作。
  • VLA‑VLM范式:使用Open‑P2P 1.2B作为VLA探索模型,固定60秒探索时长,0.5秒采样一张截图;所有VLM后端使用同一套录制轨迹做分析。
    人类基线:约10位计算机方向博士生完成人工审计;每人单任务最多10分钟;使用和AI完全相同任务输入。
    评测指标:成功率SR(Success Rate),正确识别目标异常的任务占比;使用GPT‑6 Astra作为裁判模型,裁判与人类标注一致性κ=0.645,整体一致率91.72%。

5.2 主实验结果

审计方案静态物理交互物理空间一致时间一致语义一致总体成功率
人类基线89.881.376.378.188.683.4%
VLM‑ONLY范式
GPT‑6 Astra59.329.345.112.568.242.3%
Claude Opus 535.619.529.412.550.028.2%
Gemini 3.8 Flash49.222.029.412.550.032.4%
Muse Spark 1.322.012.213.75.022.715.0%
Qwen 3.8 Flash11.97.33.92.522.78.5%
VLA‑VLM两阶段范式
GPT‑6 Astra20.317.125.50.013.616.4%
Claude Opus 522.022.011.82.513.615.0%
Gemini 3.8 Flash20.324.417.65.018.217.4%
Muse Spark 1.35.19.89.80.09.16.6%
Qwen 3.8 Flash18.622.011.80.04.512.7%

实验关键现象:

  1. VLM‑ONLY边推理边探索整体显著优于两阶段VLA‑VLM;最高AI成功率仅42.3%,距离人类83.4%存在巨大鸿沟。
  2. 时间一致性异常难度最高,几乎所有模型该类任务SR≤12.5%;需要回访对比前后状态,对记忆、证据串联要求很高。
  3. 两阶段方案推理开销更低,速度是交互式VLM方案的2.7‑10.3倍;但是因为无法追加动作验证,任务成功率大幅下降。

6 消融实验

6.1 影响审计性能的关键因素(基于Gemini3.8‑Flash,Unreal的126个任务)

实验条件VLM‑ONLY成功率VLA‑VLM成功率
默认配置33.3%5.6%
起始位置靠近异常点38.1%(+4.8pp)7.1%(+1.6pp)
探索预算缩减0.5倍23.0%(-10.3pp)4.0%(-1.6pp)
探索预算放大1.5倍34.9%(+1.6pp)7.1%(+1.6pp)
去掉上下文样例ICL31.0%(-2.4pp)5.6%(0pp)
去掉ICL+去掉异常类型提示15.9%(-17.5pp)2.4%(-3.2pp)

结论:

  1. 起始距离越远,审计难度越高;
  2. 探索预算降低性能明显下滑;预算增大收益边际递减;
  3. 异常类型提示对性能影响远大于上下文样例ICL;知道需要寻找哪一类问题,对引导探索至关重要。

6.2 单场景多异常审计

在原有任务基础,额外植入1‑2个新增异常;智能体知道场景内异常总数量,但是只给原始目标异常的类型提示。

  • 锚点目标异常识别成功率基本不受新增异常数量影响(单异常42.9%;3异常47.6%)。
  • 全部异常完整识别难度极大:2异常条件完整识别率7.1%;3异常条件完整识别率4.8%。

在固定探索预算约束下,找到一个目标异常会消耗大量动作预算,很难再去发现其余共存bug。

6.3 异常暴露与识别能力拆解(GPT‑6 Astra)

指标VLM‑ONLYVLA‑VLM
几何覆盖率(理论可看见)91.1%47.4%
人工判定真实暴露异常占比68.1%34.7%
整体任务成功率42.3%16.4%

分析:

  1. VLM‑ONLY范式因为推理可以实时指导导航,能显著提升异常被探索暴露的概率;
  2. 即便异常已经被画面暴露,VLM‑ONLY仍然优于两阶段方案:得益于记忆工具,可以回看多帧画面,跨时间跨视角对比证据;两阶段只能依赖已经录制的固定轨迹。

审计任务需要两项缺一不可:①主动探索把异常暴露出来;②拿到观测之后,跨帧关联证据完成识别。

7 结论

本文提出WorldAuditBench,一套交互式三维世界异常审计评测基准;13套环境、213项任务,覆盖五大类必须依靠交互、多视角回访才能够发现的仿真异常。
对比VLM边探索边推理、VLA‑VLM两阶段流水线两套范式:VLM‑ONLY整体性能显著更高,但即使最优模型也仅有42.3%成功率,距离人类83.4%基线差距巨大。消融实验证明失败来源于两个层面:异常无法被探索暴露;异常画面出现之后仍然无法完成证据比对识别。
该基准可以用于研究具身智能体如何耦合动作规划与时序视觉推理,实现主动假设验证式的环境审计。

8 参考文献

完整参考文献查阅原始arXiv网页:https://arxiv.org/html/2609.40325v1

附录简要说明

  • 附录A:13套环境完整清单、引擎、任务数量、资产许可证说明。
  • 附录B:任务制作、人工评审完整流程,标注字段样例。
  • 附录C:评测完整协议、智能体输入指令、全部工具定义、裁判Prompt、裁判与人类一致性验证。
  • 附录D:全部细分实验数值表格。
  • 附录E:异常分类体系完整定义,每一类异常的示例说明。
  • 附录F:定性轨迹案例,失败与成功任务样例。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/10/2 6:57:20

POC测试评分表:技术交付的可量化契约与自动化验证指南

简介:本资源是一份标准化的POC测试评分表(Word文档),面向企业IT架构师、系统集成工程师及业务需求分析师,用于在概念验证阶段科学评估解决方案的功能适配性与系统集成能力。表格聚焦功能满足程度与接口满足程度两大核心…

作者头像 李华
网站建设 2026/10/2 6:57:17

电影购票系统(协同过滤算法影片推荐、ECharts 影院经营数据看板、影片排片与可视化选座、座位锁定及超时自动释放、支付宝沙箱支付、订单退票申请审核、影片与影院收藏、影片评论点赞及回复)

系统亮点:协同过滤算法影片推荐、ECharts 影院经营数据看板、影片排片与可视化选座、座位锁定及超时自动释放、支付宝沙箱支付、订单退票申请审核、影片与影院收藏、影片评论点赞及回复;一、项目概述电影购票系统采用前后端分离架构,面向普通…

作者头像 李华
网站建设 2026/10/2 6:57:16

给AI改名,改的是定价权

《给AI改名,改的是定价权》 ——名字可以先到未来,能力得一步一步走过去一个词,两个字母,不到十天,让两位市值最高公司的掌门人当众改了口。事情说来像段子。九月二十二日,美国总统站在联合国讲台上说&…

作者头像 李华
网站建设 2026/10/2 6:57:09

家庭影院K歌音响的音质优势与性价比分析

在家搭建兼具观影和K歌功能的音响系统时,很多人会混淆家庭影院音质和K歌音响音质的评判标准,也容易陷入“音质好一定贵”“低价产品肯定效果差”的误区。实际上,家庭影院K歌音响的音质表现和性价比,都可以通过固定维度拆解&#x…

作者头像 李华
网站建设 2026/10/2 6:56:59

基于Dify构建hindsight复盘工作流:从后见之明到行动承诺

上周四我们做完一次线上故障复盘,最后一行 PPT 写着:下次加强测试。散会后所有人点头,可谁都说不清“加强”对应的是哪个具体动作。这种“事后什么都看得清楚”的状态,心理学里有个专门的名字:hindsight bias&#xff…

作者头像 李华
网站建设 2026/10/2 6:55:21

OpenRig context pack上下文包完整指南:打包、安装与ref安全校验

OpenRig context pack上下文包完整指南:打包、安装与ref安全校验 【免费下载链接】openrig Multi-agent harness that runs Claude Code and Codex together as one system 项目地址: https://gitcode.com/GitHub_Trending/op/openrig OpenRig 是一个让 Clau…

作者头像 李华