WorldAuditBench:面向多模态智能体的交互式三维世界审计评测基准
arXiv编号:arXiv:2609.40325v1 [cs.AI]
摘要
交互式三维虚拟世界越来越多地被用于智能行为研究,如何高效识别仿真环境中的各类异常(物体漂浮、可穿透墙体、物体随视角消失等)成为重要课题。视觉‑语言模型(VLM)、视觉‑语言‑动作模型(VLA)等多模态AI系统具备自动化完成该任务的潜力。但三维世界审计任务复杂度很高,需要两项能力深度耦合:动作能力,在三维空间中导航,系统性高效搜索异常;视觉推理能力,理解环境,从多模态观测中识别异常。多模态智能体能否有效耦合这两项能力,利用视觉推理发现潜在异常、并通过动作完成验证,该问题尚未得到充分探索。
本文提出WorldAuditBench三维世界审计评测基准,基于Unreal Engine5与Three.js构建13个仿真环境,合计213项异常任务,覆盖5大类异常家族。本文设计两套评测范式对5个前沿模型开展评测:①VLM智能体:视觉推理直接指导动作选择;②两阶段VLA‑VLM流水线:VLA完成环境探索,后续交由VLM做离线异常识别。
实验结果显示:被测模型在两套范式下任务成功率区间为6.6%‑42.3%,远低于人类基线83.4%。通过世界审计任务,WorldAuditBench提供测试床,用于研究多模态智能体在交互式三维环境中如何实现动作与视觉推理耦合,同时揭示当前智能体在探索过程中证据收集、证据解读方面存在显著短板。
关键词
具身智能;三维仿真;多模态智能体;世界审计;异常检测;Embodied AI;评测基准
目录
- 引言
- 相关工作
- WorldAuditBench数据集
- 3.1 数据集总览
- 3.2 异常分类体系
- 3.3 任务构建流程
- 审计任务的两种评测范式
- 4.1 任务定义
- 4.2 VLM‑ONLY 单模型审计范式
- 4.3 VLA‑VLM两阶段审计范式
- 实验
- 5.1 实验设置与评测指标
- 5.2 主实验结果
- 消融实验
- 6.1 影响审计性能的关键因素
- 6.2 单场景多异常审计
- 6.3 异常暴露与识别能力拆解
- 结论
- 附录简要说明
1 引言
交互式3D虚拟世界允许人类玩家与AI智能体探索、交互物体、完成仿真任务,被广泛应用于具身AI研究。然而仿真世界即便视觉上十分逼真,仍然会存在各类物理逻辑异常:椅子悬浮离地、实体墙体可以直接穿行、物体视角切换之后直接消失。这类缺陷会严重干扰智能体训练与评估,例如智能体依靠穿墙完成导航任务,此时不能认为导航算法具备真实可靠性。
检测这类环境缺陷不能只做静态画面查看;很多异常只有经过交互、多次变换视角之后才会显现。由此引出核心问题:多模态智能体是否可以自主完成三维世界审计,自动发现环境异常?
世界审计任务需要两项深度耦合的核心能力
- 动作能力:在有限预算下对大空间做系统性探索;
- 视觉推理能力:区分真正环境缺陷与单纯外观奇特;观测发现疑似异常后,主动选择动作进一步验证假设,最终确认缺陷是否真实存在。
示例:围栏视觉上是实体障碍物,但是碰撞存在bug。智能体需要导航靠近围栏,尝试向前穿行;对比穿行前后画面,确认自己直接穿过围栏没有被阻挡。整个流程:视觉推理建立“围栏应当阻挡移动”的预期,执行动作完成测试,利用观测得到碰撞失效的证据。
现有基准大多针对静态图片、预录视频做视觉推理,或是评测智能体完成指定任务;缺少针对交互式异常搜索审计的完整评测。
本文贡献:
- 构建WorldAuditBench交互式三维世界审计基准:13个仿真环境,213项任务,5大类异常,覆盖静态物理、交互物理、空间一致性、时间一致性、语义一致性;任务需要视觉检查、交互操作、多次对比观测才能定位异常。
- 对比两套审计范式:VLM‑ONLY(推理与探索同步进行)、VLA‑VLM两阶段(先探索后离线分析轨迹),研究动作与视觉推理耦合带来的性能差异。
- 对5个主流大模型开展评测;AI最高成功率仅42.3%,显著低于人类83.4%基线;通过消融拆解失败来源:异常无法被探索暴露、暴露之后仍然识别失败;同时验证记忆工具、任务提示、起始位置对结果的影响。
2 相关工作
静态/视频异常识别基准
Video‑MME、GlitchBench、VideoGameQA‑Bench基于图片、预录视频识别游戏故障。这类数据集证据是预先提供给模型,模型只做被动问答,不需要主动执行动作去获取证据。交互式具身仿真环境
AI2‑THOR、Habitat、UnrealCV、SimWorld、UnrealZoo提供三维交互仿真;EmbodiedBench、OpenEQA评测交互式任务执行、信息搜集。FlySearch支持在三维环境寻找放错位置物体,但只针对视觉上一眼可见的物体错位。
WorldAuditBench区别:大量异常必须主动交互、改变视角、回访位置才可以显现;证据搜集本身是任务核心环节,而不是简单定位肉眼可见物体。
3 WorldAuditBench数据集
3.1 数据集总览
- 环境数量:13套交互式3D环境,27个子场景;Unreal Engine5实现126个任务,Three.js实现87个任务。
- 场景类型:室内、城市、历史古风、工业厂房、自然野外。
- 全部213个任务每个任务植入1个目标异常;智能体以第一人称视角探索,完成异常识别并输出审计报告。
3.2 异常分类体系
五大异常家族,向下细分为15个子类别:
- 静态物理 Static physics:静态物体违背物理规则;物体悬浮、物体互相穿插、尺寸比例错误。
- 交互物理 Interactive physics:物体交互过程违背物理;墙体可穿透、物体接触之后出现反常运动。
- 空间一致性 Spatial consistency:物体外观随视角、观察位置发生不合理变化。
- 时间一致性 Temporal consistency:物体随时间发生无理由改变;物体消失、属性莫名变更。
- 语义一致性 Semantic consistency:物体配置与场景历史、功能设定互相矛盾。
部分异常单张截图即可识别;很大一部分异常必须通过交互、切换视角、回访位置才能暴露。
3.3 任务构建流程
任务分为三步构建:场景收集 → 任务制作 → 人工校验
- 场景收集:从公开资源获取13套三维环境,切分出27个独立子场景;限定可探索区域,设置智能体起始位姿。
- 任务制作:在无bug原始场景中人为植入异常:修改物体摆放、碰撞体、渲染外观、时序行为;同时标注真值异常类别,编写评测评分细则。
- 人工校验:独立评审人员手动运行任务,判断异常是否可观测;只有至少两名评审标记为
Pass,任务才被采纳;Fail/Uncertain则迭代修改。
4 审计任务的两种评测范式
4.1 任务定义
智能体接收审计指令、场景上下文、初始第一人称RGB观测;在固定探索预算内完成交互,最终输出审计报告,描述异常并且附上支撑证据截图。
交互轨迹形式化定义:
τ = ( x , a 0 , o 1 , . . . , a T − 1 , o T , y ) \tau=\left(x, a_{0}, o_{1}, ..., a_{T-1}, o_{T}, y\right)τ=(x,a0,o1,...,aT−1,oT,y)
- a t a_tat:环境动作;o t + 1 o_{t+1}ot+1:动作返回观测;y yy:最终审计报告。
报告交由VLM‑as‑Judge裁判模型,对照评分细则判断任务是否成功。
可用工具集合:导航移动、视角转动、物体交互、等待时间、记忆工具(保存/回看历史帧、笔记)、异常报告工具。
4.2 VLM‑ONLY 单模型审计范式
VLM智能体边探索边推理:每一步结合已经收集的全部轨迹、当前画面,自主选择下一步动作。发现疑似异常就主动规划视角、交互操作开展验证;推理直接引导后续探索行为。
可以调用记忆工具,回看历史画面、查阅笔记;随时撰写、修订异常报告。
4.3 VLA‑VLM两阶段审计范式
探索和分析完全解耦:
- VLA模型先独立运行,完成环境探索,完整记录轨迹截图序列;探索阶段没有高层推理指导。
- 探索全部结束之后,将整套录制好的观测轨迹送入VLM做离线分析,输出异常审计报告。
关键短板:VLM只能使用已经录制好的固定画面,不能再发起新动作去验证猜想。
5 实验
5.1 实验设置与评测指标
被测模型:GPT‑6 Astra、Claude Opus 5、Gemini 3.8 Flash、Muse Spark 1.3、Qwen 3.8 Flash。
- VLM‑ONLY范式:每个任务最多40步环境动作。
- VLA‑VLM范式:使用Open‑P2P 1.2B作为VLA探索模型,固定60秒探索时长,0.5秒采样一张截图;所有VLM后端使用同一套录制轨迹做分析。
人类基线:约10位计算机方向博士生完成人工审计;每人单任务最多10分钟;使用和AI完全相同任务输入。
评测指标:成功率SR(Success Rate),正确识别目标异常的任务占比;使用GPT‑6 Astra作为裁判模型,裁判与人类标注一致性κ=0.645,整体一致率91.72%。
5.2 主实验结果
| 审计方案 | 静态物理 | 交互物理 | 空间一致 | 时间一致 | 语义一致 | 总体成功率 |
|---|---|---|---|---|---|---|
| 人类基线 | 89.8 | 81.3 | 76.3 | 78.1 | 88.6 | 83.4% |
| VLM‑ONLY范式 | ||||||
| GPT‑6 Astra | 59.3 | 29.3 | 45.1 | 12.5 | 68.2 | 42.3% |
| Claude Opus 5 | 35.6 | 19.5 | 29.4 | 12.5 | 50.0 | 28.2% |
| Gemini 3.8 Flash | 49.2 | 22.0 | 29.4 | 12.5 | 50.0 | 32.4% |
| Muse Spark 1.3 | 22.0 | 12.2 | 13.7 | 5.0 | 22.7 | 15.0% |
| Qwen 3.8 Flash | 11.9 | 7.3 | 3.9 | 2.5 | 22.7 | 8.5% |
| VLA‑VLM两阶段范式 | ||||||
| GPT‑6 Astra | 20.3 | 17.1 | 25.5 | 0.0 | 13.6 | 16.4% |
| Claude Opus 5 | 22.0 | 22.0 | 11.8 | 2.5 | 13.6 | 15.0% |
| Gemini 3.8 Flash | 20.3 | 24.4 | 17.6 | 5.0 | 18.2 | 17.4% |
| Muse Spark 1.3 | 5.1 | 9.8 | 9.8 | 0.0 | 9.1 | 6.6% |
| Qwen 3.8 Flash | 18.6 | 22.0 | 11.8 | 0.0 | 4.5 | 12.7% |
实验关键现象:
- VLM‑ONLY边推理边探索整体显著优于两阶段VLA‑VLM;最高AI成功率仅42.3%,距离人类83.4%存在巨大鸿沟。
- 时间一致性异常难度最高,几乎所有模型该类任务SR≤12.5%;需要回访对比前后状态,对记忆、证据串联要求很高。
- 两阶段方案推理开销更低,速度是交互式VLM方案的2.7‑10.3倍;但是因为无法追加动作验证,任务成功率大幅下降。
6 消融实验
6.1 影响审计性能的关键因素(基于Gemini3.8‑Flash,Unreal的126个任务)
| 实验条件 | VLM‑ONLY成功率 | VLA‑VLM成功率 |
|---|---|---|
| 默认配置 | 33.3% | 5.6% |
| 起始位置靠近异常点 | 38.1%(+4.8pp) | 7.1%(+1.6pp) |
| 探索预算缩减0.5倍 | 23.0%(-10.3pp) | 4.0%(-1.6pp) |
| 探索预算放大1.5倍 | 34.9%(+1.6pp) | 7.1%(+1.6pp) |
| 去掉上下文样例ICL | 31.0%(-2.4pp) | 5.6%(0pp) |
| 去掉ICL+去掉异常类型提示 | 15.9%(-17.5pp) | 2.4%(-3.2pp) |
结论:
- 起始距离越远,审计难度越高;
- 探索预算降低性能明显下滑;预算增大收益边际递减;
- 异常类型提示对性能影响远大于上下文样例ICL;知道需要寻找哪一类问题,对引导探索至关重要。
6.2 单场景多异常审计
在原有任务基础,额外植入1‑2个新增异常;智能体知道场景内异常总数量,但是只给原始目标异常的类型提示。
- 锚点目标异常识别成功率基本不受新增异常数量影响(单异常42.9%;3异常47.6%)。
- 全部异常完整识别难度极大:2异常条件完整识别率7.1%;3异常条件完整识别率4.8%。
在固定探索预算约束下,找到一个目标异常会消耗大量动作预算,很难再去发现其余共存bug。
6.3 异常暴露与识别能力拆解(GPT‑6 Astra)
| 指标 | VLM‑ONLY | VLA‑VLM |
|---|---|---|
| 几何覆盖率(理论可看见) | 91.1% | 47.4% |
| 人工判定真实暴露异常占比 | 68.1% | 34.7% |
| 整体任务成功率 | 42.3% | 16.4% |
分析:
- VLM‑ONLY范式因为推理可以实时指导导航,能显著提升异常被探索暴露的概率;
- 即便异常已经被画面暴露,VLM‑ONLY仍然优于两阶段方案:得益于记忆工具,可以回看多帧画面,跨时间跨视角对比证据;两阶段只能依赖已经录制的固定轨迹。
审计任务需要两项缺一不可:①主动探索把异常暴露出来;②拿到观测之后,跨帧关联证据完成识别。
7 结论
本文提出WorldAuditBench,一套交互式三维世界异常审计评测基准;13套环境、213项任务,覆盖五大类必须依靠交互、多视角回访才能够发现的仿真异常。
对比VLM边探索边推理、VLA‑VLM两阶段流水线两套范式:VLM‑ONLY整体性能显著更高,但即使最优模型也仅有42.3%成功率,距离人类83.4%基线差距巨大。消融实验证明失败来源于两个层面:异常无法被探索暴露;异常画面出现之后仍然无法完成证据比对识别。
该基准可以用于研究具身智能体如何耦合动作规划与时序视觉推理,实现主动假设验证式的环境审计。
8 参考文献
完整参考文献查阅原始arXiv网页:https://arxiv.org/html/2609.40325v1
附录简要说明
- 附录A:13套环境完整清单、引擎、任务数量、资产许可证说明。
- 附录B:任务制作、人工评审完整流程,标注字段样例。
- 附录C:评测完整协议、智能体输入指令、全部工具定义、裁判Prompt、裁判与人类一致性验证。
- 附录D:全部细分实验数值表格。
- 附录E:异常分类体系完整定义,每一类异常的示例说明。
- 附录F:定性轨迹案例,失败与成功任务样例。