AI NPC 评测:把感知、决策和动作分开打分
NPC 看起来“像人”很主观,工程上还是要拆回状态:它看到了什么、选了什么意图、最终执行了什么动作。三层混在一起,问题很难定位。
样本覆盖状态而不是台词
固定地图、角色属性、任务进度和随机种子,准备正常交互、记忆缺失、工具超时与非法动作。对话措辞可以变化,动作必须落在规则允许集合。
指标对应具体层
感知看关键信息是否获取,规划看意图是否满足约束,执行看动作成功和状态一致性。总体验分留给试玩评审,不替代分层测试。
- 模型无响应时回退到预设行为。
- 长期记忆标注来源与有效期。
- 战斗和奖励仍由确定性系统裁决。
复现一条失败轨迹
保存状态快照、候选意图、工具参数和最终动作。只记录最后一句台词,就像只截一帧掉帧画面,找不到前面哪一拍出了问题。
AI NPC 的“聪明”要建立在游戏规则内。状态可复现、动作可约束,才有空间继续打磨角色表现。