跳到正文
原文
arXiv cs.AI· Max Ku, Nok-Kan Law, Yu-Chien Tang, Shih-Ying Yeh, Ping Nie, Andy Zheng, Tat Hei Lai, Fei-Yueh Chen, Nikko Yu, Wei-Chieh Sun, Suzy Huang, Chiao-Wei Hsu, Chih-Chuan Huang, Chak-Wing Mak, Ho Yin Sam Ng, Edisy Kin Wai Chan, Min-Hung Chen, Ho Kei Cheng·· 4 小时前AI 评分65

IGMWorld 基准测试显示 Agent 在深度干预可执行游戏世界时可靠性随干预深度下降

World Editing: Intervening on Executable Worlds at Increasing Depth

AI 摘要

该论文提出“世界编辑”概念,定义为在保留原有属性前提下对现有可执行世界进行干预,并引入“干预深度”轴来描述编辑对实体、动态和系统的耦合强度。作者构建了 IGMWorld 框架及包含 110 个任务的 IGMBench 基准,覆盖 Minecraft 和 Terraria 中的属性、实体、动态及系统级干预,评估标准包括确定性可执行性、行为表现、属性保留和视觉检查。

实测数据显示,当前前沿编码智能体在严格任务级标准下解决率为 78.2%,准则级性能达 94.8%,但可靠性随干预深度增加而显著降低,且这一趋势在评估准则数量相似的任务中依然成立。尽管大多数失败案例仍能成功构建和加载,表明核心难点在于使编辑后的世界按预期运行而非代码语法错误。此外,所有配置在联合视觉通过率上均低于 50%,说明视觉一致性仍是独立短板。

事实层面,世界编辑被证实为区别于世界生成和交互的独立能力,可执行游戏提供了有效的测试环境。推断层面,随着 Agent 从生成转向编辑,工程重点将从代码生成转向状态验证与系统动力学约束。猜测层面,若无法解决深度干预下的行为一致性问题,Agent 在复杂模拟环境中的长期自主性将受限。

来源:arXiv cs.AI · arxiv.org