arXiv cs.AI· Yuxuan Cao, Junlong Li, Hao Li, Junxian He·· 4 小时前AI 评分57
Mine Odyssey 基准测试显示 GPT-6 Astra 在真实世界空间智能任务中成功率最高
Mine Odyssey: Benchmarking Spatial Agentic Intelligence in the Wild
AI 摘要
arXiv 论文 Mine Odyssey 发布了一个基于 Minecraft 重建真实地点的基准,用于评估代理的空间智能,涵盖全球五大洲 20 个地区的 30 个地点共 180 个任务。该基准要求代理在包含户外和室内、不同地形与连通性的环境中执行自然语言指令,完成寻找路径、开门、上下楼梯等动作并处理导航错误。在八个最先进模型的评估中,GPT-6 Astra 以 85.6% 的成功率领先,Claude Opus 5.5 为 73.9%,而最强的开源权重模型 DeepSeek-V4.1-Flash 仅为 23.9%。
这一结果揭示了当前模型在处理非结构化物理环境时的显著能力断层。事实层面,测试场景包括曼哈顿中城、白金汉宫等具体地标,且任务设计强制要求代理进行多步规划与错误恢复。推断层面,开源模型与闭源模型之间超过 50 个百分点的差距表明,现有的开源架构在长程空间推理或视觉 - 动作对齐上存在关键瓶颈,而非单纯的数据量差异。猜测层面,这种差距可能源于训练数据中缺乏真实的物理交互反馈循环,导致模型难以泛化到未见过的复杂布局。
对于行业而言,该基准提供了一个可验证的物理智能标尺,提示开发者需关注从“静态知识”向“动态探索”的能力迁移。目前的技术路线若无法解决此类长程空间规划问题,将限制 Agent 在现实世界的实际部署价值。
来源:arXiv cs.AI · arxiv.org