Mine Odyssey 发布:评估智能体空间智能的基准
先了解这件事
2026年10月9日,arXiv cs.AI 发布论文介绍 Mine Odyssey 基准。该基准基于 Minecraft 重建全球五大洲 20 个地区的 30 个真实地点,包含 180 个任务,旨在评估代理在复杂户外与室内环境中的空间智能。任务涵盖自然语言指令下的路径寻找、开门、上下楼梯及导航错误处理。在八个最先进模型的评估中,GPT-6 Astra 以 85.6% 的成功率领先,Claude Opus 5.5 为 73.9%。
AI 根据报道生成 · 2 小时前更新
报道时间线
沿着报道,了解事件的不同侧面。
- arXiv cs.AIMine Odyssey 基准测试显示 GPT-6 Astra 在真实世界空间智能任务中成功率最高
arXiv 论文 Mine Odyssey 发布了一个基于 Minecraft 重建真实地点的基准,用于评估代理的空间智能,涵盖全球五大洲 20 个地区的 30 个地点共 180 个任务。该基准要求代理在包含户外和室内、不同地形与连通性的环境中执行自然语言指令,完成寻找路径、开门、上下楼梯等动作并处理导航错误。在八个最先进模型的评估中,GPT-6 Astra 以 85.6% 的成功率领先,Claude Opus 5.5 为 73.9%,而最强的开源权重模型 DeepSeek-V4.1-Flash 仅为 23.9%。 这一结果揭示了当前模型在处理非结构化物理环境时的显著能力断层。事实层面,测试场景包括曼哈顿中城、白金汉宫等具体地标,且任务设计强制要求代理进行多步规划与错误恢复。推断层面,开源模型与闭源模型之间超过 50 个百分点的差距表明,现有的开源架构在长程空间推理或视觉 - 动作对齐上存在关键瓶颈,而非单纯的数据量差异。猜测层面,这种差距可能源于训练数据中缺乏真实的物理交互反馈循环,导致模型难以泛化到未见过的复杂布局。 对于行业而言,该基准提供了一个可验证的物理智能标尺,提示开发者需关注从“静态知识”向“动态探索”的能力迁移。目前的技术路线若无法解决此类长程空间规划问题,将限制 Agent 在现实世界的实际部署价值。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。