LEGO-Bench揭示AI Agent重建3D场景几何能力不足
先了解这件事
2026年10月3日,The Decoder报道Li等人提出LEGO-Anything框架及LEGO-Bench基准测试。该研究通过编码Agent将单张照片转换为可执行的Blender程序,以评估AI智能体生成3D场景的能力。在包含208张图像的测试集中,GPT-6 Astra模型在室内场景的几何重建准确率最高,达到53.4%,而室外场景仅为39.6%。尽管所有六个GPT配置都能生成可用的场景,但模型在几何精度和外观相似度上表现差异巨大,且随着场景复杂度增加,准确率显著下降。报道指出AI智能体缺乏自我纠错能力。
AI 根据报道生成 · 1 小时前更新
报道时间线
沿着报道,了解事件的不同侧面。
- The DecoderLEGO-Anything 测试显示 AI 智能体生成 3D 场景时缺乏自我纠错能力
Li 等人提出 LEGO-Anything 框架,通过编码 Agent 将单张照片转换为可执行的 Blender 程序,并构建 LEGO-Bench 基准测试其性能。在包含 208 张图像的测试集中,GPT-6 Astra 模型在室内场景的几何重建准确率最高,达到 53.4%,而室外场景仅为 39.6%。尽管所有六个 GPT 配置都能生成可用的场景,但模型在几何精度和外观相似度上表现差异巨大,且随着场景复杂度增加,准确率显著下降。 核心发现在于 Agent 的自我评估机制失效:当要求模型判断哪个版本更接近原图时,其几何判断准确率接近随机水平(chance level)。研究人员分析发现,Agent 常出现初始尝试失败、修改导致进度倒退以及不可靠的自我评估等问题,甚至 GPT-6 Astra 也会在后期破坏已生成的场景。为解决此问题,团队开发了无需额外训练的 LEGO-Plugin,该插件用具体测量值替代不可靠的自我判断,使较弱模型的准确率提升了高达 62.7%。 在下游任务验证中,生成的可执行程序场景虽能直接用于目标检测、分割和深度估计,但效果并不理想。目标检测性能约为专用模型 DINO 的一半,而在分割和深度估计任务上与 SAM 3 和 Depth Anything 3 等专用模型的差距更大。这表明当前编码 Agent 生成的场景虽具潜力,但在忠实度上仍存在巨大鸿沟,未来应依赖客观测量而非模型自身判断进行优化。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。