跳到正文
原文
The Decoder· Jonathan Kemper·· 7 小时前AI 评分72

LEGO-Anything 测试显示 AI 智能体生成 3D 场景时缺乏自我纠错能力

AI agents build 3D scenes from photos but have no idea if they got it right

AI 摘要

Li 等人提出 LEGO-Anything 框架,通过编码 Agent 将单张照片转换为可执行的 Blender 程序,并构建 LEGO-Bench 基准测试其性能。在包含 208 张图像的测试集中,GPT-6 Astra 模型在室内场景的几何重建准确率最高,达到 53.4%,而室外场景仅为 39.6%。尽管所有六个 GPT 配置都能生成可用的场景,但模型在几何精度和外观相似度上表现差异巨大,且随着场景复杂度增加,准确率显著下降。

核心发现在于 Agent 的自我评估机制失效:当要求模型判断哪个版本更接近原图时,其几何判断准确率接近随机水平(chance level)。研究人员分析发现,Agent 常出现初始尝试失败、修改导致进度倒退以及不可靠的自我评估等问题,甚至 GPT-6 Astra 也会在后期破坏已生成的场景。为解决此问题,团队开发了无需额外训练的 LEGO-Plugin,该插件用具体测量值替代不可靠的自我判断,使较弱模型的准确率提升了高达 62.7%。

在下游任务验证中,生成的可执行程序场景虽能直接用于目标检测、分割和深度估计,但效果并不理想。目标检测性能约为专用模型 DINO 的一半,而在分割和深度估计任务上与 SAM 3 和 Depth Anything 3 等专用模型的差距更大。这表明当前编码 Agent 生成的场景虽具潜力,但在忠实度上仍存在巨大鸿沟,未来应依赖客观测量而非模型自身判断进行优化。

来源:The Decoder · the-decoder.com