arXiv cs.AI· Surya Shetty, Ulisses Braga-Neto·· 4 小时前AI 评分68
LLM-IDEA 提出可识别性驱动引擎以区分自主发现中的能力极限与数据不可识别
LLM-IDEA: Identifiability-Driven Experimental Agent for Autonomous Discovery of Mechanistic World Models
AI 摘要
该论文提出 LLM-IDEA(Identifiability-Driven Experimental Agent),旨在解决大语言模型作为自主科学家在实验设计中常被忽视的可识别性问题。当系统达到性能 plateau 时,传统方法无法判断是模型能力不足还是参数本身从数据中不可识别,导致无效重复实验。LLM-IDEA 通过引入可识别性引擎,能给出三种明确结论:能力限制、在当前设计类中可解析或已认证耗尽。
在 ODEBench 基准测试中,62 个含自由常数的系统中有 60 个在初始轮次即可被识别;RC 电路在所有协议实验中均被判定为耗尽;而一个收获模型仅需增加一个初始条件即可解析。在 Alien Universe 双体测试集中,使用可识别协议的 LLM-IDEA 在 8 个种子中均达到至少深度 3 的发现,而无此协议仅 1/8 成功。DiscoverPhysics 基准显示,所有轨迹准确但无法区分解释的模型均未能通过解释评分(15/15),而在可识别世界中这一比例为 5/9(p = 0.012)。
事实层面,该研究验证了可识别性判断能显著减少无效搜索并提升发现深度。推断上,这意味着未来自主科研 Agent 需集成统计可识别性模块以避免陷入局部最优。猜测部分,若该机制泛化至更复杂物理系统,可能重塑 AI 科学发现的评估标准,但目前仅限于特定数学模型与合成环境。
来源:arXiv cs.AI · arxiv.org