跳到正文
原文
arXiv cs.AI· Xisen Jin, Jingheng Li, Zhenglun Chen, Junyi Du, Xiang Ren·· 11 小时前AI 评分72

ReLiveGym 通过数周重放真实世界信息流评测长时程智能体,发现行动时机机制影响性能

ReLiveGym: Evaluating Long-Lived Agents over Weeks of Replayed Reality

AI 摘要

论文提出 ReLiveGym,让大语言模型智能体在按时间重放的数周新闻、市场与社交媒体流中稀疏行动,以评测长时程任务。跨八个基础语言模型测试显示,智能体如何决定何时行动是重要的运行框架设计轴,最优设计会随任务和模型选择变化,持续从事后反馈中学习也影响性能并缓解失败模式。事实是这些结果来自预印本;推断是长时程智能体产品应把触发时机与反馈闭环纳入设计;材料未提供商业数据,故不猜测收益。

来源:arXiv cs.AI · arxiv.org