arXiv cs.AI· Michael Hardy, Ruhana Azam, Anka Reuel, Mykel Kochenderfer, Sanmi Koyejo·· 10 小时前精选AI 评分78
智能体评测可靠性研究显示,更多任务并不总能修复智能体榜单排名。
Agent Evaluation Reliability: More Tasks Won't (Always) Fix An Agent Leaderboard
AI 导读
论文提出贝叶斯方差分解框架,发现智能体榜单中固定 model-scaffold 系统排名可靠,而底层模型排名可靠性明显更低。在 22 个 Holistic Agent Leaderboard 和 Harbor Index 基准上,固定 model-scaffold 系统可靠性为 0.935-0.994,底层模型可靠性为 0.148-0.841。当不确定性主要来自 scaffold 覆盖不足时,无限增加同类任务最多只能把模型排名可靠性提高 0.097;合并多样基准可在相同任务预算下把预测可靠性从 0.44 提到 0.75,并最多降低 83% 成本,推断上评估预算应优先投向 scaffold 与基准覆盖。
推荐理由
它把智能体榜单可靠性拆到脚手架覆盖与任务数量,能校正加任务就能提升模型排名可信度的评估预算判断。
来源:arXiv cs.AI · arxiv.org