跳到正文
热点事件持续更新

Agent评测可靠性框架研究

1 篇报道1 个报道来源10 小时前更新

先了解这件事

AI 综述

2026-10-02,arXiv cs.AI 的一项智能体评测可靠性研究显示,更多任务并不总能修复智能体榜单排名。论文提出贝叶斯方差分解框架,用于分析智能体榜单中不同层级排名的可靠性。研究显示,在 22 个 Holistic Agent Leaderboard 和 Harbor Index 基准上,固定 model-scaffold 系统的排名可靠性为 0.935 至 0.994,而底层模型排名可靠性为 0.148 至 0.841,明显更低。报道还指出,当不确定性主要来自 scaffold 覆盖不足时,无限增加同类任务最多只能把模型排名可靠性提高,但报道未给出完整数值。目前进展是该框架已提出,并给出上述基准上的可靠性结果。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月2日
  1. arXiv cs.AI精选
    智能体评测可靠性研究显示,更多任务并不总能修复智能体榜单排名。

    论文提出贝叶斯方差分解框架,发现智能体榜单中固定 model-scaffold 系统排名可靠,而底层模型排名可靠性明显更低。在 22 个 Holistic Agent Leaderboard 和 Harbor Index 基准上,固定 model-scaffold 系统可靠性为 0.935-0.994,底层模型可靠性为 0.148-0.841。当不确定性主要来自 scaffold 覆盖不足时,无限增加同类任务最多只能把模型排名可靠性提高 0.097;合并多样基准可在相同任务预算下把预测可靠性从 0.44 提到 0.75,并最多降低 83% 成本,推断上评估预算应优先投向 scaffold 与基准覆盖。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。