Reddit · MachineLearning· /u/tuhin_k·· 2 小时前精选AI 评分82
ThinkingBox 论文指出 Agent 单次成功与全量重复成功率存在显著差异且排名反转
ThinkingBox: Solving an agent task once vs. solving it 20/20: 507 stateful workflows graded on terminal database state [R]
AI 导读
微软团队发布 ThinkingBox 基准,通过 507 个策略驱动的企业工作流任务在 20 次独立尝试中评估模型表现,发现单一成功指标会严重高估 Agent 可靠性。Kimi-K3 在 pass@20(至少一次成功)上以 93.89% 领先,但 all-20(20 次全成功)仅 13.41%,而 Claude Opus 5 的 all-20 达到 47.53%,导致按不同指标排名的结果几乎完全相反。
研究核心在于区分“发现能力”与“可重复性”,并强调必须检查后端数据库的最终状态而非仅看任务是否结束。在 121,680 次有效试验中,67.24% 的失败案例虽然终端干净退出且调用了状态变更工具,但实际存在字段值错误、意外副作用或缺失必要效果等状态偏差,若仅依赖完成式代理指标将误判为成功。
该基准数据已开源,允许用户自行运行测试以验证结果。事实层面确认了当前主流模型在复杂状态保持上的不稳定性;推断层面表明现有排行榜可能误导产品选型;猜测层面认为未来评估体系需强制包含状态一致性检查,但这取决于行业是否采纳新的评估协议。
推荐理由
揭示 pass@20 与 all-20 排名反转及状态检查必要性,直接校正对 Agent 可靠性的评估标准。
来源:Reddit · MachineLearning · reddit.com