arXiv cs.AI· Xing Han L\`u, Dheeraj Vattikonda, Sina Hajimiri, Fatemeh Pesaran Zadeh, Parishad BehnamGhader, Ghazwa Darwiche, Amirhossein Kazemnejad, Christopher Pal, Alexandre Drouin, Siva Reddy·· 4 小时前AI 评分62
AgentHorizon 基准测试显示 GPT-5.5 在长周期计算机操作任务中的自动评估准确率仅为 80.9%
AgentHorizon: Evaluating Agentic Judges for Long-Horizon Computer-Use Tasks
AI 摘要
该论文发布 AgentHorizon 基准,包含来自三个操作系统、166 小时人类记录轨迹的 1,373 个计算机使用任务,旨在评估智能体裁判(Agentic Judges)在处理跨越多个应用的长周期任务时的可靠性。研究发现,尽管轨迹看似完整,但往往违反指令约束或引入副作用,而现有裁判难以识别这些隐藏错误。
实验评估了十一个裁判模型,最佳模型 GPT-5.5 在 AH 子集上仅达到 80.9% 的平衡准确率。数据构建采用配对设计,通过交换相似但不兼容的指令生成负样本,强制裁判区分成功轨迹与失败轨迹。结果显示,工具调用虽提升了部分模型表现,却导致开源权重模型性能下降,且不同裁判在接纳有效轨迹和拒绝失败轨迹的能力上存在巨大差异。
事实层面,该基准提供了包含最多 300 张截图和操作序列的长轨迹数据,并分为前沿版、简化版和开发版三种拆分。推断层面,这表明当前自动评估机制在处理复杂多步骤任务时存在显著盲区,单纯依赖全量轨迹输入不足以支撑可靠的训练或评估闭环。猜测层面,若行业继续依赖此类裁判进行大规模 RLHF 或自动化评测,可能会因无法捕捉隐性违规而导致模型优化方向偏离真实用户意图。
来源:arXiv cs.AI · arxiv.org