跳到正文
热点事件持续更新

AgentHorizon基准发布:GPT-5.5长周期任务评估准确率仅80.9%

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

2026年10月9日,研究团队在arXiv发布AgentHorizon基准测试论文。该基准包含来自三个操作系统的1,373个计算机使用任务及166小时人类轨迹,旨在评估智能体裁判在处理跨应用长周期任务时的可靠性。实验评估了十一个裁判模型,结果显示最佳模型GPT-5.5在AH子集上的平衡准确率仅为80.9%。研究发现,尽管部分任务轨迹看似完整,但往往违反指令约束或引入副作用,而现有裁判难以识别这些隐藏错误。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月9日
  1. arXiv cs.AI
    AgentHorizon 基准测试显示 GPT-5.5 在长周期计算机操作任务中的自动评估准确率仅为 80.9%

    该论文发布 AgentHorizon 基准,包含来自三个操作系统、166 小时人类记录轨迹的 1,373 个计算机使用任务,旨在评估智能体裁判(Agentic Judges)在处理跨越多个应用的长周期任务时的可靠性。研究发现,尽管轨迹看似完整,但往往违反指令约束或引入副作用,而现有裁判难以识别这些隐藏错误。 实验评估了十一个裁判模型,最佳模型 GPT-5.5 在 AH 子集上仅达到 80.9% 的平衡准确率。数据构建采用配对设计,通过交换相似但不兼容的指令生成负样本,强制裁判区分成功轨迹与失败轨迹。结果显示,工具调用虽提升了部分模型表现,却导致开源权重模型性能下降,且不同裁判在接纳有效轨迹和拒绝失败轨迹的能力上存在巨大差异。 事实层面,该基准提供了包含最多 300 张截图和操作序列的长轨迹数据,并分为前沿版、简化版和开发版三种拆分。推断层面,这表明当前自动评估机制在处理复杂多步骤任务时存在显著盲区,单纯依赖全量轨迹输入不足以支撑可靠的训练或评估闭环。猜测层面,若行业继续依赖此类裁判进行大规模 RLHF 或自动化评测,可能会因无法捕捉隐性违规而导致模型优化方向偏离真实用户意图。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。