CUA-Speedrun 评测显示更快环境反而降低 Agent 效率且开源模型性价比提升
How fast can a computer-use agent finish the job?
CUA-Speedrun 是一个新增速维度的计算机使用智能体评估系统,在 Modal 提供的统一硬件与虚拟环境下,对 OSWorld、OSWorld 2.0、CUA-World 和 MyPCBench 四个基准进行测试,不仅记录成功率,还精确统计任务耗时与模型调用成本。GPT-6 Astra medium 以平均 1:30.2 完成单任务领跑,Gemini 3.8 Flash low 紧随其后,而 Kimi K3 max 耗时达 7:23.7,但部分开源模型如 Kimi K3 在满分率上与 GPT-6 Astra 持平。
关键发现包括:开启 Fast I/O 模式将截图延迟从 2–3 秒降至 2–28 毫秒后,GPT-6 Astra 的低努力设置下任务时间反而从 89.5 秒增加至 99.0 秒,原因是应用更新未完成时截图已到达导致智能体重复操作;此外,通过筛选 50 个代表性任务(原集 295 个),模型排名相关系数高达 0.98,评估时间缩短 84.9%。对于 Gemini 3 Flash Preview,增加推理努力使分数从 33.6% 升至 57.6%,同时单次任务耗时减少 224 秒,表明额外思考减少了无效重试。
事实层面,该工具由 Aggarwal 等人开发并已在 arXiv 发布论文,支持自定义 Agent 接入与结果上传。推断层面,当前智能体瓶颈已从环境交互速度转向决策逻辑与状态理解,单纯加速输入输出未必带来性能提升。猜测层面,若未来环境响应进一步优化,可能需要重新设计智能体的感知 - 行动循环机制以避免冗余操作,这对工程实践中的资源分配策略具有直接参考价值。
材料揭示更快环境可能拖慢 Agent 效率,且开源模型在速度与成本上已逼近头部闭源模型。
来源:Hacker News · AI · cuaspeedrun.com