CUA-Speedrun 发布计算机使用 Agent 速度评测系统
先了解这件事
2026年10月3日,CUA-Speedrun 在 Hacker News 上发布。该系统由 Modal 提供统一硬件与虚拟环境,针对 OSWorld、OSWorld 2.0、CUA-World 和 MyPCBench 四个基准进行测试,记录成功率、任务耗时及模型调用成本。评测显示更快环境反而降低 Agent 效率且开源模型性价比提升。GPT-6 Astra medium 以平均 1:30.2 完成单任务领跑,Gemini 3.8 Flash low 紧随其后,Kimi K3 max 耗时达 7:2。
AI 根据报道生成 · 3 小时前更新
报道时间线
沿着报道,了解事件的不同侧面。
- Hacker News · AI精选CUA-Speedrun 评测显示更快环境反而降低 Agent 效率且开源模型性价比提升
CUA-Speedrun 是一个新增速维度的计算机使用智能体评估系统,在 Modal 提供的统一硬件与虚拟环境下,对 OSWorld、OSWorld 2.0、CUA-World 和 MyPCBench 四个基准进行测试,不仅记录成功率,还精确统计任务耗时与模型调用成本。GPT-6 Astra medium 以平均 1:30.2 完成单任务领跑,Gemini 3.8 Flash low 紧随其后,而 Kimi K3 max 耗时达 7:23.7,但部分开源模型如 Kimi K3 在满分率上与 GPT-6 Astra 持平。 关键发现包括:开启 Fast I/O 模式将截图延迟从 2–3 秒降至 2–28 毫秒后,GPT-6 Astra 的低努力设置下任务时间反而从 89.5 秒增加至 99.0 秒,原因是应用更新未完成时截图已到达导致智能体重复操作;此外,通过筛选 50 个代表性任务(原集 295 个),模型排名相关系数高达 0.98,评估时间缩短 84.9%。对于 Gemini 3 Flash Preview,增加推理努力使分数从 33.6% 升至 57.6%,同时单次任务耗时减少 224 秒,表明额外思考减少了无效重试。 事实层面,该工具由 Aggarwal 等人开发并已在 arXiv 发布论文,支持自定义 Agent 接入与结果上传。推断层面,当前智能体瓶颈已从环境交互速度转向决策逻辑与状态理解,单纯加速输入输出未必带来性能提升。猜测层面,若未来环境响应进一步优化,可能需要重新设计智能体的感知 - 行动循环机制以避免冗余操作,这对工程实践中的资源分配策略具有直接参考价值。
本事件热度走势
当前热度 9·可比范围峰值 9(10月3日 13:00)·近 24 小时可比范围变化 –
趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。