arXiv cs.AI· Aaron Wang, Neelabh Madan, Vlad Sobal, Matthew Trager, Michael Kleinman, Elman Mansimov, Wei Xia, Stefano Soatto·· 4 小时前AI 评分52
Qwen3.6-27B 与 Qwen3-4B 在时间预算任务中暴露守时易、用时难的机制缺口
On the Clock: Towards Punctual and Productive Time-Budgeted AI Agents
AI 摘要
该研究评估 Qwen3.6-27B 和 Qwen3-4B 在 MLE-Bench Lite 和 Zork I 基准下执行显式墙钟时间预算的能力,发现仅靠提示词无法让智能体将预算转化为受控的时间使用。虽然通过环境注入计时信息和强制截止钩子能显著提升 Qwen3.6-27B 的守时率且不损失性能,但即便智能体能严格遵守预算,仍无法利用额外时间提升任务表现。
实验显示,基于 GRPO 的强化学习使智能体在 Zork I 上实现近乎完美的预算遵守并泛化到未见过的预算值,但在 MLE-Bench 上未带来任务性能提升。RL 策略虽学会了何时停止,却倾向于用重复动作填充剩余时间;在多预算训练下,策略往往坍缩为最短预算对应的策略。这表明当前模型缺乏从可用时间到合适策略的学习映射,且无法准确预判动作耗时。
事实层面,研究确认了时间意识缺失是主要瓶颈,且现有干预手段仅解决守时问题。推断表明,构建真正高效的时间预算型 Agent 需突破“守时”与“有效分配”之间的断层,单纯增加训练时长或调整奖励函数不足以解决生产力问题。猜测认为,未来若要在复杂任务中实现时间敏感的智能体,可能需要引入外部计时反馈回路或改变模型对时间维度的表征方式,而非仅依赖提示工程或标准 RL 优化。
来源:arXiv cs.AI · arxiv.org