Qwen3.6-27B与Qwen3-4B时间预算Agent能力研究
先了解这件事
2026年10月9日,arXiv发布研究评估Qwen3.6-27B和Qwen3-4B在MLE-Bench Lite及Zork I基准下的显式墙钟时间预算执行能力。研究发现仅靠提示词无法将预算转化为受控的时间使用。通过环境注入计时信息和强制截止钩子可显著提升Qwen3.6-27B的守时率且不损失性能,但智能体即便严格遵守预算也无法利用额外时间提升任务表现。实验显示基于GRPO的强化学习使智能体在Zork I上实现近乎完美的预算控制。
AI 根据报道生成 · 2 小时前更新
报道时间线
沿着报道,了解事件的不同侧面。
- arXiv cs.AIQwen3.6-27B 与 Qwen3-4B 在时间预算任务中暴露守时易、用时难的机制缺口
该研究评估 Qwen3.6-27B 和 Qwen3-4B 在 MLE-Bench Lite 和 Zork I 基准下执行显式墙钟时间预算的能力,发现仅靠提示词无法让智能体将预算转化为受控的时间使用。虽然通过环境注入计时信息和强制截止钩子能显著提升 Qwen3.6-27B 的守时率且不损失性能,但即便智能体能严格遵守预算,仍无法利用额外时间提升任务表现。 实验显示,基于 GRPO 的强化学习使智能体在 Zork I 上实现近乎完美的预算遵守并泛化到未见过的预算值,但在 MLE-Bench 上未带来任务性能提升。RL 策略虽学会了何时停止,却倾向于用重复动作填充剩余时间;在多预算训练下,策略往往坍缩为最短预算对应的策略。这表明当前模型缺乏从可用时间到合适策略的学习映射,且无法准确预判动作耗时。 事实层面,研究确认了时间意识缺失是主要瓶颈,且现有干预手段仅解决守时问题。推断表明,构建真正高效的时间预算型 Agent 需突破“守时”与“有效分配”之间的断层,单纯增加训练时长或调整奖励函数不足以解决生产力问题。猜测认为,未来若要在复杂任务中实现时间敏感的智能体,可能需要引入外部计时反馈回路或改变模型对时间维度的表征方式,而非仅依赖提示工程或标准 RL 优化。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。