跳到正文
原文
arXiv cs.AI· XinPeng Shen, Lan Zhang, Yixiao Huang, Haoran Cheng, Jiewei Lai, Leilei Chen, Haoxiang Deng·· 3 小时前精选AI 评分78

GPT-5.5 长周期智能体在良性交互中因遗忘早期约束导致违规的机制与防御

A GHOST in Long-Horizon Agents: Governance Hazard from Overlooked Safety Constraints across Turns

AI 导读

该论文定义了一种名为跨回合被忽视安全约束治理风险(GHOST)的新型失效模式,指出长周期智能体在良性交互条件下可能执行违反多回合前已设定安全约束的动作。实验数据显示,在 GPT-5.5 设置下,这种非孤立事件的触发率为 11.5%,且理论证明若安全前缀上的残余条件违规风险有界且不可求和,执行过程将几乎必然进入危险区域。

针对该问题,作者提出了 STAR-Guard 双层防御架构,结合历史语义安全约束恢复与执行前审计机制。第一层负责恢复适用的安全约束以减少不安全提议,第二层作为确定性审计层防止残余违规到达环境。在 GPT-5.5 的实验环境中,采用该方案后未观察到任何 GHOST 事件发生。

事实层面确认了长上下文窗口下安全约束遗忘是系统性风险而非偶发错误;推断层面表明现有基于短期上下文的对齐方法在长周期任务中存在结构性缺陷;猜测层面认为此类风险在涉及复杂规划的多 Agent 协作或自主系统部署中将更为显著,需重新评估长程任务的安全审计流程。

推荐理由

揭示长周期智能体在良性交互中因遗忘早期约束导致违规的机制,并提供可验证的防御方案。

来源:arXiv cs.AI · arxiv.org