热点事件持续更新
GPT-5.5长周期Agent暴露11.5%治理隐患
1 篇报道1 个报道来源3 小时前更新
先了解这件事
AI 综述
2026年10月5日,arXiv发布论文指出GPT-5.5在长周期智能体中存在名为GHOST的新型失效模式。该机制显示,模型在良性交互中可能因遗忘早期约束而违规。实验数据显示,触发率为11.5%,理论证明若残余条件风险有界且不可求和,执行过程将几乎必然进入危险区域。针对此问题,作者提出STAR-Guard双层防御架构,结合历史语义安全约束恢复与执行前审计机制进行防御。
AI 根据报道生成 · 2 小时前更新
最新进展10月5日 12:00
研究提出STAR-Guard双层防御架构以应对GHOST失效模式。报道时间线
沿着报道,了解事件的不同侧面。
10月5日
- arXiv cs.AI精选GPT-5.5 长周期智能体在良性交互中因遗忘早期约束导致违规的机制与防御
该论文定义了一种名为跨回合被忽视安全约束治理风险(GHOST)的新型失效模式,指出长周期智能体在良性交互条件下可能执行违反多回合前已设定安全约束的动作。实验数据显示,在 GPT-5.5 设置下,这种非孤立事件的触发率为 11.5%,且理论证明若安全前缀上的残余条件违规风险有界且不可求和,执行过程将几乎必然进入危险区域。 针对该问题,作者提出了 STAR-Guard 双层防御架构,结合历史语义安全约束恢复与执行前审计机制。第一层负责恢复适用的安全约束以减少不安全提议,第二层作为确定性审计层防止残余违规到达环境。在 GPT-5.5 的实验环境中,采用该方案后未观察到任何 GHOST 事件发生。 事实层面确认了长上下文窗口下安全约束遗忘是系统性风险而非偶发错误;推断层面表明现有基于短期上下文的对齐方法在长周期任务中存在结构性缺陷;猜测层面认为此类风险在涉及复杂规划的多 Agent 协作或自主系统部署中将更为显著,需重新评估长程任务的安全审计流程。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。