arXiv cs.CR· Xinran Zheng, Xin Fan Guo, Zhiqiang Hao, Fan Yang, Xingzhi Qian, Jiawei Du, Jinfeng Xu, Zheng Xing, Shuo Yang, Xingjun Wang·· 4 小时前精选AI 评分82
APEX:基于执行边界主动保护的LLM智能体防御框架
APEX: Active Protection at Execution Boundaries for LLM Agents
AI 导读
该论文针对间接提示注入(IPI)在LLM智能体中的传播问题,提出名为APEX的主动防御框架。其核心观点是无论攻击载体如何变化,危害仅在智能体将内部状态转化为外部动作或输出的“执行边界”处显现。因此,防御应聚焦于该边界,依据预编译的授权合同来验证两个条件:拟议效果是否被授权,以及运行时信息是否获得任务背书。
APEX通过两种机制实现保护:证据门控预防仅在合同允许时放行效果,欺骗暴露机制则在效果提交前揭示未获认可的使用行为。该方法不依赖特定攻击策略或污点追踪,而是基于任务许可进行统一防护。实验显示,在13个基线对比中,APEX在六个基准测试中有五个达到0%的攻击成功率,第六个为0.56%,且在三种能力单元类型下的自适应攻击中均保持0%成功率,对不同防御骨干模型也表现出有效性。
事实层面,该研究定义了基于执行边界的防御范式并提供了代码实现;推断层面,这种基于合同而非模式的思路可能改变Agent安全架构的设计方向,减少对特征匹配的依赖;猜测层面,其在复杂多模态场景下的性能表现及部署成本仍需进一步观察。
推荐理由
提出以执行边界授权合同为核心的防御机制,将防护重心从攻击模式识别转向任务许可验证。
来源:arXiv cs.CR · arxiv.org