arXiv cs.AI· Corinn Tiffany, Wen Zhang, Eugene Bagdasarian, Lillian Tsai·· 11 小时前精选AI 评分78
Sapien 提出状态化策略引擎以约束自主 AI Agent 的工具调用序列
Sapien: A Stateful Policy Engine for Autonomous AI Agents
AI 导读
Sapien 是一个用于自主 AI Agent 的状态化策略引擎,通过把任务特定策略编码为带状态谓词、延迟策略生成和作用域语义检查的扩展正则表达式,来约束 Agent 的多步工具调用序列。
论文给出的结果显示,Sapien 在保持与无约束 Agent 相差不超过几个百分点的效用的同时,即使 Agent 被完全劫持,也能在 AgentDojo 上排除 93-95% 的攻击,在 Toolathlon 上排除 62-85% 的攻击;在长程任务中,这一拦截比例是工具白名单的两倍。
事实是论文提出了策略表示与评测结果。可以推断,这说明多步 Agent 安全不能只依赖静态允许列表,而需要结合已发生动作和已获知上下文做状态化裁决;对 Agent 产品而言,这类引擎可能成为工具调用层的安全中间件。尚不确定的是其在真实生产环境中的策略编写成本与延迟开销,原文摘要未提供这些细节。
推荐理由
它把 Agent 安全从静态工具白名单推进到状态化策略引擎,可改变对长程任务防御方案的选型判断。
来源:arXiv cs.AI · arxiv.org