跳到正文
原文
arXiv cs.CR· Bijeeta Pal, Sridhar Reddy Maddireddy, Muhaimin Bin Munir, Zoltan Puha, Max Zhurovich, Adi Raghavendra, Sean Tout·· 4 小时前AI 评分75

Persona Guardrail 提出基于语义白名单的生产级 Agent 运行时防御框架及 PAGE 评测基准

Persona Guardrail: A Production-Grade Defense Framework for Agentic Systems

AI 摘要

该论文提出 Persona Guardrail,一种针对面向客户的 AI 智能体系统的生产级运行时防御框架,通过同步输入输出验证和语义允许/禁止列表规范,强制实施明确的功能边界。相比通用 LLM 基线,该框架在整体准确率上从 85.7% 提升至 95.9%,域外检测率从 57.3% 跃升至 93.5%,误报批准率从 25.0% 降至 4.7%。

研究团队同时发布了 PAGE(Persona-Aware Guardrail Evaluation)基准,用于在良性、对抗性和域外交互场景下评估特定功能的防护能力。实测数据显示,当前部署版本在满足延迟预算的同时,在真实生产负载下保持了极低的误拦截和误放行率。这一结果证实了该框架在可扩展性和实用性上的表现,解决了现有黑盒威胁模型下运行时护栏无法区分恶意请求与域外查询的痛点。

事实层面,该框架已投入生产使用并通过了上述指标测试;推断层面,这种基于语义规范的显式边界控制可能成为未来企业级 Agent 安全架构的标准组件;猜测层面,其具体性能表现是否能在不同领域的复杂任务中复现仍需更多独立验证。

来源:arXiv cs.CR · arxiv.org