arXiv cs.CR· Eugene Zhang, Cheng-Yun King Yang, Dongyan Xu·· 5 小时前AI 评分62
基于智能体轨迹的两阶段审计框架将LLM审计成本降低71%并维持高检出率
Efficient Auditing of Adversarial AI Agent Behavior from Agent Traces
AI 摘要
该论文提出一种针对大语言模型驱动的智能体的两阶段行为审计框架,旨在解决现有规则型护栏易被绕过或全量LLM审计成本过高的问题。框架第一阶段利用单事件和轨迹序列规则筛选待检查动作,第二阶段由LLM审计智能体结合前置轨迹上下文对筛选出的动作进行审查。作者在OpenAgentSafety公开基准上测试显示,该方案将每次运行的平均LLM审计次数从8.15次降至2.33次,Token消耗从47.8k降至14.6k,检测率为72.8%,而全量审计的检测率为81.5%。
在两个模拟多智能体案例研究中,该框架成功标记了所有恶意轨迹,同时将审计Token使用量减少了80%以上。其核心机制在于联合优化门控规则与审计指令,使系统能自适应复杂智能体行为而非仅依赖预设规则。文中明确区分了事实数据(如具体的Token节省比例和检测率数值)与推断结论(即该方法适用于大规模部署),未提及任何关于具体公司应用或商业化落地的信息。
这一结果意味着在构建高并发、低延迟的Agent系统时,可以显著降低安全审计的计算开销。事实层面确认了效率提升幅度,推断层面表明该架构可作为通用组件集成到LangChain或AutoGen等框架中,但猜测层面需警惕其在对抗性攻击下的泛化能力是否如基准测试所示稳定,原文未提供长期运行或动态环境下的表现数据。
来源:arXiv cs.CR · arxiv.org