跳到正文
热点事件持续更新

两阶段AI Agent审计框架降低LLM成本71%并维持高检出率

1 篇报道1 个报道来源4 小时前更新

先了解这件事

AI 综述

2026年10月7日,研究团队在arXiv发布论文,提出一种针对大语言模型驱动智能体的两阶段行为审计框架。该框架旨在解决现有规则型护栏易被绕过或全量LLM审计成本过高的问题。第一阶段利用单事件和轨迹序列规则筛选待检查动作,第二阶段由LLM审计智能体结合前置上下文对筛选出的动作进行审查。测试显示,该方案将OpenAgentSafety基准上的平均LLM审计次数从8.15次降至2.33次,Token消耗从47.8k降至14.6k,检测率为72.8%。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv cs.CR
    基于智能体轨迹的两阶段审计框架将LLM审计成本降低71%并维持高检出率

    该论文提出一种针对大语言模型驱动的智能体的两阶段行为审计框架,旨在解决现有规则型护栏易被绕过或全量LLM审计成本过高的问题。框架第一阶段利用单事件和轨迹序列规则筛选待检查动作,第二阶段由LLM审计智能体结合前置轨迹上下文对筛选出的动作进行审查。作者在OpenAgentSafety公开基准上测试显示,该方案将每次运行的平均LLM审计次数从8.15次降至2.33次,Token消耗从47.8k降至14.6k,检测率为72.8%,而全量审计的检测率为81.5%。 在两个模拟多智能体案例研究中,该框架成功标记了所有恶意轨迹,同时将审计Token使用量减少了80%以上。其核心机制在于联合优化门控规则与审计指令,使系统能自适应复杂智能体行为而非仅依赖预设规则。文中明确区分了事实数据(如具体的Token节省比例和检测率数值)与推断结论(即该方法适用于大规模部署),未提及任何关于具体公司应用或商业化落地的信息。 这一结果意味着在构建高并发、低延迟的Agent系统时,可以显著降低安全审计的计算开销。事实层面确认了效率提升幅度,推断层面表明该架构可作为通用组件集成到LangChain或AutoGen等框架中,但猜测层面需警惕其在对抗性攻击下的泛化能力是否如基准测试所示稳定,原文未提供长期运行或动态环境下的表现数据。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。