跳到正文
热点事件持续更新

Daphne团队提出AIDA框架提升LLM在SOC告警研判中的可靠性

1 篇报道1 个报道来源4 小时前更新

先了解这件事

AI 综述

2026年10月9日,Daphne团队发布ALERT-BENCH基准测试,评估了五种基于大语言模型(LLM)的智能体在安全运营中心(SOC)告警分类任务中的表现。测试包含1,247个多阶段攻击场景的告警数据,结果显示所有被研究的单遍工具使用、迭代检索等方法,其攻击相关告警的漏报率均至少达到40.4%。追踪分析发现,当搜索返回无记录时攻击告警更可能被错误驳回,且同一上下文的审查存在负净修正效果。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月9日
  1. arXiv cs.CR
    Daphne团队提出AIDA框架解决LLM在SOC告警排查中的高漏报问题

    Daphne团队发布ALERT-BENCH基准测试,评估了五种基于大语言模型(LLM)的智能体在安全运营中心(SOC)告警分类任务中的表现。在包含1,247个来自多阶段攻击场景的告警数据集中,所有被研究的单遍工具使用、迭代检索、采样调查、自我审查和显式验证方法,其攻击相关告警的漏报率均至少达到40.4%。 追踪分析显示,当搜索返回无记录时攻击告警更可能被错误驳回,同一上下文的审查存在负净修正效果,且驳回决策并未获得比升级决策更强有力的证据支持。针对这些机制缺陷,作者设计了AIDA(对抗性调查与辩证分析)多智能体框架,该框架要求先提出明确决策再进行独立挑战,并在驳回前设定更高的证据门槛。AIDA通过仅追加的调查账本保留历史,并将挑战置于独立的推理上下文中,由独立的法官根据证据裁决决策或要求补充证据。 在相同告警集上,AIDA实现了0.958的F1分数,显著优于被研究方法的0.371至0.744区间;同时将假阴性率从40.4%大幅降低至3.1%,并将18.4%的告警升级给分析师。事实层面证明了结构化证据检索与决策审查能显著提升智能体SOC分类的可靠性,推断表明当前主流的单次或简单迭代推理策略不足以应对复杂攻击场景,猜测则指向未来SOC自动化需引入类似司法程序的对抗性验证机制而非单纯依赖模型生成能力。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。