arXiv cs.CR· Hao Sun, Yibin Yao, Chaohai Xie, Yuqun Lin·· 5 小时前AI 评分55
Case-Level Verification in Scanner-LLM Cascades: Overcoming the Alert Aggregation Bottleneck to Expand the FRR-TPR Trade-off Space
Case-Level Verification in Scanner-LLM Cascades: Overcoming the Alert Aggregation Bottleneck to Expand the FRR-TPR Trade-off Space
AI 摘要
该论文指出动态应用安全测试(DAST)扫描器与大语言模型(LLM)级联架构中存在的结构性瓶颈:警报聚合机制将多个真实与虚假案例绑定为同一决策单元,导致在降低误报率时不可避免地损失真实案例。作者提出将验证粒度从“警报级”下沉至“案例级”,通过独立重放每个检测到的 HTTP 请求并独立判定,从而打破原有的误报削减率(FRR)与真实案例检出率(TPR)之间的权衡限制。
在 Damn Vulnerable Web Application (DVWA) 和 WebGoat 双测试床上的评估显示,最佳警报级操作点的 FRR 为 42.86%(TPR 51.7%)。而案例级基线策略将 FRR 提升至 47.6%,改善幅度达 4.7 个百分点;若结合案例聚焦证据验证提示词(CEV-Prompt),在保持相同 FRR 的情况下,TPR 从 55.2% 进一步提升至 62.1%。这些数字直接量化了细粒度验证对安全检测效率的提升效果。
事实层面,该研究证明了警报聚合是性能瓶颈的核心来源,且案例级验证在特定基准上优于传统级联方式。推断层面,这意味着未来构建 AI 驱动的安全审计工具时,必须设计支持独立实例重放的执行引擎,而非仅依赖日志聚合分析。猜测层面,这种架构迁移可能增加单次调用的计算成本,但在高价值安全场景下,其带来的误报减少和检出率提升具有明确的商业价值。
来源:arXiv cs.CR · arxiv.org