跳到正文
原文
arXiv cs.CR· Niveen O. Jaffal, Ahmet Yuksel, David Mohaisen·· 5 小时前AI 评分65

RAG-PIBench 基准显示 DistilBERT 在提示词注入检测中表现最佳

RAG-PIBench: A Leakage-Aware Benchmark for Prompt-Injection Detection in Trustworthy RAG Systems

AI 摘要

该论文发布 RAG-PIBench 基准,包含 4,876 个上下文示例,用于评估检索增强生成系统中的提示词注入检测能力。研究通过泄露感知构建流程和严格评估协议,对比了基于关键词、语义参考、TF-IDF 和 Transformer 的检测器性能。结果显示,DistilBERT 在受保护测试集中取得 F1 分数 0.896 和 PR-AUC 0.968,而 TF-IDF SVM 和逻辑回归仍具竞争力。

关键细节在于数据集的构建方式采用了“泄露感知”(leakage-aware)流程,旨在防止训练数据污染测试集,从而更真实地反映模型泛化能力。此外,结果突显了稀疏基线模型(如 TF-IDF)在特定安全场景下的有效性,挑战了仅依赖大型 Transformer 模型的常规认知。

事实层面,DistilBERT 确实在该基准的受保护测试集上表现最优。推断层面,这表明在 RAG 系统的安全防御中,轻量级模型配合高质量的数据构建可能比单纯增加模型复杂度更有效。猜测层面,若其他安全团队沿用类似的数据构建方法,可能会发现更多传统机器学习方法在对抗样本检测中的潜力,但这需进一步验证。

来源:arXiv cs.CR · arxiv.org