arXiv cs.CR· Luman Zhao, Minghui Xu, Yue Zhang, Yijun Yang·· 5 小时前AI 评分73
LTBD:一种无需微调即可抵御提示注入的可信边界分隔符方法
LTBD: Learnable Trust-Boundary Delimiters for Prompt Injection Defense
AI 摘要
该论文针对大语言模型易受提示注入攻击的问题,提出了一种名为可学习信任边界分隔符(LTBD)的轻量级防御方案。该方法通过在输入中显式编码信任来源,利用少量可学习的分隔符区分可信用户指令与不可信外部数据,从而在不改变 LLM 参数的情况下强化模型的信任层级遵循能力。
实验数据显示,LTBD 在 AlpacaFarm 数据集上实现了 0.00% 的攻击成功率(ASR),在 TaskTracker 数据集上的 ASR 仅为 0.11-0.19%,表现优于现有的推理时防御手段,并与基于训练的方法具有竞争力。此外,该方案在对抗性攻击场景下依然有效,即当攻击者完全知晓防御机制并试图绕过时,LTBD 仍能保持防护效果,且引入的推理开销可忽略不计。
事实层面,该研究通过 arXiv cs.CR 发布,核心创新在于引入显式的信任源头表示而非依赖微调或硬编码提示。推断层面,这种无需参数更新即可生效的机制可能降低企业部署安全防御的成本与复杂度。猜测层面,其长期有效性是否依赖于特定类型的攻击向量尚需更多独立复现验证,但当前结果已显示出在保持良性任务效用方面的显著优势。
来源:arXiv cs.CR · arxiv.org