跳到正文
热点事件持续更新

LTBD:无需微调即可抵御提示注入的可信边界分隔符方法

1 篇报道1 个报道来源4 小时前更新

先了解这件事

AI 综述

2026年10月9日,arXiv发布论文提出可学习信任边界分隔符(LTBD)方案。该方法针对大语言模型易受提示注入攻击的问题,通过在输入中显式编码信任来源,利用少量可学习的分隔符区分可信用户指令与不可信外部数据。该方案无需改变LLM参数即可强化模型的信任层级遵循能力。实验数据显示,LTBD在AlpacaFarm数据集上实现了0.00%的攻击成功率,在TaskTracker数据集上的ASR仅为0.11-0.19。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月9日
  1. arXiv cs.CR
    LTBD:一种无需微调即可抵御提示注入的可信边界分隔符方法

    该论文针对大语言模型易受提示注入攻击的问题,提出了一种名为可学习信任边界分隔符(LTBD)的轻量级防御方案。该方法通过在输入中显式编码信任来源,利用少量可学习的分隔符区分可信用户指令与不可信外部数据,从而在不改变 LLM 参数的情况下强化模型的信任层级遵循能力。 实验数据显示,LTBD 在 AlpacaFarm 数据集上实现了 0.00% 的攻击成功率(ASR),在 TaskTracker 数据集上的 ASR 仅为 0.11-0.19%,表现优于现有的推理时防御手段,并与基于训练的方法具有竞争力。此外,该方案在对抗性攻击场景下依然有效,即当攻击者完全知晓防御机制并试图绕过时,LTBD 仍能保持防护效果,且引入的推理开销可忽略不计。 事实层面,该研究通过 arXiv cs.CR 发布,核心创新在于引入显式的信任源头表示而非依赖微调或硬编码提示。推断层面,这种无需参数更新即可生效的机制可能降低企业部署安全防御的成本与复杂度。猜测层面,其长期有效性是否依赖于特定类型的攻击向量尚需更多独立复现验证,但当前结果已显示出在保持良性任务效用方面的显著优势。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。