跳到正文
原文
arXiv cs.CR· Yibo Zhang, Tianrong Guan, Liang Lin, Puze Wang, Jin Wang, Qingsong Wen·· 5 小时前精选AI 评分83

大语言模型可在对话中自生成触发词以绕过安全拒绝机制

The Model Plants the Trigger: Answer-Side Backdoor Attacks in Multi-Turn Large Language Models

AI 导读

该论文提出一种针对多轮对话的大语言模型后门攻击方法,核心在于将触发器植入模型生成的回答而非用户输入。攻击者通过良性首轮提示诱导模型生成特定无害词汇,该词汇随后成为后续有害查询的触发条件,使模型在检测到自身生成的触发词时绕过安全拒绝,而用户输入始终保持干净。

实验显示,该方法在四个大语言模型上实现了接近100%的攻击成功率,仅需5%的数据投毒率即可生效,同时保持了模型的通用能力和对干净输入的防御效果。表征级分析表明,这种自生成触发词能持续抑制模型的拒绝信号,暴露了当前主流防御机制仅关注输入端清洗的盲区。

事实层面,该攻击利用了多轮对话的历史上下文依赖特性;推断层面,这意味着单纯依靠输入过滤无法完全阻断此类攻击,防御体系需向上下文感知或输出侧监控扩展;猜测层面,若该机制被广泛利用,可能迫使行业重新评估“输入即唯一风险源”的安全架构设计。

推荐理由

揭示模型可自生成触发词绕过输入过滤,直接挑战当前基于输入清洗的防御假设。

来源:arXiv cs.CR · arxiv.org