跳到正文
热点事件持续更新

大模型自生成触发词绕过对话安全防御

1 篇报道1 个报道来源5 小时前更新

先了解这件事

AI 综述

2026年10月7日,arXiv发布论文指出一种针对多轮对话的后门攻击方法。该研究提出攻击者通过良性首轮提示诱导模型生成特定无害词汇,将其植入回答而非用户输入中。随后,当模型检测到自身生成的触发词时,会绕过安全拒绝机制响应后续有害查询。实验显示该方法在四个大语言模型上成功率接近100%,仅需5%的数据投毒率即可生效,且未损害模型通用能力与对干净输入的防御效果。表征级分析表明这种自生成触发词具有持续性。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv cs.CR精选
    大语言模型可在对话中自生成触发词以绕过安全拒绝机制

    该论文提出一种针对多轮对话的大语言模型后门攻击方法,核心在于将触发器植入模型生成的回答而非用户输入。攻击者通过良性首轮提示诱导模型生成特定无害词汇,该词汇随后成为后续有害查询的触发条件,使模型在检测到自身生成的触发词时绕过安全拒绝,而用户输入始终保持干净。 实验显示,该方法在四个大语言模型上实现了接近100%的攻击成功率,仅需5%的数据投毒率即可生效,同时保持了模型的通用能力和对干净输入的防御效果。表征级分析表明,这种自生成触发词能持续抑制模型的拒绝信号,暴露了当前主流防御机制仅关注输入端清洗的盲区。 事实层面,该攻击利用了多轮对话的历史上下文依赖特性;推断层面,这意味着单纯依靠输入过滤无法完全阻断此类攻击,防御体系需向上下文感知或输出侧监控扩展;猜测层面,若该机制被广泛利用,可能迫使行业重新评估“输入即唯一风险源”的安全架构设计。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。