跳到正文
热点事件持续更新

提出QES策略隔离LLM后门攻击

1 篇报道1 个报道来源12 小时前更新

先了解这件事

报道摘要

该论文提出了一种名为 QES(Quarantined Expert Shutdown)的新策略,旨在解决大语言模型中的后门攻击问题。其核心思路是允许后门在训练阶段形成,但通过路由机制将其引导至一个指定的、可隔离的专家组件中,从而在部署时能够直接禁用该组件以消除威胁。 实验数据显示,该方法在两个任务、三种攻击方式和四个模型家族上,将攻击成功率从 100% 降低至 0-10%,同时下游任务的效用通常得以保留或仅受轻微影响。技术实现上,QES 在基于 Transformer 的语言模型中增加了路由特定的 LoRA 分支和轻量级路由器,利用辅助路由目标将触发器驱动的行为吸引到指定专家,而保持其他部分的良性能力不受影响。 事实层面,该研究属于“学习但分流”的新范式,区别于传统的抑制学习或事后净化策略。推断层面,这种机制意味着模型在上线后可以通过简单的权重置零操作来应对已知类型的后门,无需重新训练或进行复杂的触发器筛查。猜测层面,该方法对未知触发器或动态变化的攻击模式是否有效仍需进一步验证,且引入额外的 LoRA 分支可能会增加推理时的显存占用。

摘自 arXiv cs.AI

报道时间线

沿着报道,了解事件的不同侧面。

10月2日
  1. arXiv cs.AI
    QES 论文提出通过隔离可关闭专家实现大语言模型后门防御

    该论文提出了一种名为 QES(Quarantined Expert Shutdown)的新策略,旨在解决大语言模型中的后门攻击问题。其核心思路是允许后门在训练阶段形成,但通过路由机制将其引导至一个指定的、可隔离的专家组件中,从而在部署时能够直接禁用该组件以消除威胁。 实验数据显示,该方法在两个任务、三种攻击方式和四个模型家族上,将攻击成功率从 100% 降低至 0-10%,同时下游任务的效用通常得以保留或仅受轻微影响。技术实现上,QES 在基于 Transformer 的语言模型中增加了路由特定的 LoRA 分支和轻量级路由器,利用辅助路由目标将触发器驱动的行为吸引到指定专家,而保持其他部分的良性能力不受影响。 事实层面,该研究属于“学习但分流”的新范式,区别于传统的抑制学习或事后净化策略。推断层面,这种机制意味着模型在上线后可以通过简单的权重置零操作来应对已知类型的后门,无需重新训练或进行复杂的触发器筛查。猜测层面,该方法对未知触发器或动态变化的攻击模式是否有效仍需进一步验证,且引入额外的 LoRA 分支可能会增加推理时的显存占用。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。