arXiv cs.CR· Diego Fernandez Arias, Dev Prashant Mistry, Ren Wang, Yibo Hu·· 4 小时前AI 评分72
多智能体 LLM 系统中分布式后门的早期检测研究揭示其依赖表面特征
Early Detection of Distributed Backdoors in Multi-Agent LLM Systems: A Characterization Study
AI 摘要
该论文针对多智能体 LLM 系统提出了一种新型攻击场景:攻击载荷被加密分割并分散在多个工具的片段中,仅在运行结束后由外部步骤重组执行,导致传统的单步安全检查失效。研究构建了一个分层多智能体系统实例,在五种语言模型和两种工具环境下测试了这种攻击的早期检测能力。结果显示,几乎没有任何运行能在第一个片段注入前被标记;一旦注入开始,基于前缀的检测器能以约 1% 的误报率在平均剩余十二个步骤时拦截 99.5% 的成功攻击,这意味着在载荷组装前即可触发中止。
然而,有效的检测机制高度依赖于可被轻易移除的表面特征,主要是密文的长度和熵值。当这些明显线索被剥离后,仅凭当前观测值的检测器效果显著下降,且跨工具环境的泛化能力大幅减弱。虽然使用历史步骤信息能在一定程度上缓解这一问题,但通用的零样本和行为训练检测器无法区分不安全与安全的运行。值得注意的是,在原始文本上微调的模型能够恢复部分性能损失,这表明单纯依赖统计特征而非深层语义理解是当前的主要瓶颈。
事实层面,该研究证实了分布式后门在现有防护下的隐蔽性及其被检测的特定条件。推断层面,现有的“独立动作”安全评估范式在面对跨代理、跨时间的协同攻击时存在结构性漏洞。猜测层面,如果攻击者进一步采用动态编码或混淆技术消除长度和熵的特征,现有的检测方案可能完全失效,这要求未来的对齐工作必须从静态特征匹配转向对多步交互逻辑的深度推理。
来源:arXiv cs.CR · arxiv.org