跳到正文
原文
arXiv cs.CR· Narek Maloyan·· 4 小时前精选AI 评分77

2026年博士论文提出评估LLM抗扰动指标并验证MCP隔离可显著降低攻击成功率

Evaluating and Improving the Robustness of Large Language Models to Input Sequence Variations

AI 导读

该论文针对生产环境中LLM面临的提示注入、后门及质量指标操纵问题,提出基于Jensen-Shannon散度的生成式鲁棒性指标R_stab(f),并证明局部攻击下决策保持概率与鲁棒性的边界关系。作者开发了自适应进化黑盒攻击ASA,在LLM-as-a-Judge系统中达到73.8%的攻击成功率,且跨开放模型迁移率高达62.6%,揭示了当前评估体系的脆弱性。

实证数据显示,在Trojan Detection Challenge 2023数据集中,代理触发器召回率仅为17%,远低于基线;而在SaTML CTF 2024中,通过系统化四类绕过手段可将多层防御的攻击成功率从90%降至15-25%。关键发现在于,由5至7个异构模型组成的委员会能将Gemma-3-4B的攻击成功率降低47-55个百分点至19.3%。针对基于Model Context Protocol (MCP) 的智能体系统,提出的AttestMCP机制通过HMAC保护包实现工具调用认证,单次耗时低于0.1毫秒,配合Commit Boundary隔离模式,在MCPBench 847个场景中将平均攻击成功率从53.7%大幅压降至12.4%。

事实层面,该方法已实现在JudgeGuard和TrojanArmor软件套件及MCPSec模块中。推断层面,这表明单纯依赖单一模型或常规防御难以应对高级对抗样本,引入异构模型投票与协议层隔离是提升Agent安全性的有效路径。猜测层面,若未来MCP成为智能体标准通信协议,AttestMCP可能成为基础设施层面的强制安全组件,但需进一步验证其在大规模并发下的性能开销与兼容性。

推荐理由

论文量化了多模型委员会与MCP隔离对攻击的抑制效果,为构建高鲁棒性Agent系统提供了具体工程参数。

来源:arXiv cs.CR · arxiv.org