arXiv cs.CR· Muhammad Zeeshan Karamat, Christiana Chamon Garcia·· 6 小时前AI 评分65
论文揭示LLaMA-2-7B中仅0.19%的特定参数修改即可导致53%的提示注入成功率
How Fragile Is On-Device Language Model Safety? Localizing Safety-Critical Parameters for Sparse Fault Analysis
AI 摘要
该研究针对资源受限和端侧部署的小型语言模型(SLMs),通过低秩子空间分析和参数级重要性过滤两种方法,定位了LLaMA-2-7B-Chat模型中高度非均匀的安全敏感性分布。研究发现MLP层的down_proj组件是主要的安全敏感部分,而o_proj贡献较小,表明安全关键行为集中在稀疏的参数子集中。
实证数据显示,仅修改down_proj中0.19%的模型权重,即可使Basic ASR达到53%,GCG ASR达到56%,而tinyBenchmarks的准确率仅从52.2%轻微下降至51.6%。这一结果证实了极少量的参数扰动足以显著削弱模型的安全性,同时保持大部分功能正常,揭示了端侧模型在本地存储参数完整性方面存在的巨大潜在风险。
基于上述事实,推断未来端侧及智能体系统的防护策略应从全量校验转向针对特定安全敏感参数的选择性完整性保护。这并非猜测,而是基于实验观察到的稀疏性特征得出的工程推论:在算力有限的设备上,优先监控或加密这些高敏参数比全模型哈希校验更具性价比。材料未提及具体的防御实现方案,仅提出了针对性故障分析的需求方向。
来源:arXiv cs.CR · arxiv.org