跳到正文
原文
arXiv cs.CR· Daniel Gilkarov, Ran Dubin·· 4 小时前AI 评分75

NeuPerm 论文提出利用置换对称性破坏隐藏在神经网络参数中的恶意软件

NeuPerm: Disrupting Malware Hidden in Neural Network Parameters by Leveraging Permutation Symmetry

AI 摘要

Daniel Gilkarov 和 Ran Dubin 在 arXiv 上发布 NeuPerm 方法,旨在通过利用神经网络置换对称性的理论特性,破坏隐藏在预训练模型参数中的自执行恶意软件。该研究针对模型共享场景下用户可能 unknowingly 直接执行或间接依赖恶意模型的威胁,提供了一种简单且有效的防御手段。

实证结果显示,NeuPerm 对模型性能几乎没有影响,并能成功干扰此前仅能通过高度复杂的量化过程解决的先进攻击。与以往类似工作不同,该方法被证明在大型语言模型(LLMs)上同样有效,填补了现有技术在 LLM 领域应用的空白。源代码已公开在指定 URL 处。

事实层面,NeuPerm 利用置换对称性作为防御机制,且在 LLM 上验证有效;推断层面,该方法可能成为模型分发前的标准清洗步骤,降低恶意代码注入风险;猜测层面,若大规模采用,可能改变当前模型共享生态的安全基线,但具体部署成本与兼容性需进一步观察。

来源:arXiv cs.CR · arxiv.org