arXiv cs.CL· Pavan Maddula·· 5 小时前精选AI 评分78
论文评估开放权重大模型在非规范输入下的四态安全表现
Quad-State Safety Evaluation of Open-Weight Large Language Models on Non-Canonical Inputs
AI 导读
该研究针对现实部署中常见的表情符号、拼写变异和编码字符串等非规范输入,构建了包含2100个提示词的ASRD数据集,并对五个开放权重语言模型进行了评估。研究发现,Emoji和不可见Unicode变体导致的理解失败极少,但有害响应率仍维持在20.27%左右,主要由Mistral 7B驱动;而Leetspeak、编码包装和混合变换则导致理解失败率飙升至36.47%至65.60%,同时有害响应率显著下降。
原始输出分析揭示了三种典型行为模式:幻觉良性(hallucinated benignity)、结构崩溃(structural collapse)和语言漂移(language drift)。在Leetspeak等复杂变换下,模型倾向于无法正确解析指令从而拒绝回答或产生无意义内容,而非直接执行有害操作。这种机制表明,传统的基于纯文本的安全评估可能低估了特定编码攻击面的风险,同时也高估了模型在处理复杂表面形式时的理解能力。
事实层面确认了不同表面形式对模型安全边界的差异化影响,推断出当前开放模型在面对非标准字符编码时存在特定的脆弱性窗口。这提示开发者在构建Agent或RAG系统时,不能仅依赖标准文本过滤,需针对编码转换和字符级变异增加专门的预处理层或检测机制。猜测部分认为,随着对抗样本生成技术的演进,此类非规范输入可能成为绕过安全对齐的新兴攻击路径,值得在后续基准测试中持续追踪。
推荐理由
揭示非规范输入下模型幻觉与结构崩溃风险,校正对表面形式鲁棒性的评估结论。
来源:arXiv cs.CL · arxiv.org