跳到正文
原文
arXiv cs.CR· Fengwei Tian, Ravi Tandon·· 6 小时前AI 评分68

Intent-Hiding Jailbreaks 论文提出信息论框架分析组合式攻击与模型安全阈值的权衡

Intent-Hiding Jailbreaks: An Information-Theoretic Framework for Compositional Attacks

AI 摘要

该论文从信息论视角构建了意图隐藏的组合式越狱(compositional intent-hiding jailbreaks)形式化框架,核心在于通过选择辅助任务使有害意图的先验概率与后验概率相匹配,从而在不改变估计意图的情况下将有害目标嵌入看似良性的查询中。

研究区分了两种优化设置:查询独立设置下,任务选择独立于最终查询的表达方式,作者证明了在捆绑包大小约束下实现精确的先验后验匹配是计算困难的,并推导了分数权重的最优水填充解;查询依赖设置下,任务选择与查询构建被联合考虑,评估了生成的查询对意图隐蔽和目标保留的效果。实验在多个开源模型上验证了不同捆绑包大小、查询生成器和搜索预算下的越狱有效性。

事实层面显示,组合式查询在评估的搜索预算下能激发超出直接请求基线的目标行为,但存在明确权衡:随着捆绑包规模增大,多个模型的目标行为保持率呈下降趋势。推断层面表明,这种概率匹配机制可能成为绕过基于统计异常检测的安全防御的新路径,而猜测层面则涉及未来攻击者是否会利用水填充算法自动化构建高隐蔽性攻击载荷。

来源:arXiv cs.CR · arxiv.org