跳到正文
热点事件持续更新

提出意图隐藏组合攻击的信息论框架

1 篇报道1 个报道来源5 小时前更新

先了解这件事

AI 综述

2026年10月5日,一篇题为Intent-Hiding Jailbreaks的论文在arXiv发布。该研究从信息论视角构建了意图隐藏的组合式越狱形式化框架,核心在于通过选择辅助任务使有害意图的先验概率与后验概率相匹配,从而在不改变估计意图的情况下将有害目标嵌入看似良性的查询中。研究区分了两种优化设置:在查询独立设置下,作者证明了在捆绑包大小约束下实现精确的先验后验匹配是计算困难的,并推导了分数权重的最优水填充解;在查询依赖设置下,研究探讨了更复杂的动态调整机制。目前该框架仍处于理论分析阶段,尚未涉及具体模型的实际测试数据。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月5日
  1. arXiv cs.CR
    Intent-Hiding Jailbreaks 论文提出信息论框架分析组合式攻击与模型安全阈值的权衡

    该论文从信息论视角构建了意图隐藏的组合式越狱(compositional intent-hiding jailbreaks)形式化框架,核心在于通过选择辅助任务使有害意图的先验概率与后验概率相匹配,从而在不改变估计意图的情况下将有害目标嵌入看似良性的查询中。 研究区分了两种优化设置:查询独立设置下,任务选择独立于最终查询的表达方式,作者证明了在捆绑包大小约束下实现精确的先验后验匹配是计算困难的,并推导了分数权重的最优水填充解;查询依赖设置下,任务选择与查询构建被联合考虑,评估了生成的查询对意图隐蔽和目标保留的效果。实验在多个开源模型上验证了不同捆绑包大小、查询生成器和搜索预算下的越狱有效性。 事实层面显示,组合式查询在评估的搜索预算下能激发超出直接请求基线的目标行为,但存在明确权衡:随着捆绑包规模增大,多个模型的目标行为保持率呈下降趋势。推断层面表明,这种概率匹配机制可能成为绕过基于统计异常检测的安全防御的新路径,而猜测层面则涉及未来攻击者是否会利用水填充算法自动化构建高隐蔽性攻击载荷。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。