CKA-Agent利用无害提示编织绕过LLM防御
先了解这件事
2026年10月8日,arXiv发布论文介绍名为CKA-Agent的攻击框架。该研究提出通过无害子查询编织与自适应树搜索技术,成功绕过Gemini2.5-Flash、GPT-oss-120B及Claude-Haiku-4.5等主流商业大模型的护栏,成功率超过95%。与传统依赖恶意语义信号的方法不同,CKA-Agent利用模型内部知识互联性,将有害目标分解为多个看似无害的子查询,并通过动态探索组装信息达成攻击目的。实验证据显示,该框架在强护栏环境下依然有效。
AI 根据报道生成 · 2 小时前更新
报道时间线
沿着报道,了解事件的不同侧面。
- arXiv cs.CR精选CKA-Agent 利用无害提示编织与自适应树搜索绕过商业 LLM 护栏
该论文提出一种名为 CKA-Agent 的攻击框架,通过无害子查询编织和自适应树搜索成功绕过 Gemini2.5-Flash、GPT-oss-120B 和 Claude-Haiku-4.5 等主流商业大模型的护栏,成功率超过 95%。与传统依赖恶意语义信号的提示优化方法不同,该攻击利用模型内部知识的互联性,将有害目标分解为多个单独看似无害的子查询,通过动态探索组装信息达成攻击目的。 实验证据显示,CKA-Agent 在强护栏环境下依然保持高成功率,其核心机制在于将 jailbreaking 重构为对目标模型知识库的自适应树状探索。攻击者发出局部无害查询,利用模型响应引导多路径探索,最终聚合信息实现原始有害目标。这种知识分解攻击暴露了当前护栏主要依赖检测显式恶意信号而非理解深层知识关联的缺陷。 事实层面,该研究已在 arXiv 发布并获 ICML 2026 录用,代码已开源。推断层面,这意味着仅靠提示词层面的语义过滤可能不足以防御此类攻击,防御方需重新评估基于知识图谱或意图追踪的防御策略。猜测层面,未来可能出现针对知识编织模式的专门检测算法,但具体实施细节尚未在文中披露。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。