跳到正文
原文
arXiv cs.CR· Rongzhe Wei, Peizhi Niu, Xinjie Shen, Tony Tu, Yifan Li, Ruihan Wu, Eli Chien, Pin-Yu Chen, Olgica Milenkovic, Pan Li·· 3 小时前精选AI 评分88

CKA-Agent 利用无害提示编织与自适应树搜索绕过商业 LLM 护栏

The Trojan Knowledge: Bypassing Commercial LLM Guardrails via Harmless Prompt Weaving and Adaptive Tree Search

AI 导读

该论文提出一种名为 CKA-Agent 的攻击框架,通过无害子查询编织和自适应树搜索成功绕过 Gemini2.5-Flash、GPT-oss-120B 和 Claude-Haiku-4.5 等主流商业大模型的护栏,成功率超过 95%。与传统依赖恶意语义信号的提示优化方法不同,该攻击利用模型内部知识的互联性,将有害目标分解为多个单独看似无害的子查询,通过动态探索组装信息达成攻击目的。

实验证据显示,CKA-Agent 在强护栏环境下依然保持高成功率,其核心机制在于将 jailbreaking 重构为对目标模型知识库的自适应树状探索。攻击者发出局部无害查询,利用模型响应引导多路径探索,最终聚合信息实现原始有害目标。这种知识分解攻击暴露了当前护栏主要依赖检测显式恶意信号而非理解深层知识关联的缺陷。

事实层面,该研究已在 arXiv 发布并获 ICML 2026 录用,代码已开源。推断层面,这意味着仅靠提示词层面的语义过滤可能不足以防御此类攻击,防御方需重新评估基于知识图谱或意图追踪的防御策略。猜测层面,未来可能出现针对知识编织模式的专门检测算法,但具体实施细节尚未在文中披露。

推荐理由

揭示通过无害子查询编织绕过商业模型护栏的新机制,直接挑战现有基于语义检测的防御逻辑。

来源:arXiv cs.CR · arxiv.org