跳到正文
原文
arXiv cs.CR· Min-Young Yu, Tony Kim, Jang Won Choi·· 3 小时前精选AI 评分80

NOMOS 通过四步编译器将自然语言策略转化为静态验证的工具调用门控

NOMOS: Compiling Written Policies into Statically Verified Tool-Call Gates for LLM Agents

AI 导读

NOMOS 提出一种四步编译器,将自然语言策略直接转换为确定性的工具调用门控,仅依赖工具模式级别的静态检查即可修复或拒绝 37%(航空)和 13%(零售)的候选规则,解决了传统方法中提取的规则因自身前提条件而阻塞工具的问题。在 tau^2-bench 基准测试中,该门控将状态改变调用中的参考编码子句违规率从 66.3% 降至 2.6%(航空)以及从 30.8% 降至 6.9%(零售),同时显著提升了航空任务的成功率。

与依赖 LLM 验证器或重型形式化工具的现有防御不同,NOMOS 的决策在微秒级内完成且无需调用大模型,其 26B 本地编译版本的效果不逊于手写或前沿编译规则。在银行场景下,该方法实现了零攻击成功率(ASR),使九种攻击家族坍缩为三条结构规则;在其他三个套件中 ASR 最高仅为 3.6%,且使用 Llama-3.3-70B 复现了相同效果。

事实层面,该研究展示了静态验证在减少误报和漏报方面的具体数据表现;推断层面,这种机制可能降低对实时推理算力的依赖,使安全策略部署更轻量化;猜测层面,若该编译器能适配更多动态工具集,或许能解决当前 Agent 框架中普遍存在的策略执行不一致问题,但需进一步观察其在复杂长程任务中的稳定性。

推荐理由

材料证明静态编译策略可消除LLM代理的静默违规,为无需推理模型的工程化对齐提供新路径。

来源:arXiv cs.CR · arxiv.org