NOMOS: 将策略编译为静态验证的工具调用门
先了解这件事
NOMOS 提出一种四步编译器,将自然语言策略直接转换为确定性的工具调用门控,仅依赖工具模式级别的静态检查即可修复或拒绝 37%(航空)和 13%(零售)的候选规则,解决了传统方法中提取的规则因自身前提条件而阻塞工具的问题。在 tau^2-bench 基准测试中,该门控将状态改变调用中的参考编码子句违规率从 66.3% 降至 2.6%(航空)以及从 30.8% 降至 6.9%(零售),同时显著提升了航空任务的成功率。 与依赖 LLM 验证器或重型形式化工具的现有防御不同,NOMOS 的决策在微秒级内完成且无需调用大模型,其 26B 本地编译版本的效果不逊于手写或前沿编译规则。在银行场景下,该方法实现了零攻击成功率(ASR),使九种攻击家族坍缩为三条结构规则;在其他三个套件中 ASR 最高仅为 3.6%,且使用 Llama-3.3-70B 复现了相同效果。 事实层面,该研究展示了静态验证在减少误报和漏报方面的具体数据表现;推断层面,这种机制可能降低对实时推理算力的依赖,使安全策略部署更轻量化;猜测层面,若该编译器能适配更多动态工具集,或许能解决当前 Agent 框架中普遍存在的策略执行不一致问题,但需进一步观察其在复杂长程任务中的稳定性。
摘自 arXiv cs.CR
报道时间线
沿着报道,了解事件的不同侧面。
- arXiv cs.CR精选NOMOS 通过四步编译器将自然语言策略转化为静态验证的工具调用门控
NOMOS 提出一种四步编译器,将自然语言策略直接转换为确定性的工具调用门控,仅依赖工具模式级别的静态检查即可修复或拒绝 37%(航空)和 13%(零售)的候选规则,解决了传统方法中提取的规则因自身前提条件而阻塞工具的问题。在 tau^2-bench 基准测试中,该门控将状态改变调用中的参考编码子句违规率从 66.3% 降至 2.6%(航空)以及从 30.8% 降至 6.9%(零售),同时显著提升了航空任务的成功率。 与依赖 LLM 验证器或重型形式化工具的现有防御不同,NOMOS 的决策在微秒级内完成且无需调用大模型,其 26B 本地编译版本的效果不逊于手写或前沿编译规则。在银行场景下,该方法实现了零攻击成功率(ASR),使九种攻击家族坍缩为三条结构规则;在其他三个套件中 ASR 最高仅为 3.6%,且使用 Llama-3.3-70B 复现了相同效果。 事实层面,该研究展示了静态验证在减少误报和漏报方面的具体数据表现;推断层面,这种机制可能降低对实时推理算力的依赖,使安全策略部署更轻量化;猜测层面,若该编译器能适配更多动态工具集,或许能解决当前 Agent 框架中普遍存在的策略执行不一致问题,但需进一步观察其在复杂长程任务中的稳定性。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。