跳到正文
热点事件持续更新

NOMOS: 将策略编译为静态验证的工具调用门

1 篇报道1 个报道来源3 小时前更新

先了解这件事

报道摘要

NOMOS 提出一种四步编译器,将自然语言策略直接转换为确定性的工具调用门控,仅依赖工具模式级别的静态检查即可修复或拒绝 37%(航空)和 13%(零售)的候选规则,解决了传统方法中提取的规则因自身前提条件而阻塞工具的问题。在 tau^2-bench 基准测试中,该门控将状态改变调用中的参考编码子句违规率从 66.3% 降至 2.6%(航空)以及从 30.8% 降至 6.9%(零售),同时显著提升了航空任务的成功率。 与依赖 LLM 验证器或重型形式化工具的现有防御不同,NOMOS 的决策在微秒级内完成且无需调用大模型,其 26B 本地编译版本的效果不逊于手写或前沿编译规则。在银行场景下,该方法实现了零攻击成功率(ASR),使九种攻击家族坍缩为三条结构规则;在其他三个套件中 ASR 最高仅为 3.6%,且使用 Llama-3.3-70B 复现了相同效果。 事实层面,该研究展示了静态验证在减少误报和漏报方面的具体数据表现;推断层面,这种机制可能降低对实时推理算力的依赖,使安全策略部署更轻量化;猜测层面,若该编译器能适配更多动态工具集,或许能解决当前 Agent 框架中普遍存在的策略执行不一致问题,但需进一步观察其在复杂长程任务中的稳定性。

摘自 arXiv cs.CR

报道时间线

沿着报道,了解事件的不同侧面。

10月9日
  1. arXiv cs.CR精选
    NOMOS 通过四步编译器将自然语言策略转化为静态验证的工具调用门控

    NOMOS 提出一种四步编译器,将自然语言策略直接转换为确定性的工具调用门控,仅依赖工具模式级别的静态检查即可修复或拒绝 37%(航空)和 13%(零售)的候选规则,解决了传统方法中提取的规则因自身前提条件而阻塞工具的问题。在 tau^2-bench 基准测试中,该门控将状态改变调用中的参考编码子句违规率从 66.3% 降至 2.6%(航空)以及从 30.8% 降至 6.9%(零售),同时显著提升了航空任务的成功率。 与依赖 LLM 验证器或重型形式化工具的现有防御不同,NOMOS 的决策在微秒级内完成且无需调用大模型,其 26B 本地编译版本的效果不逊于手写或前沿编译规则。在银行场景下,该方法实现了零攻击成功率(ASR),使九种攻击家族坍缩为三条结构规则;在其他三个套件中 ASR 最高仅为 3.6%,且使用 Llama-3.3-70B 复现了相同效果。 事实层面,该研究展示了静态验证在减少误报和漏报方面的具体数据表现;推断层面,这种机制可能降低对实时推理算力的依赖,使安全策略部署更轻量化;猜测层面,若该编译器能适配更多动态工具集,或许能解决当前 Agent 框架中普遍存在的策略执行不一致问题,但需进一步观察其在复杂长程任务中的稳定性。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。