arXiv cs.CR· Nikolaos Kekatos, Dimitrios Nikou, Anastasios Temperekidis, Alexios Lekidis, Nikolaos Kolokotronis, Panagiotis Katsaros, Stylianos Basagiannis·· 6 小时前AI 评分72
论文提出多层面运行时验证框架使LLM智能体在模拟任务中攻击成功率归零
Multi-Aspect Runtime Verification for Simulation-Based V&V of LLM-Enabled Autonomous Agents
AI 摘要
这篇论文针对采购型LLM智能体无法重训练的场景,提出了一种将自然语言政策条款分解为空间、时间和语义三元组的运行时验证框架,通过四值代数融合各维度裁决并保留溯源信息。该框架在两个军事领域(伤员撤离和 contested sustainment)和一个民事领域进行了测试,结果显示采用预防性阻断策略的组合监控能将攻击成功率降至零,且未观察到任何误报,单次事件处理成本为微秒级。
核心证据在于实验对比:单独启用任一维度或任意两个维度的组合均无法阻止大部分攻击,只有三个维度同时运行才能完全阻断攻击链。此外,在闭环实验中,缺乏策略意识的规划器在未受保护的任务中大多会进入违规状态,而受到该框架保护的任务则无一违规;即便有四起被拒绝的事件,系统也能在五起中的五起恢复至合规结果。研究还指出空间义务不能由一阶时间规范完全涵盖,证明了多模态分解的必要性。
事实是框架在特定模拟环境中实现了零攻击成功率和微秒级开销;推断是该方法可能适用于高约束的国防或关键基础设施场景,因为模型本身不可控时可管控接口;猜测是这种基于图论和逻辑引擎的方案是否能在通用商业Agent中低成本部署仍需验证,原文未提及实际生产环境的性能数据。
来源:arXiv cs.CR · arxiv.org