arXiv cs.CR· Pengfei He, Deep Mitra, Vishesh Sharma, Jiliang Tang, Vinay S Rao, Tomas Pfister, Long T. Le·· 6 小时前AI 评分67
ASPIRE 论文提出基于行为图的开放域智能体提示注入红队引擎
ASPIRE: Agentic Safety & Prompt Injection Red-teaming Engine
AI 摘要
该论文提出 ASPIRE(Agentic Safety & Prompt Injection Red-teaming Engine),旨在解决现有自动化红队测试仅针对预设场景优化载荷、无法探索智能体行为空间中潜在漏洞的问题。ASPIRE 通过维护动态演进的 Agent Security Behavior Graph,利用互补的探索与利用专家来发现、验证并泛化以后果为中心的测试用例,从而实现对未授权操作和持久状态变更等间接提示注入风险的深度挖掘。
核心机制在于轨迹证据更新图谱并诊断部分或失败尝试,同时通过跨运行记忆转移有效的红队策略。实验在多个基准上进行,结果显示 ASPIRE 在保持高攻击成功率的同时,显著扩展了后果、注入方法、环境和行为路径的覆盖范围。材料中未披露具体的参数量、算力消耗或与其他工具的直接性能对比数据,仅定性描述了覆盖面的扩大。
事实层面,ASPIRE 是一个用于开放域行为级漏洞发现的框架,依赖行为图和记忆机制。推断层面,该架构可能提升对复杂智能体系统的安全评估效率,减少人工红队的试错成本。猜测层面,其实际部署效果取决于具体智能体的工具调用复杂度及环境模拟的真实性,目前尚无大规模工业界应用数据支持。
来源:arXiv cs.CR · arxiv.org