ASPIRE 论文提出基于行为图的智能体红队引擎
先了解这件事
2026年10月8日,arXiv cs.CR 发布论文介绍 ASPIRE(Agentic Safety & Prompt Injection Red-teaming Engine)。该研究旨在解决现有自动化红队测试仅针对预设场景优化载荷、无法探索智能体行为空间潜在漏洞的问题。ASPIRE 通过维护动态演进的 Agent Security Behavior Graph,利用互补的探索与利用专家来发现、验证并泛化以后果为中心的测试用例,从而实现对未授权操作和持久状态变更等间接提示注入风险的深入检测。
AI 根据报道生成 · 3 小时前更新
报道时间线
沿着报道,了解事件的不同侧面。
- arXiv cs.CRASPIRE 论文提出基于行为图的开放域智能体提示注入红队引擎
该论文提出 ASPIRE(Agentic Safety & Prompt Injection Red-teaming Engine),旨在解决现有自动化红队测试仅针对预设场景优化载荷、无法探索智能体行为空间中潜在漏洞的问题。ASPIRE 通过维护动态演进的 Agent Security Behavior Graph,利用互补的探索与利用专家来发现、验证并泛化以后果为中心的测试用例,从而实现对未授权操作和持久状态变更等间接提示注入风险的深度挖掘。 核心机制在于轨迹证据更新图谱并诊断部分或失败尝试,同时通过跨运行记忆转移有效的红队策略。实验在多个基准上进行,结果显示 ASPIRE 在保持高攻击成功率的同时,显著扩展了后果、注入方法、环境和行为路径的覆盖范围。材料中未披露具体的参数量、算力消耗或与其他工具的直接性能对比数据,仅定性描述了覆盖面的扩大。 事实层面,ASPIRE 是一个用于开放域行为级漏洞发现的框架,依赖行为图和记忆机制。推断层面,该架构可能提升对复杂智能体系统的安全评估效率,减少人工红队的试错成本。猜测层面,其实际部署效果取决于具体智能体的工具调用复杂度及环境模拟的真实性,目前尚无大规模工业界应用数据支持。
本事件热度走势
当前热度 9·可比范围峰值 9(10月8日 14:00)·近 24 小时可比范围变化 –
趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。