它们被称为“蜂群追逐者”,在 AI 失控时迅速行动
一种被称为“蜂群追逐者”的机制会在 AI 系统失控时自动启动。该机制旨在应对 AI 行为异常或偏离预期的情况,目前尚未披露具体的模型版本、参数规模或部署细节。关于其技术实现原理及实际应用场景,原文未提供进一步信息。
一种被称为“蜂群追逐者”的机制会在 AI 系统失控时自动启动。该机制旨在应对 AI 行为异常或偏离预期的情况,目前尚未披露具体的模型版本、参数规模或部署细节。关于其技术实现原理及实际应用场景,原文未提供进一步信息。
AI 辅助攻击团伙批量外泄了 15 GB 西班牙中小企业 ERP 数据,其暴露目录还泄露 10,428 个文件,包含 6 个产品漏洞利用模块和 24 个攻击工具。报告称,攻击者没有依赖传统恶意软件,而是从暴露 git 仓库中取得 Azure service-principal secret,再用 OAuth client-credentials 调用 Microsoft Dynamics 365 Business Central REST API,批量导出客户、总账、发票和附件。 证据链集中在 shell history 和版本化脚本:目录名 spain-dental-osint、gitleaks-report.json、03-CRITICAL-azure-bc-creds.md 显示侦察到密钥提取的顺序;bc_full_dump.py 与 bc_export.sh 保留到 v2.0.2,并有运行日志,单个 generalLedgerEntries 导出达到 3.9 GB。工具包同时覆盖 SonicWall SMA1000、JetBrains TeamCity、BeyondTrust、KEMP LoadMaster、SmarterMail 和 SharePoint,以及 mimikatz、secretsdump、DCSync、BloodHound、impacket、responder、ntlmrelayx、certipy、Sliver、Havoc、Cobalt Strike 和 xmrig。 事实是,受害者为 10 家西班牙中小企业,偏牙科和医疗,最大单一受害者占 6.6 GB,数据包括客户数据库、总账、发票、IBAN、支付卡号和医疗记录。推断是,长期服务主体密钥加云 API 批量读取,使暴露仓库成为比终端恶意软件更隐蔽的入口,且重置单个密码不足以终止访问。猜测是,该团伙可能继续利用未修补的互联网暴露设备和 Azure 密钥,但材料未确认后续行动。
推荐理由:它把 AI 辅助攻击落到企业资源计划云接口批量外泄,能直接校正中小企业对暴露仓库、服务主体密钥和接口监控的优先级。
AI 教父 Yann LeCun 在采访中称 Anthropic CEO Dario Amodei 对人工智能风险的担忧是“糊涂”和“疯狂”的,并认为人类灭绝风险为零。LeCun 将近期 AI 自主攻击事件归咎于糟糕的系统设计与沙箱漏洞,而非模型本身失控。他批评许多 AI 实验室缺乏基本的网络安全理解,强调相关事故完全可预防。
研究证明在零测量噪声下,若安全相关输出关于 $2q$-稀疏可观测,则运行时保障机制能抵御控制 $q$ 个信道的攻击。该条件弱于全状态可观测,且通过三个不可影响计数器可将信道预算从二提升至六。当低于此前提时,集合值监控器成为最优解以应对非零噪声环境。
针对图像返回型多模态 RAG 的黑盒自适应数据提取攻击把恶意指令嵌入用户输入图像,而不是把恶意查询放在文本 prompt 中。实验覆盖医疗助手、文档助手和通用工具三个场景,在多个 CLIP-family retrievers 与不同 generators 下,单次 2500-query run 在 local-feature correspondence 下最多重建 611 张放射科图像、566 份文档扫描和 416 张通用图像,并达到非自适应 baseline 最多 5.6 倍。事实是攻击可沿 embedding space 中仍能产生新检索的区域自适应推进;推断是 MRAG 的图像检索与返回通道本身构成数据源泄露入口,防护需要覆盖多模态输入、检索和图像输出,而不只是文本 prompt。
推荐理由:它把多模态 RAG 的数据提取风险从文本提示扩展到图像输入,并给出黑盒自适应攻击的量化结果,能直接校正对 MRAG 安全边界的判断。
这篇 arXiv 论文提出名为 LLMLeak 的攻击:本地恶意软件自身不能直接联网,但可以把机密编码进 URL,并诱导 LLM 为完成看似正常的任务去访问该网页。当 LLM 使用其网页抓取工具请求这个地址时,攻击者控制的 DNS 或 Web 服务器就能收到机密,从而绕开对直接网络通信和生成代码外发的常规检测。 论文的关键细节是攻击不依赖网络库,也不要求 LLM 生成明显的发送代码,只利用 Agent 常见的 fetch website 能力。作者在 11 个开放参数模型上评估,报告攻击成功率为 79.7%,并在真实聊天机器人上做了案例研究。这说明风险不仅存在于理论构造,也可能出现在允许工具调用、网页浏览或插件式信息获取的产品里。 事实是论文展示了攻击路径、评估范围和成功率;推断是这种风险会提高对 Agent 出站请求的审计需求,尤其要识别 URL 中携带异常编码参数的抓取行为;猜测是未来防护可能把网页抓取工具纳入数据外泄面,而不是只把它当作普通联网功能。
推荐理由:论文把网页抓取这类常见 Agent 工具变成隐蔽外泄通道,可提醒开发者在工具白名单和出站审计中区分“合法请求”与数据外带。
针对 AMD 7-Series FPGA 的位流加密方案,研究者提出并演示了一种利用光子发射显微镜和电光探测的光学侧信道攻击。该攻击成功从 ICAP 接口提取动态重配置过程中的明文配置数据。研究指出,即使采用部分重配置和自定义加密引擎,硬连线配置接口仍易受此类光学攻击威胁。
APEX 通过串联技能劫持 LLM 智能体,在 SkillsBench 上取得 74.2% 攻击成功率。在 GPT-5.4 上,完整技能链成功率为 84.3%,合并为单个技能时只有 17.4%;要求智能体检查技能生成文件是否匹配原始请求的提示防御把成功率降到 59.1%,但 72 个良性原生技能任务的验证通过率从 86.7% 降到 56.3%。事实是攻击依赖上游技能写入任务进展记录并夹带虚假用户批准,下游技能据此执行攻击者选定动作;推断是开源技能链的跨技能状态会扩大攻击面,防御需要在阻止定向动作与保留正常任务性能之间权衡;没有材料支持更宽泛的猜测。
推荐理由:它把多技能智能体的跨技能状态污染量化为攻击,能校正对开源技能链安全边界与防御成本的相关现实判断。
论文提出 Bi-QSTO,在显式质量约束下优化毒样本,并显示质量筛选后部分保留的高质量样本仍可能降低安全对齐 LLM 的安全表现。 摘要先指出安全对齐 LLM 在少量有害或看似良性样本上微调仍脆弱,以往投毒研究常假设有害样本直接进入微调,而实际训练管线会先做质量筛选;该工作系统评估筛选对投毒的过滤效果和保留数据的下游安全影响,发现筛选能移除许多明显有害样本,但一些保留的高质量样本仍可能降低模型安全对齐,摘要将其可能归因于层级梯度层面的有害类训练更新模式。 在跨投毒设置、目标模型和过滤率的实验中,Bi-QSTO 在筛选前后保持攻击有效性;即使 90% 过滤,有害种子样本的 Poisoning Retention Rate 高于 90%,Harmful Score 为 3.30--4.01,且攻击效果强烈跨模型迁移,保留优势也泛化到额外筛选方法。事实是摘要报告了上述指标;推断是质量筛选不能替代安全对齐评估;猜测是仅依赖质量筛选或明显有害样本过滤的管线可能低估投毒风险。
推荐理由:它把数据质量筛选从安全假设变成可攻击面,能改变对训练数据清洗、微调安全评估和投毒检测阈值的判断。
PACE 论文提出在每次工具调用执行前进行来源感知能力执行,用路径约束提出可执行的影响路径切分,并用能力与效果校验把 schema 定义的效果对照来自认证请求编译出的权限,从而在工具元数据、检索页面、记忆或可复用技能被投毒时,限制它们对下一次工具调用的影响。论文在 8 个可执行智能体安全基准和 3 个目标模型族上报告,评估配置在 79 个合格攻击列中的 62 列取得严格最低攻击成功率、14 列持平,完整基准原生效用相对无防护智能体最多损失 3 点,1167 个配对案例的完整消融把多数安全增益归因于效果校验,把拒绝控制归因于边界适配,且小规模自适应搜索对 30 个越权目标取得 0/30 成功。事实是入口审查无法区分安全变体与泄漏变体,PACE 把边界移到执行前,要求最终动作保持认证切分,并区分认证执行契约与评估配置,允许在建议阻断后恢复授权调用或应用声明修复;推断是工具调用前能力执行可能成为智能体部署的关键安全层,因为它把权限校验从静态准入移到每次副作用发生前;猜测是它能否降低真实环境中的投毒攻击仍待验证。
推荐理由:它把工具调用前的来源约束与效果校验拆成可执行边界,能校正对智能体投毒防护只能靠入口审查的判断。
该论文系统化了去中心化金融(DeFi)金库的架构、策展中介控制平面及策略执行模式,提出了统一的系统模型与形式化定义。研究涵盖金库暴露与目标、策展治理问责机制三大分类,并将代表性生产协议映射至这些维度以支持更安全的区块链金融应用设计。
该研究针对智能手机易受 GNSS 欺骗攻击的问题,建立了定义攻击效应与防御技术的分类体系。文章回顾了手机漏洞特征的历史演变,并概述了检测及对抗此类威胁的现有技术方案。通过对比框架评估了各技术在移动平台上的优劣,填补了现有综述未涵盖移动架构限制的空白。
Helol Tunnel 通过重新排列 TLS Client Hello 包中的加密信息元素,构建新型隐蔽信道以绕过下一代防火墙。该方法利用协议扩展性合规措施及用户为抗指纹识别而变化的参数配置实现数据外泄。实验基于真实流量捕获和公开指纹数据,证明其优于现有利用 TLS 的隐蔽信道技术。
ABSENTIA 用 LLM agent 对 Web 应用后端做路由级访问控制检测,并在 BAC-Bench 召回 19 个案例。论文把访问控制问题描述为授权关系,即谁可以对什么对象执行操作,而不是数据如何流动;由于每个应用自己定义这种关系,预先写好的规则难以跨应用迁移,因此 ABSENTIA 让 agent 从代码中推断应用应满足的属性,并在属性未被强制时报告对应路由。 BAC-Bench 的设计是这篇论文里容易被忽略的细节。它包含 30 个 broken access control advisories,覆盖 25 个仓库、3 种语言和 9 个框架,且每个案例都发布于 2025 或之后,经人工审计员验证,并配对修复 commit。所谓 paired credit 要求检测器标记易受攻击版本,而不是修复后的版本,这使评估更接近真实审计中定位问题版本的要求。 从结果看,事实是 ABSENTIA 在 BAC-Bench 上召回 19 个,paired credit 下 17 个,LLM verifier 确认 51% 的发现;CodeQL 和 Semgrep 召回 0,同一模型上的 unstructured agent 召回 3。在 OWASP Benchmark 的 injection categories 中,ABSENTIA 在 Python 上领先专用分析器,在 Java 上仅落后 CodeQL 和 IRIS。推断是,对访问控制这类关系型漏洞,结构化覆盖和路由级检查比自由搜索更有价值,但 51% 的确认率说明自动发现仍需人工复核。猜测是,若扩展到更多框架、更大代码库或不同授权模型,召回和误报率可能变化,但材料未提供这些证据。
推荐理由:ABSENTIA 把通用 LLM agent 变成路由级访问控制审计器,并用 BAC-Bench 给出召回基线,可校正对 AI 安全自动审计工具实际有效性的判断。
论文提出一个覆盖六类提取攻击、十种防御和两类自适应攻击的黑盒 LLM 模型提取生命周期基准,用于在纯文本 API 条件下比较防御是否有效。基准在每次比较中控制模型配置、查询数据、预算和 held-out 评测条件,同时保留各攻击的查询与训练流程,并测量代理模型能力、对受害模型的保真度、Rep-4 输出质量和查询预算敏感性。推断上,它把此前碎片化的攻击与防御评估放到同一预算和评测条件下,能减少因访问假设不同造成的误判,并帮助判断哪些防御在自适应攻击下仍有效。
这篇论文提出 ZoneClaw,用分层信任区替代 OpenClaw 风格 computer-use agent 的扁平工作区记忆,以缓解持久记忆注入攻击。其核心不是阻止外部内容被记住,而是把“可持久保存”和“可指导行动”拆开:外部声明先进入低信任区,只有跨越显式权限边界并经过攻击者不可直接写入区域交叉校验后,才能获得行动授权。 作者指出的攻击链是:攻击者控制看似无害的外部内容,诱导 Agent 在正常任务中记录有利于攻击者的声明,这些声明随后影响攻击者未接触过的后续任务。论文称既有防御多在内容进入记忆前或后续动作执行时干预,较少处理“已存储内容是否可指导行动”。在四个攻击场景、两种注入设置和四个 backbone 上,ZoneClaw 将 ASR 从 372/480 降至 6/480,同时在 458/480 次试验中保持效用,并对部分具备防御意识的攻击者仍有效。 事实是论文给出了分区、权限边界和实验数字;推断是这种设计意味着 Agent 记忆系统的安全重点会从内容过滤转向权限治理;猜测是若该方法在真实长期助手环境中复现,低信任记忆区可能成为 Agent 安全架构的常见组件。
推荐理由:它把 Agent 持久记忆攻击从输入过滤转向权限分层,可改变长期记忆系统的安全设计优先级。
这篇 arXiv cs.CR 论文针对 ACP、A2A 等 Agent 交互协议带来的间接提示词注入风险,提出名为 A2A-TIBA 的攻击原理,并设计 GDA Measurement 红队测试方法。作者认为现有评测只看攻击成功率,无法区分失败究竟来自 LLM 识别恶意内容,还是 Agent 层机制拦截执行,因此把攻击结果扩展为 Class A/B/C/D,对应语义拒绝率、语义突破率、拦截率和穿透率。 攻击路径采用植入命令、回传数据和建立回调交互程序的步骤,让目标 Agent 部署一个可被攻击者后续直接调用的交互通道,从而绕过 Agent 前端继续发号施令。为评估防御,作者通过 LLM gateway 捕获原始上下文、双路数据保存和基于 Agent 的自动判定构建测试台,并在 15 种 Agent 前端与 LLM 后端组合上测试,建立 1,000 个案例数据集。实验结论是,恶意内容进入 Agent 的信封层,即 A2A、工具、记忆等通道,应被视为独立防御层。 作者据此提出 ELA-ITL 三层同构攻防模型:防御分为信封包装、LLM 识别和 Agent 拦截,攻击分为植入通道、提示优化和执行机制。论文称,在 A2A、工具和记忆等信封包装中加入恶意提示标签,能显著提升 LLM 对恶意内容的识别。这一结果若可复现,意味着多智能体产品不能只依赖模型安全对齐或终端执行沙箱,还需要在协议封装、消息元数据和通道标记层增加安全设计。
推荐理由:把 Agent 安全评测从单一 ASR 拆成四层结果,并提出信封层标注防御,能改变多智能体系统安全设计优先级。
研究揭示模型量化会改变模型反演攻击的有效性,并在 4 bits 时表现出显著的量化敏感性差异。在 ResNet-50 上,Palm 数据集 4 bits 量化将 RL-MIA 严格成功率从 54% 降至 26%,准确率仅从 99.01% 降至 96.55%。
论文提出 Proof-Gated Signing,用 SMT 求解器校验链上 AI 智能体交易,阻止了 140 个有害场景中的 93.6%。作者把签名前检查的问题定义为状态漂移:静态 allowlist、LLM reviewer 和 transaction simulation 都描述检查时的链状态,而交易可能在 front-running、合约升级或 token 参数变化后的状态执行;PGS 先模拟拟议交易并提取效果,再对 oracle 不确定区间内每个价格检查声明式 value-and-permission policy,然后把钱包余额边界、收款方收据、allowance caps 和 ownership 编译为 on-chain post-conditions,由智能合约钱包原子执行。测试床包含 260 个场景,其中 14 个攻击族包括 5 个 drift 和 2 个 adaptive 族,另有 12 个 benign 族;伤害按 attacker balances 而非 policy 测量,PGS 通过 97.5% 的 benign 场景,simulation-only 只阻止 57.9%,static allowlist 阻止 71.4%,50 个 drift 场景在 PGS 下没有 attacker gain,唯一未阻止的 in-policy drain 被 per-session budget 限制。事实是 PGS 在开放测试床上优于 simulation-only 和 allowlist,且单次检查约 41k gas、0.1-0.2 s;推断是若 gas 和延迟可接受,它可能成为链上 AI 智能体钱包的默认签名前安全层;猜测是 LLM reviewer 获得 clean pre-drift simulation 后更可能批准 drift attack,这一发现提示把干净模拟直接交给模型可能放大攻击面,但原文未给出生产环境规模。
推荐理由:它把链上 AI 智能体交易安全从检查时状态推进到执行时状态漂移,并给出 SMT 证明与测试数据,可校正对签名前检查有效性的判断。
研究提出训练无关的 NEEDLE 方法,利用激活向量估计后门方向与拒绝子空间,通过序列权重正交化抑制后门。该方法无需干净参考模型或原始中毒数据,在多种模型家族和攻击类型评估中实现最低平均攻击成功率(ASR),代码注入攻击 ASR 达 0%。NEEDLE 同时保持最低的 KL 散度及最小的能力与安全变化。
UnifiedAttack 是一个针对原生统一多模态模型的安全评测基准,重点不是单模态有害内容,而是文本与图像协同后产生的额外危害增益。论文同时提出一个协同劫持框架,用 In-Context Reskinning 和 Cognitive Planning Injection 验证漏洞:前者通过 few-shot 方式把对抗意图包装进看似良性的虚拟外壳,降低安全过滤敏感度;后者强制模型先进入中性逻辑规划,再利用其保持一致性的倾向诱导后续生成有害多模态内容。 论文称在多种先进架构上,UnifiedAttack 能持续绕过现代对齐机制。这个结果的关键含义是,统一模型的结构性有用性和逻辑连贯性可能被系统性武器化,因此仅靠单模态内容过滤或通用拒答策略不够,安全防御需要进入协同生成任务的逻辑规划层。 事实是论文提出了基准、攻击方法和实验结论;推断是这类攻击对统一多模态产品尤其相关,因为图文同模型生成会减少跨模块审查点;猜测是未来安全评测会增加 logic-aware defenses 和跨模态协同风险指标。
论文提出可重放工具智能体审计收据,联合绑定声明、来源片段、执行前缀和来源版本。它针对的问题不是引用或执行日志单独无效,而是两者都形式有效时,声明仍可能被移植到不同声明、动作、运行或来源版本。该合同把展示给用户的 claim 与产生它的 committed execution 和 cited source 关联起来,使审计不再只检查引用和 trace 是否 well formed。 收据包含 emission anchor,用于在 committed answer 或 claim-bearing action 中定位 claim,并携带 source identifiers、offsets、hashes、quotes 和 domain-separated execution commitment。确定性 integrity verifier 在语义或任务标签 join 前重建这些绑定,并把 integrity plane 与可插拔 support plane 分开,避免把结构有效性当作 entailment 的代理。论文列出七个可独立测试属性,包括 claim-emission binding、source binding、ordered-execution binding、oracle separation、persisted-object replay、execution-rerun consistency 和 version/access binding。 在 1,280 次 cross-object attacks 中,联合合同检测出 1,275 次 substitutions,检测率为 0.9961;移除某个 targeted property 后,对应攻击检测率降到 0.0156-0.0625。在独立 adjudicated 的 384-pair split 上,conflict-aware support guard 的 F1 为 0.8865,false acceptance 为 0.0729;在 unseen failure families 上分别为 0.8679 和 0.0938。事实是论文报告了这些指标;推断是,对需要引用可追溯的 Agent 产品,审计重点应从引用和日志是否完整转向声明、执行与来源版本是否同一;猜测是,实际部署需要维护 source version、access state 和 execution commitment,可能增加工程成本,但能降低跨对象替换造成的误导风险。
推荐理由:它把工具智能体的引用、执行与来源版本绑定为可重放收据,能校正只查日志和引用是否有效的审计判断。
该研究复现了图像与文本分类中的逃逸攻击,显示 MNIST 模型在 FGSM 攻击下准确率从 98.63% 降至 1.72%,而 DistilBERT 在特定扰动下仅产生微弱概率变化。实验表明对抗脆弱性具有强模态依赖性,且鲁棒性需通过实证测试而非依赖清洁准确率推断。
这篇 PRISMA 指南综述系统梳理了 2017 至 2026 年间单像素攻击(OPAs)的研究,涵盖算法基础、黑盒进化优化及防御机制。分析显示差分进化策略占主导,但数据集多样性与标准化评估仍存在缺口。文章提出包含鲁棒性测试和事件披露的监管框架,以应对医疗诊断等关键领域的超稀疏对抗威胁。
该研究提出一种无需触发器先验知识或重新训练即可净化 LoRA 微调大语言模型后门的方法。通过构建正交零空间并投影 LoRA 更新,该方法将攻击成功率从近 100% 降至 10% 以下,同时保留基座模型能力与下游任务技能。相关成果已提交至 NeurIPS 2026。