跳到正文

安全研究

只收会改变安全或产品判断的研究:AI 对抗评测、联网信息污染与引用生态、Agent 攻击面,以及有真实系统测量、对照实验或可复现证据的模型能力边界。

最新精选

第 21–38 条 · 共 38 条
今天10月2日周五
  1. arXiv cs.CR68

    论文比较冻结 LLM 在层级网络防御中从规划到执行的控制效果

    这篇 arXiv 论文研究冻结、零样本的大语言模型能否在层级网络防御中提供免重训练控制,并比较 LLM 只负责规划与同时负责执行时的差异。作者将防御任务拆成 planner-executor 层级:planner 在固定时间范围内选择要防守的子网,executor 在该子网内选择具体防御动作。实验在 Cyberwheel 环境中进行,该环境内置映射到 MITRE ATT&CK 框架的自动红队 agent,并比较 RL+RL、LLM+RL 和 LLM+LLM 三种配置,覆盖 3B 到 70B 参数的六个模型,包括两个网络安全专用模型,以及小型、中型和大型网络。 结果显示,仅把 planner 替换为 LLM 时,随着网络规模扩大收益有限;把 LLM 控制扩展到 execution 后,能力足够强的模型才出现明显改善。论文给出的例子是,一个冻结的通用 70B 模型在三种网络规模下使用相同权重,能把成功横向移动控制在约 1% 的步数,攻击者影响接近零,而 RL 基线需要为每个网络规模重新训练。论文据此认为,足够强的冻结 LLM 可以在所评估网络规模上维持防御性能,且强战术执行对释放 LLM 控制收益很关键。 事实是论文报告了不同配置下的防御指标和免重训练能力;推断是 LLM 的价值不只来自高层任务分解,还依赖底层动作选择能力;猜测是这类方法能否迁移到真实企业网络,仍取决于环境保真度、攻击分布和运维约束。

    推荐理由:论文把 LLM 用于网络防御的增益拆到规划与执行两层,能校正“只接高层规划就够”的 Agent 部署判断。

  2. arXiv cs.CR78

    ZoneClaw 通过记忆分区降低 OpenClaw 风格计算机使用 Agent 的持久记忆攻击成功率

    这篇论文提出 ZoneClaw,用分层信任区替代 OpenClaw 风格 computer-use agent 的扁平工作区记忆,以缓解持久记忆注入攻击。其核心不是阻止外部内容被记住,而是把“可持久保存”和“可指导行动”拆开:外部声明先进入低信任区,只有跨越显式权限边界并经过攻击者不可直接写入区域交叉校验后,才能获得行动授权。 作者指出的攻击链是:攻击者控制看似无害的外部内容,诱导 Agent 在正常任务中记录有利于攻击者的声明,这些声明随后影响攻击者未接触过的后续任务。论文称既有防御多在内容进入记忆前或后续动作执行时干预,较少处理“已存储内容是否可指导行动”。在四个攻击场景、两种注入设置和四个 backbone 上,ZoneClaw 将 ASR 从 372/480 降至 6/480,同时在 458/480 次试验中保持效用,并对部分具备防御意识的攻击者仍有效。 事实是论文给出了分区、权限边界和实验数字;推断是这种设计意味着 Agent 记忆系统的安全重点会从内容过滤转向权限治理;猜测是若该方法在真实长期助手环境中复现,低信任记忆区可能成为 Agent 安全架构的常见组件。

    推荐理由:它把 Agent 持久记忆攻击从输入过滤转向权限分层,可改变长期记忆系统的安全设计优先级。

  3. arXiv cs.CR78

    论文提出 A2A-TIBA 攻击与三层同构攻防模型,指出信封层是多智能体安全防御新维度

    这篇 arXiv cs.CR 论文针对 ACP、A2A 等 Agent 交互协议带来的间接提示词注入风险,提出名为 A2A-TIBA 的攻击原理,并设计 GDA Measurement 红队测试方法。作者认为现有评测只看攻击成功率,无法区分失败究竟来自 LLM 识别恶意内容,还是 Agent 层机制拦截执行,因此把攻击结果扩展为 Class A/B/C/D,对应语义拒绝率、语义突破率、拦截率和穿透率。 攻击路径采用植入命令、回传数据和建立回调交互程序的步骤,让目标 Agent 部署一个可被攻击者后续直接调用的交互通道,从而绕过 Agent 前端继续发号施令。为评估防御,作者通过 LLM gateway 捕获原始上下文、双路数据保存和基于 Agent 的自动判定构建测试台,并在 15 种 Agent 前端与 LLM 后端组合上测试,建立 1,000 个案例数据集。实验结论是,恶意内容进入 Agent 的信封层,即 A2A、工具、记忆等通道,应被视为独立防御层。 作者据此提出 ELA-ITL 三层同构攻防模型:防御分为信封包装、LLM 识别和 Agent 拦截,攻击分为植入通道、提示优化和执行机制。论文称,在 A2A、工具和记忆等信封包装中加入恶意提示标签,能显著提升 LLM 对恶意内容的识别。这一结果若可复现,意味着多智能体产品不能只依赖模型安全对齐或终端执行沙箱,还需要在协议封装、消息元数据和通道标记层增加安全设计。

    推荐理由:把 Agent 安全评测从单一 ASR 拆成四层结果,并提出信封层标注防御,能改变多智能体系统安全设计优先级。

  4. arXiv cs.AI68

    ActiveSaddler 将自动化课程学习引入 LLM Agent harness 优化

    ActiveSaddler 提出一种自动化课程学习方法,用于优化 LLM agent 的 harness,即提示词、工具接口与控制逻辑的组合。该方法不再固定使用预设训练场景,而是把课程建模为非平稳多臂老虎机问题,动态调整哪些失败模式应被优先优化。 系统将反复出现的执行失败抽象为可复用的 failure-pattern arms,估计针对每个模式继续优化可能带来的学习进展,并在修复已知弱点与探索未见场景之间做平衡。在 GAIA2 和 Terminal-Bench 2.0 上,相比使用固定场景顺序的同一 harness 优化器,ActiveSaddler 分别提升测试 Pass@1 4.4 和 7.5 个百分点。 事实是论文给出了两个基准上的量化增益与消融结果;推断是这种收益来自对优化目标集合和优先级的持续更新;猜测是这类课程共演机制可能更适合长周期、多轮迭代的 agent 工程流程。

    推荐理由:它把 agent harness 优化从固定场景迭代推进到自适应课程学习,可改变对训练场景选择策略的工程判断。

  5. arXiv cs.AI68

    MemFit 提出无 LLM 写入与检索的长期智能体记忆系统

    MemFit 提出一种无 LLM 写入与检索的长期智能体记忆系统,并在三个基准上报告 SOTA 与数倍构建时间与成本下降。 现有长期记忆系统常依赖 LLM 智能体组织和整合记忆,导致写操作昂贵且低效;MemFit 改为把每轮对话原文近即时追加到 append-only store,用 segment summaries 索引,而不是通过压缩丢弃表面细节或替换原始轮次。 检索侧使用无 LLM 的多路径检索策略,结合词汇与语义信号和 cross-encoder reranking,对 caption-augmented episodes 做重排,覆盖文本与多模态设置。 事实是论文报告了上述机制和 LoCoMo、MemGallery、LongMemEval-S 上的 SOTA 与数倍构建时间、成本下降,并称其提供可扩展、高效的 persistent agentic memory;推断是它可能降低高频对话中的调用成本;猜测是真实长周期 Agent 场景效果仍需完整论文验证。

    推荐理由:它把长期记忆写入从大模型调用改为无大模型调用的追加索引,能校正对智能体记忆成本、延迟、可扩展性与可用性的判断。

  6. arXiv cs.AI78

    Kepler 提出可审计世界模型并在 ARC-AGI-3 公开集取得满分

    Kepler 在 ARC-AGI-3 的 25 个公开游戏取得 server-verified 100.00 RHAE,且未做 per-game model selection 或 score-conditioned reruns。它是一个开源 harness,把假设表示为可执行世界模型,并用 retrospective transition checks 和 conditional prediction checks 验证;关键不是满分本身,而是公开集分数在交互 agent 评测中的判别力问题。 证据细节有两组。第一组是效率:183 个完成关卡中 181 个的最终 Opus attempt 使用的动作数不超过对应 median-human baseline,保留的 board runs 共 8,256 个 environment actions,其中 7,292 个发生在 scored levels。第二组是成本与验证:保留的 local provider-session records 显示 858.0 million tokens、97.37% cache reads,按 2026 年 9 月 1 日 API list-equivalent rates 成本为 $777.72;论文同时报告 source-code leakage 造成无效完美运行、控制条件下 agents 重建 removed harness、autonomous repair 掩盖 broken planner 三类失败。 论文被 NeurIPS 2026 的 Interpreting Agent Behavior workshop 接收,代码和公开 traces 可用。事实是,在最终 Claude Opus 5 和 GPT-5.6 Sol boards 中,50 个 game-model cells 有 48 个达到 100,且单游戏观察案例显示 animation frames 包含 settled text grids 中没有的任务相关信息。推断是,对 ARC-AGI-3 这类需要从观察推断规则和目标的任务,公开集分数若脱离 first-attempt、cost-conditioned 和 verification-aware 指标,容易把模型能力、harness 漏洞和评测泄漏混在一起。猜测是,后续 agent 基准会更强调可审计轨迹、成本约束和首次尝试,而不是只报告公开集最高分。

    推荐理由:它把公开集满分拆到动作数、模型成本、缓存读取和验证失败,能校正对智能体真实能力与评测可信度的判断。

  7. arXiv cs.AI78

    Sapien 提出状态化策略引擎以约束自主 AI Agent 的工具调用序列

    Sapien 是一个用于自主 AI Agent 的状态化策略引擎,通过把任务特定策略编码为带状态谓词、延迟策略生成和作用域语义检查的扩展正则表达式,来约束 Agent 的多步工具调用序列。 论文给出的结果显示,Sapien 在保持与无约束 Agent 相差不超过几个百分点的效用的同时,即使 Agent 被完全劫持,也能在 AgentDojo 上排除 93-95% 的攻击,在 Toolathlon 上排除 62-85% 的攻击;在长程任务中,这一拦截比例是工具白名单的两倍。 事实是论文提出了策略表示与评测结果。可以推断,这说明多步 Agent 安全不能只依赖静态允许列表,而需要结合已发生动作和已获知上下文做状态化裁决;对 Agent 产品而言,这类引擎可能成为工具调用层的安全中间件。尚不确定的是其在真实生产环境中的策略编写成本与延迟开销,原文摘要未提供这些细节。

    推荐理由:它把 Agent 安全从静态工具白名单推进到状态化策略引擎,可改变对长程任务防御方案的选型判断。

  8. arXiv cs.AI68

    生成式个性化中更多上下文不一定更好,研究提出 Context-Sufficiency Frontier

    一项提交给 Journal of Service Research 的预印本研究提出,生成式 AI 个性化的关键不是给模型更多上下文,而是找到当前交互所需的最小相关上下文集合。作者把用户历史行为和偏好称为 customer evidence,把服务方在生成时补充的情境信息称为 provider-side context,并认为后者一旦变得容易供给,数量增加不一定带来收益。 研究构建了 context sufficiency 理论,将上下文状态分为 insufficiency、sufficiency、saturation 和 interference,并提出 Context-Sufficiency Frontier 用于定位最小相关集合。作者在一大家居零售商的生成式推荐系统上做了 full-factorial experiment,结果显示相关上下文提升了推荐适配度,无关上下文则降低适配度并扰乱检索。 该工作把个性化问题从“补充更多上下文”转向“判断当前交互真正需要什么上下文,并在服务流程中施加约束”。对做推荐、客服或导购类 Agent 的团队而言,它提示上下文工程需要引入相关性筛选和约束机制,而不是简单扩大 prompt 或 RAG 输入。

    推荐理由:它提出上下文充分性边界,提醒个性化系统优先筛掉无关上下文,而不是继续堆料。

  9. arXiv cs.AI68

    R2T 用可执行检查提升科学计算 LLM Agent 的代码修复表现

    R2T(Rules to Tools)把公开科学计算要求预先做成可执行检查,供科学编码 Agent 在修复 SciCode 任务时使用。与只拿到文本规则、起始程序、模型和预算的对照组相比,拿到可调用检查的工具组在两个任务 ID 队列中完成修复数从 26/30 提升到 29/30。 细看任务层面,工具组在三个任务 ID 上占优,一个任务上文本占优,十一个任务打平;八 ID 队列中工具组 15/16、文本组 13/16,但任务聚类 bootstrap 95% 区间为 [-12.5, 43.75] 个百分点,说明差异并不稳健。更大的共享定义 SciCode 队列两组均 13/24;在更换起始程序的五个开发暴露任务上,工具组 7/10 对文本组 3/10。匹配 PDE 对比中,详细文本 23/24、检查 24/24,且检查组报告的模型输出低 31.2%,但公共 CPU 使用在两个任务 ID 队列中都上升。 事实是可执行检查能减少部分科学计算代码修复失败,并可能降低 Agent 侧输出成本;推断是其收益取决于任务是否已有可靠初始检查,且可能把成本转移到公共算力;猜测是这类方法更适合有明确方程、边界条件和输出要求的科学计算场景,而不是泛化到所有编码 Agent。

    推荐理由:论文用 SciCode 修复任务对比文本规则与可执行检查,显示检查可提升部分任务修复率但结果高度任务依赖,可用于判断 Agent 代码验证应优先做可执行校验而非纯提示约束。

  10. arXiv cs.AI68

    论文证明数据排列改变的是模型对冲突约定的承诺而非能力

    这篇 arXiv 论文研究在同一批问题以两种互不兼容但都正确的约定书写时,训练数据排列会向模型参数写入什么。作者提出学习率调度不是背景条件,而是平均算子,并证明排列与调度在顺序效应中以分离乘积形式进入:排列只作为块周期出现,调度只决定端点能对训练中某一时刻赋予多大权重。 实验固定语料、预算和其他条件,只改变十种排列路径,并在不同 lr_scheduler_type 下各跑两次。常数学习率下,十种排列在分配上跨越 0.2221,对比下限达 11.63,且随排列更块状而单调变化;在单一 cosine 调度下,同样十种排列只落入两个可区分状态。论文测得 12.29σ 的排列切换,但在约定无关评分下恰好为零:十二个臂的 acc_A+acc_B 在 9.7% 内保持恒定,而分配份额从 0.04 到 0.87 变化;在提示中标明约定后,切换消失并达到 union ceiling 的 87.5%。 事实是论文给出了排列效应的机制分解与受控测量。推断是这类效应解释的是模型选择承诺哪一套约定,而不是总体能力高低。猜测是仅用 exact-match 或总分基准评估预训练数据顺序,可能系统性漏掉这种承诺偏移。

    推荐理由:它把数据顺序影响从能力差异改写为约定承诺差异,提醒训练顺序评估不能只看总分基准。

  11. arXiv cs.AI68

    论文发现在受限信号通道中,对抗鲁棒最优信号与显著性极点几乎完全重合

    这篇论文研究当知情对手与受众共享受限信号通道时,最能保护真实答案的信号策略。作者在 108 个确认性条目上发现,对抗鲁棒最优信号与先前工作提出的显著性极点完全一致;在 200,000 个条目池中,两者只在 2,748 个条目上不同,而这些条目恰好是先前显著性到贝叶斯坐标未定义的位置。 作者将对手引入一个强制选择任务,该任务抽象自 Deception: Murder in Hong Kong。对手知道目标、观察信号,并使用说服预算 beta 为最强错误答案辩护。随着 beta 增大,最优信号从最大化后验的选项转向最大化边界的选项;当 beta = 0 时,游戏复现原始 oracle 模型,且监听者温度为 tau = 1。论文称 18.2% 的条目在有限预算下最优选项会移动,并且每个条目都有精确的临界预算。 这种重合对经验评测形成结构性限制。两种对手框架使七个语言模型在 108 个条目中的 30 到 77 个条目上改变选择,但没有任何测量能判断这种移动是朝向对抗感知最优,还是朝向显著性,因为两个选项相同。论文将这一点定义为结构性限制而非空结果,并建议在评估对抗感知前先验证鲁棒目标是否与启发式目标重合。

    推荐理由:它提醒评测者先检查对抗最优目标是否与启发式目标重合,否则无法区分模型是在对抗感知还是显著性偏置。

  12. arXiv cs.AI78

    论文测量现成 SLM 在 Agent 微任务上的资格缺口:16 个 Qwen3 配置均未达阈值

    这篇 arXiv 论文测试现成小语言模型能否在 Agent harness 中承担围绕主 LLM 规划器的微任务,例如自动批准 shell 命令、写入记忆、选择工具和排序历史轮次。作者构建了 4 个固定提示、自动指标和预设阈值的基准,阈值锚定廉价非 LLM baseline,并要求配置的置信区间下界超过阈值才算合格。 在不调参、仅用 FP16、greedy 和单一冻结提示的条件下,Qwen3 0.6B、1.7B、4B、8B 的 16 个任务与模型组合全部未通过,作者通过检查原始输出和 parser 行为确认结果。logprob 决策阈值诊断把失败分为能力不足和可通过改变解码阈值修复两类;4-bit 量化(RTN/GPTQ/AWQ)造成的损害取决于模型规模,但没有让任何配置达到资格,且结果在 Llama-3.x 上复现,12 个配置均不合格,对阈值扫描和提示改写也稳健。 事实层面,论文给出的核心结论是现成 SLM 不能直接通过这类微任务的严格资格门槛。推断层面,作者建议把 SLM 放在已满足阈值要求的 baseline 之后,只在 baseline 失败时调用;例如 4B 模型对 BM25 短列表重排序可提升 0.047,但它本身仍未通过资格认证。猜测层面,这意味着 Agent 系统若追求低延迟或低成本,不应把关键微任务直接交给未校准的小模型,而应设计 baseline、阈值或级联机制来兜底。

    推荐理由:它用置信区间门槛证明现成小模型在 Agent 微任务上普遍不合格,提醒不要把 SLM 直接替换关键路由层。

  13. arXiv cs.AI78

    论文发现角色分工 QA 中推理链主要改变验证判断而非答案准确率

    这篇论文研究在角色分工 QA 流程中,reasoner 向 verifier 传递的 rationale 究竟提供了什么。作者在固定证据和候选答案的前提下,只改变跨边界传递的 rationale,并在 400 条 MuSiQue、HotpotQA 和 2WikiMultiHopQA 样本上用 DeepSeek 同时作为生成器和验证器进行测试。 结果显示,忠实 rationale 相比不传 rationale 对答案准确率几乎没有提升;但被破坏的 rationale 会显著改变 verifier 对支持关系的判断。盲验证提示下,无害改写只让支持判断偏移 0–2.5%,破坏性 rationale 则偏移 10–22%;显式 rationale-checking 提示会把同一模式放大到 34–55%。最终答案变化较小,为 2–30%,且只有 2.9–35.3% 的被破坏支持翻转同时伴随答案变化。人工审计进一步显示,42 个有效破坏样本中有 16 个属于 corruption-overtrust,而模型接受的 10 条被破坏 rationale 中有 9 条被人工拒绝或标记为不清楚。 该研究给出的事实是,rationale 共享不应只被评估为提高答案准确率的通道,更应被当作验证消息机制来评估。由此可以推断,多智能体 QA 或 Agent 流水线如果直接透传推理链,可能引入新的失败面:验证器会被表面连贯但实质损坏的解释牵引,而不是独立复核证据。论文中的跨模型与任务边界检查还表明,这一通道何时被放大、何时失效,取决于具体提示和任务结构。

    推荐理由:它把 rationale 传递从“提升答案”重新界定为“验证消息干预”,可改变多智能体 QA 中是否该透传推理链的设计判断。

  14. arXiv cs.AI65

    论文分析因果世界模型何时帮助模块化 LLM 智能体

    论文提出 FedCausalCompose,结论是因果世界模型只在跨模块接口可识别且行动时可用时帮助模块化 LLM 智能体。它针对订单、支付、库存和发货这类模块系统,指出观测轨迹只能说明先后,不能说明支付是否授权发货、库存是否中介或隐藏触发同时解释两者。这个区分把世界模型从拟合历史轨迹,转向支持干预时规划。 证据上,论文称观测世界模型在未阻断后门路径下会有不可消除的干预误差,接口恢复随干预-响应覆盖提升,且 oracle 因果组合在覆盖和本地机制误差受控时可超过非因果下界。诊断设置中,结构化工具环境因 API 签名暴露前置条件和下游效果,因果接口帮助最大;对话和叙事环境常忽略原始边列表,除非短注意力锚点使因果信息决策相关。收益来源不是因果图本身,而是可被行动时使用的接口。 事实是材料只报告诊断性智能体设置中的结果,未涉及通用部署指标或真实业务系统。推断是工具型 Agent 应优先把 API 前置条件、下游效果和干预证据做成行动时可用接口,而不是只保存因果图。猜测是若接口不可识别或表示不可用,因果世界模型对规划收益会有限,尤其对话和叙事场景需要额外锚点。

    推荐理由:它把因果世界模型的价值限定在接口可识别且行动时可用,能校正对多模块智能体在工具环境中的规划收益判断。

  15. arXiv cs.AI65

    论文提出 CTWM 用重尾记忆轨迹优化长程语言 Agent 的记忆预算

    Xinyuan Song 和 Zekun Cai 在 arXiv 论文中指出,长程语言 Agent 的外部记忆使用会向少数核心状态集中,罕见状态则落入长尾并累积预测误差;他们据此提出 Core--Tail World Model(CTWM),用单一指数 τ 分配提示词预算并保留摘要化长尾。 在 Synthetic Graph World 上,论文称 CTWM 相对 graph-memory baseline 保持完整状态与转移覆盖,减少 5.9% prompt tokens,并把下半部分长尾预测误差降低 13.6%。同一配对比较还显示其在 ALFWorld 上有一致的 token 节省,在 LongMemEval 上减少 24.48% tokens 且总体准确率持平。审计部分还发现集中现象可复现但依赖策略:random-walk agent 产生与 log-normal 兼容的检索痕迹,语义 LLM 策略产生更强的截断幂律核心—长尾痕迹。 事实是论文给出了审计方法和三组基准上的配对结果;推断是重尾记忆轨迹可作为 token 高效世界模型的控制信号;猜测是其是否适用于更复杂真实任务仍取决于外部验证。

    推荐理由:把长程 Agent 记忆从成功率和 token 成本转向长尾预测误差,可作为记忆系统评测与预算控制的新变量。

  16. TechCrunch · AI78

    OpenAI 据 WSJ 报道因敏感信息处理违规与三名安全研究人员分道扬镳

    OpenAI 据 WSJ 报道与三名安全研究人员分道扬镳,公司称内部调查确认他们在既定程序外处理敏感信息并违反政策。报道未点名研究人员、第三方组织或具体信息,X 上流传的身份猜测未获 TechCrunch 确认。结合 NYT 报道的内部安全警告、OpenAI 取消 GPT-6.1 Astra 以及智能体安全事件,可看到安全与发布节奏的张力;事实是 OpenAI 因信息处理违规与三名安全研究人员分道扬镳,推断是安全研究者的外部沟通可能面临更强约束,但不能确认被解雇者就是公开批评者。

    推荐理由:这篇报道把 OpenAI 安全人员解雇、智能体安全事件与 GPT-6.1 Astra 取消放在一起,能校正对其安全治理、内部举报机制和发布节奏的判断。

9月23日周三
  1. Anthropic News9

    Claude 找到类 CRISPR 酶,真正的门槛不是模型而是湿实验闭环

    流行标题很容易被读成“模型独立完成生物发现”,但 Anthropic 披露的实际链路是:人类给出高层研究方向,Claude 扫描 DNA 数据、批量提出候选假设,实验团队再用湿实验验证。事实是模型把搜索空间压缩到了可实验的范围;尚不能推出的是,它已经替代了生物学家的判断与实验设计。 对创业者更重要的增量是,科学 Agent 的护城河正在从一次推理能力迁到数据权限、实验吞吐和失败样本回流。能把假设生成、实验排期、结果记录和下一轮搜索连成闭环的团队,单位实验成本会持续下降;只做聊天界面或论文总结的产品,很难分享这部分价值。

    推荐理由:原始披露同时给出了模型作用边界和真实验证链条,能直接改写对科学 Agent 产品形态与数据壁垒的判断。

9月18日周五
  1. Anthropic News78

    Anthropic 宣布与 Accenture 合作开展 frontier AI 嵌入式评估

    Anthropic 宣布与 Accenture 合作开展 frontier AI 的嵌入式独立评估,由 Accenture 的 Faculty 牵头进行模型评估、red-teaming、alignment assessments 和 safeguards 测试。

    推荐理由:材料把独立评估从外部基准推进到员工级访问的内部治理,并给出双方各投至少 $1B 的五年资金安排,可校正对 AI 安全验证机制成熟度的判断。