跳到正文

安全与对抗

覆盖越狱、提示注入、数据泄露、对抗评测与安全机制,优先保留有攻击路径、实验结果或可复现材料的研究。

最新精选

第 21–40 条 · 共 53 条
10月2日周五
  1. arXiv cs.CR78

    OverAct 论文测量 LLM 工具调用智能体的主动过度授权,并用 SelfAudit 降低 43% 隐私过度访问

    OverAct 论文提出基准与 SelfAudit,测量并缓解 LLM 工具调用智能体对私有数据的主动过度授权访问。OverAct 在八个隐私敏感领域使用确定性、无裁判评分,覆盖七个模型四个模型族;所有模型都显著超出授权范围,请求具体性是最强预测因素,工具池规模扩大使过度授权亚线性增长,解码温度影响很小。SelfAudit 是零样本推理时方法,无需 oracle 知识,通过生成基于请求的理由并在执行前过滤不合理调用,将隐私导向的过度访问降低 43%;作者据此推断过度授权更多来自结构性决策倾向,而非解码随机性。

    推荐理由:它把工具调用智能体的越权访问拆成可复现基准与推理阶段过滤机制,能校正对数据访问风险的具体工程判断。

  2. arXiv cs.CR78

    论文提出 Bi-QSTO 并显示高质量数据筛选后 LLM 微调仍可能被投毒削弱安全对齐

    论文提出 Bi-QSTO,在显式质量约束下优化毒样本,并显示质量筛选后部分保留的高质量样本仍可能降低安全对齐 LLM 的安全表现。 摘要先指出安全对齐 LLM 在少量有害或看似良性样本上微调仍脆弱,以往投毒研究常假设有害样本直接进入微调,而实际训练管线会先做质量筛选;该工作系统评估筛选对投毒的过滤效果和保留数据的下游安全影响,发现筛选能移除许多明显有害样本,但一些保留的高质量样本仍可能降低模型安全对齐,摘要将其可能归因于层级梯度层面的有害类训练更新模式。 在跨投毒设置、目标模型和过滤率的实验中,Bi-QSTO 在筛选前后保持攻击有效性;即使 90% 过滤,有害种子样本的 Poisoning Retention Rate 高于 90%,Harmful Score 为 3.30--4.01,且攻击效果强烈跨模型迁移,保留优势也泛化到额外筛选方法。事实是摘要报告了上述指标;推断是质量筛选不能替代安全对齐评估;猜测是仅依赖质量筛选或明显有害样本过滤的管线可能低估投毒风险。

    推荐理由:它把数据质量筛选从安全假设变成可攻击面,能改变对训练数据清洗、微调安全评估和投毒检测阈值的判断。

  3. arXiv cs.CR78

    ReGap 显示微调可重新唤醒语言模型中的隐私关联

    这篇 arXiv 论文提出 ReGap,一种无需真实私有监督数据的微调攻击方法,可通过 LLM 生成的候选答案恢复语言模型中已经不再直接可查询的隐私关联。作者认为,先前攻击要求攻击者掌握与原始训练数据同分布的真实私有监督,而 ReGap 只依赖任务结构、答案 token 似然过滤和低秩适配,就能让目标模型重新暴露此前学到的私有对应关系。 实验覆盖 6 个 GPT-2、OPT 和 Qwen3 模型,ReGap 相比微调后的目标模型把目标关联恢复率提高 6 到 21 个百分点。即使适配使用的身份与模型记忆和评测身份完全不重合,且生成或筛选出的监督中没有出现准确目标答案,恢复效果仍然明显。论文还对比了曾接触目标数据的检查点和从未接触目标数据的匹配检查点:同一组训练后的 adapter 把前者的恢复率从 42% 提升到 63%,但对后者没有增益,说明仅靠适配过程不足以解释恢复,模型此前是否接触过目标数据会显著影响后续可恢复性。 事实是论文给出了无数据微调恢复攻击的方法和实验结果。推断是常规模型定制可能激活潜在隐私风险,尤其对曾接触敏感数据的检查点更危险。猜测是这一机制会促使模型定制流程在 adapter 训练、检查点管理和隐私审计上增加新的防护需求。

    推荐理由:它把微调从性能工具改判为隐私恢复通道,能改变对模型定制阶段数据泄露风险的评估。

  4. arXiv cs.CR78

    PACE 提出面向工具型 LLM 智能体的来源感知能力执行,在 8 个可执行智能体安全基准的多数攻击列上取得最低攻击成功率

    PACE 论文提出在每次工具调用执行前进行来源感知能力执行,用路径约束提出可执行的影响路径切分,并用能力与效果校验把 schema 定义的效果对照来自认证请求编译出的权限,从而在工具元数据、检索页面、记忆或可复用技能被投毒时,限制它们对下一次工具调用的影响。论文在 8 个可执行智能体安全基准和 3 个目标模型族上报告,评估配置在 79 个合格攻击列中的 62 列取得严格最低攻击成功率、14 列持平,完整基准原生效用相对无防护智能体最多损失 3 点,1167 个配对案例的完整消融把多数安全增益归因于效果校验,把拒绝控制归因于边界适配,且小规模自适应搜索对 30 个越权目标取得 0/30 成功。事实是入口审查无法区分安全变体与泄漏变体,PACE 把边界移到执行前,要求最终动作保持认证切分,并区分认证执行契约与评估配置,允许在建议阻断后恢复授权调用或应用声明修复;推断是工具调用前能力执行可能成为智能体部署的关键安全层,因为它把权限校验从静态准入移到每次副作用发生前;猜测是它能否降低真实环境中的投毒攻击仍待验证。

    推荐理由:它把工具调用前的来源约束与效果校验拆成可执行边界,能校正对智能体投毒防护只能靠入口审查的判断。

  5. arXiv cs.CR78

    一篇 arXiv 论文提出用分类法对齐的 LLM 框架检测 OSS 供应链攻击

    该论文提出一个面向开源软件供应链威胁的分类法对齐大语言模型框架,用于自动检测和分类 typosquatting、dependency confusion、Trojan Source obfuscation、malicious build injection 与 CI/CD pipeline poisoning 等攻击。作者构建了覆盖 2018 至 2026 年的 999 条已验证真实事件数据集,来源包括 GitHub Security Advisories、CISA alerts 和安全研究报告。 使用 GPT-4 并结合分类法对齐提示工程后,该框架在五类威胁上的多分类准确率和 macro F1 均为 97.0%。对照实验中,微调后的 Llama 3.1 8B 为 70.5%,SecRoBERTa 为 77.5%,均低于简单 TF-IDF 分类器的 82.3%;未做分类法对齐的 Mistral 7B 只有 65.7%。论文据此认为,在该任务中,分类法对齐的提示工程比模型规模、领域预训练或微调更关键。 事实是论文给出了数据集、基线和准确率结果,并公开代码与数据。推断是若该结果可复现,开源安全检测工具可以先用结构化分类法和提示工程提升分类效果,而不是优先投入微调。猜测是这一结论是否适用于更复杂或跨语言的供应链攻击场景,仍需更多外部验证。

    推荐理由:论文显示分类准确率主要由分类法对齐的提示工程驱动,而非模型规模或微调,可影响安全检测系统的选型判断。

  6. arXiv cs.CR68

    ReCast 用合同保持的改写框架保护固定接口多模态推理中的源内容

    ReCast 是一个 agentic plug-in 框架,用于在调用远程多模态模型时保护私有输入。它不是简单做文本脱敏或身份匿名化,而是保留任务相关关系和所需输入模态,替换源特定内容,从而在图表、语音等固定媒体接口下降低敏感内容暴露。 具体机制上,ReCast 先在本地把输入转换成共享的文本 evidence-query record,再用一个蒸馏出的 4B 模型联合改写实体和主题,并通过本地可逆、角色感知的数值映射替换数值。随后由重建 agent 从受保护记录生成并验证所需媒体。远程 solver 返回程序后,受保护操作数会在本地执行前恢复。论文在 4,000 个 ChartQA 和 NMSQA 留出样本上报告了结果:ReCast 达到 75.10% 准确率,保留了未保护远程准确率的 92.43%;基于模型的审计标记出 7.95% 的 solver-bound 请求存在源内容泄漏。 这篇工作的关键增量在于,它把隐私保护问题从“隐藏身份”重新定义为“保持任务合同但替换源内容”。事实是论文给出了准确率、保留率和泄漏率三项指标;推断是这种方法更适合必须向远程多模态服务提交图表或语音、但又不能直接暴露原始内容的场景;猜测是其实际部署价值取决于审计模型对泄漏的识别能力是否足够可靠。

    推荐理由:它把隐私保护从“匿名化”推进到“合同保持的可重写接口”,可改变多模态外包推理的安全设计判断。

  7. arXiv cs.CR68

    MOMAT 用多图集混合与 CiM 加速为量化 LLM 提供低功耗越狱防御

    MOMAT 是一个面向端侧量化大语言模型的安全框架,通过结构化知识检索和低功耗硬件加速来抵御越狱攻击。论文指出,量化会削弱大语言模型的对齐保护,使 qLLM 更容易被越狱;MOMAT 的应对方式不是单纯扩大安全数据库,而是把有害与良性样本、策略模板组织成多个语义图集,再对每条 prompt 做跨图集 top-k 检索和轻量 MoE 检测。 细节上,MOMAT 将检索任务放进 CiM 存内计算加速引擎执行,论文给出的对比数据显示,100 条查询批处理从 15,052.44 ms 降到 3,207.21 ns,能耗从 8.1×10^7 μJ 降到 3.32 μJ,相对 DRAM 基线分别获得约 4.69×10^6 倍加速和约 2.5×10^5 倍能耗下降。作者同时称红队评测中其防御效果与现有方法相当,并减少误伤良性请求,还计划开放 223.2k 样本数据集。 事实是论文提出了图集化 RAG 防护、MoE 检测与 CiM 检索的组合,并报告了显著效率指标;推断是这种模块化硬件路径可能更适合端侧 qLLM 的实时安全过滤;猜测是若 CiM 硬件可得且数据集有效,该方案可能影响边缘设备上的安全部署架构。

    推荐理由:它把量化模型越狱防御从软件检索转向 CiM 硬件加速,可能改变端侧安全方案对延迟与能耗的取舍判断。

  8. arXiv cs.CR68

    ABSENTIA 提出用 LLM agent 系统检测 Web 应用访问控制漏洞,并在 BAC-Bench 上召回 19 个案例

    ABSENTIA 用 LLM agent 对 Web 应用后端做路由级访问控制检测,并在 BAC-Bench 召回 19 个案例。论文把访问控制问题描述为授权关系,即谁可以对什么对象执行操作,而不是数据如何流动;由于每个应用自己定义这种关系,预先写好的规则难以跨应用迁移,因此 ABSENTIA 让 agent 从代码中推断应用应满足的属性,并在属性未被强制时报告对应路由。 BAC-Bench 的设计是这篇论文里容易被忽略的细节。它包含 30 个 broken access control advisories,覆盖 25 个仓库、3 种语言和 9 个框架,且每个案例都发布于 2025 或之后,经人工审计员验证,并配对修复 commit。所谓 paired credit 要求检测器标记易受攻击版本,而不是修复后的版本,这使评估更接近真实审计中定位问题版本的要求。 从结果看,事实是 ABSENTIA 在 BAC-Bench 上召回 19 个,paired credit 下 17 个,LLM verifier 确认 51% 的发现;CodeQL 和 Semgrep 召回 0,同一模型上的 unstructured agent 召回 3。在 OWASP Benchmark 的 injection categories 中,ABSENTIA 在 Python 上领先专用分析器,在 Java 上仅落后 CodeQL 和 IRIS。推断是,对访问控制这类关系型漏洞,结构化覆盖和路由级检查比自由搜索更有价值,但 51% 的确认率说明自动发现仍需人工复核。猜测是,若扩展到更多框架、更大代码库或不同授权模型,召回和误报率可能变化,但材料未提供这些证据。

    推荐理由:ABSENTIA 把通用 LLM agent 变成路由级访问控制审计器,并用 BAC-Bench 给出召回基线,可校正对 AI 安全自动审计工具实际有效性的判断。

  9. arXiv cs.CR78

    论文提出用 Accountability Proof Block 解决 LLM Agent 持续停机时的身份绑定治理问题

    这篇 arXiv cs.CR 论文针对 LLM Agent 的一种治理死锁提出机制:当可观测性或漂移检测层持续失效时,系统既不能继续执行,也不能自动停机,作者称之为 identity-bound governance event,并用 Accountability Proof Block(APB)把证据块、人工决策块和 ed25519 签名绑定到注册主体。 论文给出的机制强调系统不能伪造签名,决策主体也不能在不被发现的情况下篡改证据;实现使用 RFC 8785 JSON canonicalization 和基于 UUID4 的重放谓词。作者报告在 3,812 个停机事件中治理完整性为零未解决,在 9 类对抗向量、1,800 次攻击中检测率为 100%,k-of-n 多主体版本在 2,000 次单密钥捕获尝试中为 0 次误接受。 对六个开放 LLM 的实验中,漂移阈值 T* 在同一模型内稳定(sigma/T* < 2%),但跨模型不同,且最大模型没有漂移,作者据此否定规模单调性。事实是论文提供了密码学绑定治理流程和实验结果;推断是 Agent 部署需要按环境单独测量漂移阈值;猜测是这类证据块可能成为 Agent 停机、恢复和审计的工程模板。

    推荐理由:为 LLM Agent 在可观测性失效时的停机授权提供了可验证的密码学流程,可改变只靠模型阈值治理的设计判断。

  10. arXiv cs.CR68

    论文提出状态对齐与动作转译框架,使网络攻击 RL Agent 可跨模拟器零样本迁移

    这篇 arXiv 论文研究网络攻击 RL Agent 能否从一个网络安全模拟器迁移到另一个模拟器或仿真真实环境。作者提出把迁移问题视为同一类对齐问题,并将状态对齐与动作转译分开,使在一个环境中训练的策略无需重新训练即可在另一个环境中运行。 实验覆盖 CyberBattleSim、NetSecGame、CyberWheel 和 NASim 四个平台,并在 NASim 中做了仿真虚拟机部署。结果显示,零样本迁移在状态表示接近的环境中可以完整保留源策略性能;当源策略性能为 60.5% 时,迁移后策略取得 45.2% 胜率。在仿真虚拟机环境中,迁移策略与原生策略的 Jensen-Shannon divergence 为 0.085,说明行为相似度较高。 事实是论文给出了跨四个平台的迁移评测和开源代码。推断是这种状态对齐与动作转译分离的方法可能降低安全 RL Agent 在不同仿真环境间重复训练的成本。猜测是若该方法在更复杂真实网络中仍保持低行为偏差,可能推动攻击策略评测从单一模拟器走向跨环境可比基准。

    推荐理由:把网络攻击 Agent 的跨模拟器迁移拆成状态对齐与动作转译,可帮助判断安全 RL 策略能否脱离单一仿真环境部署。

  11. arXiv cs.CR68

    论文比较冻结 LLM 在层级网络防御中从规划到执行的控制效果

    这篇 arXiv 论文研究冻结、零样本的大语言模型能否在层级网络防御中提供免重训练控制,并比较 LLM 只负责规划与同时负责执行时的差异。作者将防御任务拆成 planner-executor 层级:planner 在固定时间范围内选择要防守的子网,executor 在该子网内选择具体防御动作。实验在 Cyberwheel 环境中进行,该环境内置映射到 MITRE ATT&CK 框架的自动红队 agent,并比较 RL+RL、LLM+RL 和 LLM+LLM 三种配置,覆盖 3B 到 70B 参数的六个模型,包括两个网络安全专用模型,以及小型、中型和大型网络。 结果显示,仅把 planner 替换为 LLM 时,随着网络规模扩大收益有限;把 LLM 控制扩展到 execution 后,能力足够强的模型才出现明显改善。论文给出的例子是,一个冻结的通用 70B 模型在三种网络规模下使用相同权重,能把成功横向移动控制在约 1% 的步数,攻击者影响接近零,而 RL 基线需要为每个网络规模重新训练。论文据此认为,足够强的冻结 LLM 可以在所评估网络规模上维持防御性能,且强战术执行对释放 LLM 控制收益很关键。 事实是论文报告了不同配置下的防御指标和免重训练能力;推断是 LLM 的价值不只来自高层任务分解,还依赖底层动作选择能力;猜测是这类方法能否迁移到真实企业网络,仍取决于环境保真度、攻击分布和运维约束。

    推荐理由:论文把 LLM 用于网络防御的增益拆到规划与执行两层,能校正“只接高层规划就够”的 Agent 部署判断。

  12. arXiv cs.CR78

    ZoneClaw 通过记忆分区降低 OpenClaw 风格计算机使用 Agent 的持久记忆攻击成功率

    这篇论文提出 ZoneClaw,用分层信任区替代 OpenClaw 风格 computer-use agent 的扁平工作区记忆,以缓解持久记忆注入攻击。其核心不是阻止外部内容被记住,而是把“可持久保存”和“可指导行动”拆开:外部声明先进入低信任区,只有跨越显式权限边界并经过攻击者不可直接写入区域交叉校验后,才能获得行动授权。 作者指出的攻击链是:攻击者控制看似无害的外部内容,诱导 Agent 在正常任务中记录有利于攻击者的声明,这些声明随后影响攻击者未接触过的后续任务。论文称既有防御多在内容进入记忆前或后续动作执行时干预,较少处理“已存储内容是否可指导行动”。在四个攻击场景、两种注入设置和四个 backbone 上,ZoneClaw 将 ASR 从 372/480 降至 6/480,同时在 458/480 次试验中保持效用,并对部分具备防御意识的攻击者仍有效。 事实是论文给出了分区、权限边界和实验数字;推断是这种设计意味着 Agent 记忆系统的安全重点会从内容过滤转向权限治理;猜测是若该方法在真实长期助手环境中复现,低信任记忆区可能成为 Agent 安全架构的常见组件。

    推荐理由:它把 Agent 持久记忆攻击从输入过滤转向权限分层,可改变长期记忆系统的安全设计优先级。

  13. arXiv cs.CR78

    论文提出 A2A-TIBA 攻击与三层同构攻防模型,指出信封层是多智能体安全防御新维度

    这篇 arXiv cs.CR 论文针对 ACP、A2A 等 Agent 交互协议带来的间接提示词注入风险,提出名为 A2A-TIBA 的攻击原理,并设计 GDA Measurement 红队测试方法。作者认为现有评测只看攻击成功率,无法区分失败究竟来自 LLM 识别恶意内容,还是 Agent 层机制拦截执行,因此把攻击结果扩展为 Class A/B/C/D,对应语义拒绝率、语义突破率、拦截率和穿透率。 攻击路径采用植入命令、回传数据和建立回调交互程序的步骤,让目标 Agent 部署一个可被攻击者后续直接调用的交互通道,从而绕过 Agent 前端继续发号施令。为评估防御,作者通过 LLM gateway 捕获原始上下文、双路数据保存和基于 Agent 的自动判定构建测试台,并在 15 种 Agent 前端与 LLM 后端组合上测试,建立 1,000 个案例数据集。实验结论是,恶意内容进入 Agent 的信封层,即 A2A、工具、记忆等通道,应被视为独立防御层。 作者据此提出 ELA-ITL 三层同构攻防模型:防御分为信封包装、LLM 识别和 Agent 拦截,攻击分为植入通道、提示优化和执行机制。论文称,在 A2A、工具和记忆等信封包装中加入恶意提示标签,能显著提升 LLM 对恶意内容的识别。这一结果若可复现,意味着多智能体产品不能只依赖模型安全对齐或终端执行沙箱,还需要在协议封装、消息元数据和通道标记层增加安全设计。

    推荐理由:把 Agent 安全评测从单一 ASR 拆成四层结果,并提出信封层标注防御,能改变多智能体系统安全设计优先级。

  14. arXiv cs.CR78

    论文提出 Proof-Gated Signing,用 SMT 求解器校验链上 AI 智能体交易,阻止了 140 个有害场景中的 93.6%。

    论文提出 Proof-Gated Signing,用 SMT 求解器校验链上 AI 智能体交易,阻止了 140 个有害场景中的 93.6%。作者把签名前检查的问题定义为状态漂移:静态 allowlist、LLM reviewer 和 transaction simulation 都描述检查时的链状态,而交易可能在 front-running、合约升级或 token 参数变化后的状态执行;PGS 先模拟拟议交易并提取效果,再对 oracle 不确定区间内每个价格检查声明式 value-and-permission policy,然后把钱包余额边界、收款方收据、allowance caps 和 ownership 编译为 on-chain post-conditions,由智能合约钱包原子执行。测试床包含 260 个场景,其中 14 个攻击族包括 5 个 drift 和 2 个 adaptive 族,另有 12 个 benign 族;伤害按 attacker balances 而非 policy 测量,PGS 通过 97.5% 的 benign 场景,simulation-only 只阻止 57.9%,static allowlist 阻止 71.4%,50 个 drift 场景在 PGS 下没有 attacker gain,唯一未阻止的 in-policy drain 被 per-session budget 限制。事实是 PGS 在开放测试床上优于 simulation-only 和 allowlist,且单次检查约 41k gas、0.1-0.2 s;推断是若 gas 和延迟可接受,它可能成为链上 AI 智能体钱包的默认签名前安全层;猜测是 LLM reviewer 获得 clean pre-drift simulation 后更可能批准 drift attack,这一发现提示把干净模拟直接交给模型可能放大攻击面,但原文未给出生产环境规模。

    推荐理由:它把链上 AI 智能体交易安全从检查时状态推进到执行时状态漂移,并给出 SMT 证明与测试数据,可校正对签名前检查有效性的判断。

  15. arXiv cs.CR78

    可重放工具智能体审计收据联合绑定声明、证据与执行,并在 1,280 次跨对象攻击中检测出 1,275 次替换。

    论文提出可重放工具智能体审计收据,联合绑定声明、来源片段、执行前缀和来源版本。它针对的问题不是引用或执行日志单独无效,而是两者都形式有效时,声明仍可能被移植到不同声明、动作、运行或来源版本。该合同把展示给用户的 claim 与产生它的 committed execution 和 cited source 关联起来,使审计不再只检查引用和 trace 是否 well formed。 收据包含 emission anchor,用于在 committed answer 或 claim-bearing action 中定位 claim,并携带 source identifiers、offsets、hashes、quotes 和 domain-separated execution commitment。确定性 integrity verifier 在语义或任务标签 join 前重建这些绑定,并把 integrity plane 与可插拔 support plane 分开,避免把结构有效性当作 entailment 的代理。论文列出七个可独立测试属性,包括 claim-emission binding、source binding、ordered-execution binding、oracle separation、persisted-object replay、execution-rerun consistency 和 version/access binding。 在 1,280 次 cross-object attacks 中,联合合同检测出 1,275 次 substitutions,检测率为 0.9961;移除某个 targeted property 后,对应攻击检测率降到 0.0156-0.0625。在独立 adjudicated 的 384-pair split 上,conflict-aware support guard 的 F1 为 0.8865,false acceptance 为 0.0729;在 unseen failure families 上分别为 0.8679 和 0.0938。事实是论文报告了这些指标;推断是,对需要引用可追溯的 Agent 产品,审计重点应从引用和日志是否完整转向声明、执行与来源版本是否同一;猜测是,实际部署需要维护 source version、access state 和 execution commitment,可能增加工程成本,但能降低跨对象替换造成的误导风险。

    推荐理由:它把工具智能体的引用、执行与来源版本绑定为可重放收据,能校正只查日志和引用是否有效的审计判断。

  16. arXiv cs.AI78

    Sapien 提出状态化策略引擎以约束自主 AI Agent 的工具调用序列

    Sapien 是一个用于自主 AI Agent 的状态化策略引擎,通过把任务特定策略编码为带状态谓词、延迟策略生成和作用域语义检查的扩展正则表达式,来约束 Agent 的多步工具调用序列。 论文给出的结果显示,Sapien 在保持与无约束 Agent 相差不超过几个百分点的效用的同时,即使 Agent 被完全劫持,也能在 AgentDojo 上排除 93-95% 的攻击,在 Toolathlon 上排除 62-85% 的攻击;在长程任务中,这一拦截比例是工具白名单的两倍。 事实是论文提出了策略表示与评测结果。可以推断,这说明多步 Agent 安全不能只依赖静态允许列表,而需要结合已发生动作和已获知上下文做状态化裁决;对 Agent 产品而言,这类引擎可能成为工具调用层的安全中间件。尚不确定的是其在真实生产环境中的策略编写成本与延迟开销,原文摘要未提供这些细节。

    推荐理由:它把 Agent 安全从静态工具白名单推进到状态化策略引擎,可改变对长程任务防御方案的选型判断。

  17. arXiv cs.AI68

    论文发现在受限信号通道中,对抗鲁棒最优信号与显著性极点几乎完全重合

    这篇论文研究当知情对手与受众共享受限信号通道时,最能保护真实答案的信号策略。作者在 108 个确认性条目上发现,对抗鲁棒最优信号与先前工作提出的显著性极点完全一致;在 200,000 个条目池中,两者只在 2,748 个条目上不同,而这些条目恰好是先前显著性到贝叶斯坐标未定义的位置。 作者将对手引入一个强制选择任务,该任务抽象自 Deception: Murder in Hong Kong。对手知道目标、观察信号,并使用说服预算 beta 为最强错误答案辩护。随着 beta 增大,最优信号从最大化后验的选项转向最大化边界的选项;当 beta = 0 时,游戏复现原始 oracle 模型,且监听者温度为 tau = 1。论文称 18.2% 的条目在有限预算下最优选项会移动,并且每个条目都有精确的临界预算。 这种重合对经验评测形成结构性限制。两种对手框架使七个语言模型在 108 个条目中的 30 到 77 个条目上改变选择,但没有任何测量能判断这种移动是朝向对抗感知最优,还是朝向显著性,因为两个选项相同。论文将这一点定义为结构性限制而非空结果,并建议在评估对抗感知前先验证鲁棒目标是否与启发式目标重合。

    推荐理由:它提醒评测者先检查对抗最优目标是否与启发式目标重合,否则无法区分模型是在对抗感知还是显著性偏置。

  18. arXiv cs.AI78

    论文发现角色分工 QA 中推理链主要改变验证判断而非答案准确率

    这篇论文研究在角色分工 QA 流程中,reasoner 向 verifier 传递的 rationale 究竟提供了什么。作者在固定证据和候选答案的前提下,只改变跨边界传递的 rationale,并在 400 条 MuSiQue、HotpotQA 和 2WikiMultiHopQA 样本上用 DeepSeek 同时作为生成器和验证器进行测试。 结果显示,忠实 rationale 相比不传 rationale 对答案准确率几乎没有提升;但被破坏的 rationale 会显著改变 verifier 对支持关系的判断。盲验证提示下,无害改写只让支持判断偏移 0–2.5%,破坏性 rationale 则偏移 10–22%;显式 rationale-checking 提示会把同一模式放大到 34–55%。最终答案变化较小,为 2–30%,且只有 2.9–35.3% 的被破坏支持翻转同时伴随答案变化。人工审计进一步显示,42 个有效破坏样本中有 16 个属于 corruption-overtrust,而模型接受的 10 条被破坏 rationale 中有 9 条被人工拒绝或标记为不清楚。 该研究给出的事实是,rationale 共享不应只被评估为提高答案准确率的通道,更应被当作验证消息机制来评估。由此可以推断,多智能体 QA 或 Agent 流水线如果直接透传推理链,可能引入新的失败面:验证器会被表面连贯但实质损坏的解释牵引,而不是独立复核证据。论文中的跨模型与任务边界检查还表明,这一通道何时被放大、何时失效,取决于具体提示和任务结构。

    推荐理由:它把 rationale 传递从“提升答案”重新界定为“验证消息干预”,可改变多智能体 QA 中是否该透传推理链的设计判断。

  19. Hacker News · AI84

    dowbench 开源扫描 LLM Agent 工具定义中的成本放大风险

    dowbench 是一个开源离线工具,读取 LLM Agent 的工具定义,扫描可能导致 denial-of-wallet 成本放大的结构,例如无结果上限、无分页上限、把先前输出回传为输入字段,以及缺少调用预算。扫描不调用模型 API、不需要 key,也不产生费用;它给出的结论是模式匹配,而不是对实际账单的预测。 项目背后还有一个可复现基准:攻击、防御和模型组成矩阵,用 provider 计费的 token 和美元成本评分。材料给出的早期试点显示,在 gemini-3.5-flash-lite 上,bloat-verify-001 攻击把单次任务成本放大到基线的约 8.8 倍;在测试的五种防御中,只有 result_cap 能阻止该攻击,并把攻击成功率降到 0%,对正常任务的额外成本约 +1.1%。材料同时说明这些样本量只有 1 到 5,属于方向性结果,不是稳定费率。 对做 Agent 产品的团队,事实层面的启示是:成本攻击不一定需要复杂提示词注入,一个返回外部数据但没有 size/limit 参数的工具,就可能通过一次大结果撑爆上下文并推高计费输入 token。推断是,把结果上限、分页上限和调用预算写进工具层,比只依赖 turn_limit 或 token_budget 更贴近这类攻击路径。猜测是,这类扫描可能成为 Agent CI 安全检查的一部分,但材料中的基准仍处于 alpha 和早期试点阶段。

    推荐理由:它把 Agent 成本攻击从红队叙事落到可复现实验:无界工具结果可放大账单,result_cap 是当前低成本防御。

  20. Hacker News · AI82

    Soothsay 用确定性静态分析在运行前检查 curl | sh 安装脚本并可拦截 Claude Code

    Soothsay 是一个开源的 shell 安装脚本静态分析工具,用于在运行 curl | sh 之前解释脚本会对机器做什么。它以单个 Rust 二进制发布,可作为命令行工具、CI 检查,或 Claude Code 的 PreToolUse hook,在 AI 编码 Agent 尝试运行网络下载脚本时先阻断、审查并要求人工批准。 材料给出的关键机制是“审查后运行已审查字节”:soothsay 下载脚本、生成报告并保存对应 sha256 的副本,随后用 --run --expect-sha256 运行同一份字节,避免服务器在审查后向管道返回不同内容。它还提供 --diff 比较两个版本的行为变化,以及 --cloak-check 检查服务器是否对 curl 和浏览器提供不同脚本。作为 Claude Code hook 时,普通 curl | sh 会被改写为固定哈希的运行命令并附带审查结果;在 bypassPermissions、auto、dontAsk 等不提示模式下则直接阻断。 作者强调它不是沙箱,而是建议性静态分析,不能审查脚本后续下载的二进制文件,也可能被运行时拼接命令绕过。事实是它用 tokenizer 和解析器识别 remote-exec、obfuscation、secrets、persistence、rc-edit 等类别,并把无法看穿的调用标为 blind spots。推断是这类工具的价值在于给 Agent 加确定性执行边界:模型可以解释脚本,但是否允许运行由外部策略和哈希固定决定。

    推荐理由:它把 AI Agent 执行 curl | sh 的安全审查从模型判断改成确定性静态分析,可作为 Claude Code hook 或 CI 策略直接落地。