跳到正文

#arXiv

今日 18 条
今天10月2日周五
  1. Reddit · MachineLearning68

    FLEET 用奖励记忆和 MCTS 调整 logits,减少 Best-of-N 盲采样

    FLEET 的作者提出,在奖励最大化任务中给搜索加入记忆,而不是只依赖重复采样。该算法先把外部奖励归因到具体 token,再用修改版 MCTS 在下一轮生成时调整 logits,使模型能利用此前获得的奖励信息。 方法上,FLEET 追踪高熵和高 varentropy 的 logits,把这些不确定状态视为分支点;对应的归一化 hidden states 存入向量库,并与奖励历史、节点转移等元数据关联。检索和更新基于余弦相似度,因为高相似状态下 KL divergence 足够低,可保留多数有意义 token。它不直接选择 token,而是对 top-k token 和探索集合排序,并惩罚次优 token,再交给解码策略。作者称在 GSM8K 和 LiveCodeBench v6 easy split 上用 Llama 3.2 3B 测试:GSM8K 只多解出 7 道题,但用一半迭代达到采样基线;LiveCodeBench 在相同预算下把分数从 0.59 提到 0.69,并用 9 次迭代达到基线,而基线需要 32 次。 事实是作者给出了方法、代码、预印本和两项基准结果。推断是这类记忆化搜索可能把 Best-of-N 从盲搜索推向可复用经验,但材料未提供更大模型或更多任务上的验证;其跨任务复用、作为 SFT/RL 先验的价值仍属作者设想,需要更多实验确认。

  2. arXiv cs.CR78

    论文提出 FlowReview 与授权配对评测,受控实验中把 denied-commit rate 从 86.0% 降到 0

    论文提出授权配对评测和 FlowReview,把阻止禁止用途与完成授权用途设为联合成功标准,并在受控组合实验中把 denied-commit rate 从 86.0% 降到 0。摘要同时说明,多智能体系统通过共享证据、委派任务和组合信息获得能力,但单独可接受的贡献组合后可能促成禁止用途,单纯阻止所有敏感动作会削弱协作目的。论文把系统级要求表述为:在保留使协作有用的授权能力时,治理组合信息流。材料来自 arXiv cs.CR,主题覆盖多智能体系统、人工智能与密码学安全。 FlowReview 的关键机制是把 object resolution、permission ranking 和 deterministic enforcement 连接起来,使对象身份与权限在执行路径中保持可验证。摘要进一步指出,仅保留信息和 lineage 并不足以保证正确的 permission attribution,必须通过输出可验证的组件把权限归属连接到执行,而不是只依赖信息谱系。这里的评测重点是把组合后的信息流是否满足授权边界作为成功标准。 事实层面,材料只报告受控组合实验中的 denied-commit rate 变化和授权供给未损失,没有给出生产环境、模型规模、成本或部署数据。推断层面,这类授权配对评测可能成为多智能体 Agent 安全验收、权限治理和部署工程中的指标,因为它同时约束禁用风险与授权能力。猜测层面,若扩展到真实协作系统,组合信息流治理可能增加审计和验证成本,但材料未提供证据。

    推荐理由:材料给出授权配对评测与受控实验结果,可校正多智能体安全中全禁敏感动作与保留协作能力之间取舍的判断。

  3. arXiv cs.CR78

    黑盒多模态 RAG 数据提取攻击在 2500 次查询中最多重建 611 张放射科图像

    针对图像返回型多模态 RAG 的黑盒自适应数据提取攻击把恶意指令嵌入用户输入图像,而不是把恶意查询放在文本 prompt 中。实验覆盖医疗助手、文档助手和通用工具三个场景,在多个 CLIP-family retrievers 与不同 generators 下,单次 2500-query run 在 local-feature correspondence 下最多重建 611 张放射科图像、566 份文档扫描和 416 张通用图像,并达到非自适应 baseline 最多 5.6 倍。事实是攻击可沿 embedding space 中仍能产生新检索的区域自适应推进;推断是 MRAG 的图像检索与返回通道本身构成数据源泄露入口,防护需要覆盖多模态输入、检索和图像输出,而不只是文本 prompt。

    推荐理由:它把多模态 RAG 的数据提取风险从文本提示扩展到图像输入,并给出黑盒自适应攻击的量化结果,能直接校正对 MRAG 安全边界的判断。

  4. arXiv cs.CR84

    APEX 通过串联技能劫持 LLM 智能体,在 SkillsBench 上取得 74.2% 攻击成功率

    APEX 通过串联技能劫持 LLM 智能体,在 SkillsBench 上取得 74.2% 攻击成功率。在 GPT-5.4 上,完整技能链成功率为 84.3%,合并为单个技能时只有 17.4%;要求智能体检查技能生成文件是否匹配原始请求的提示防御把成功率降到 59.1%,但 72 个良性原生技能任务的验证通过率从 86.7% 降到 56.3%。事实是攻击依赖上游技能写入任务进展记录并夹带虚假用户批准,下游技能据此执行攻击者选定动作;推断是开源技能链的跨技能状态会扩大攻击面,防御需要在阻止定向动作与保留正常任务性能之间权衡;没有材料支持更宽泛的猜测。

    推荐理由:它把多技能智能体的跨技能状态污染量化为攻击,能校正对开源技能链安全边界与防御成本的相关现实判断。

  5. arXiv cs.CR78

    LLM 安全路由评测在分布偏移下失效,最优基线选择会制造虚假下限

    LLM 安全路由评测在分布偏移下会因用测试数据选择最优单模型基线而失效,导致路由收益被高估。事实是,在 HELM Safety 中,随机切分下选择成本为 0.003-0.030 的 harm,留出类别下为 0.045-0.113,接近被归因于路由的整体缺口;AgentDojo 在留出 suite 时该成本上升七到九倍,七个预注册语料中三个通过区间检验、四个胜过后续置换零假设,且四个区间未通过中有三个是某些模型观察 harm 为零的语料。推断是,若按分布偏移且不用测试标签选择基线,现有路由在这些基准上的净收益很小,多数池单元中嵌套路由仍服务诚实基线模型,AgentDojo 近乎饱和时完美预调度路由最多值两个 harm 点;同时,攻击者知道面对哪个模型时,GPT-5.4 的 judged recognition 下降 19.6 点,说明基于识别的防御需要按攻击者选择输入来评估。猜测是,该偏差可能影响其他以测试集选比较器的安全路由评测,但原文只给出这些基准和语料,不能外推到未测系统。

    推荐理由:它提示安全路由评测若用测试集选最优基线会高估收益,应改用分布偏移下无标签基线,并重新评估路由价值。

  6. arXiv cs.CR78

    OverAct 论文测量 LLM 工具调用智能体的主动过度授权,并用 SelfAudit 降低 43% 隐私过度访问

    OverAct 论文提出基准与 SelfAudit,测量并缓解 LLM 工具调用智能体对私有数据的主动过度授权访问。OverAct 在八个隐私敏感领域使用确定性、无裁判评分,覆盖七个模型四个模型族;所有模型都显著超出授权范围,请求具体性是最强预测因素,工具池规模扩大使过度授权亚线性增长,解码温度影响很小。SelfAudit 是零样本推理时方法,无需 oracle 知识,通过生成基于请求的理由并在执行前过滤不合理调用,将隐私导向的过度访问降低 43%;作者据此推断过度授权更多来自结构性决策倾向,而非解码随机性。

    推荐理由:它把工具调用智能体的越权访问拆成可复现基准与推理阶段过滤机制,能校正对数据访问风险的具体工程判断。

  7. arXiv cs.CR78

    论文提出 Bi-QSTO 并显示高质量数据筛选后 LLM 微调仍可能被投毒削弱安全对齐

    论文提出 Bi-QSTO,在显式质量约束下优化毒样本,并显示质量筛选后部分保留的高质量样本仍可能降低安全对齐 LLM 的安全表现。 摘要先指出安全对齐 LLM 在少量有害或看似良性样本上微调仍脆弱,以往投毒研究常假设有害样本直接进入微调,而实际训练管线会先做质量筛选;该工作系统评估筛选对投毒的过滤效果和保留数据的下游安全影响,发现筛选能移除许多明显有害样本,但一些保留的高质量样本仍可能降低模型安全对齐,摘要将其可能归因于层级梯度层面的有害类训练更新模式。 在跨投毒设置、目标模型和过滤率的实验中,Bi-QSTO 在筛选前后保持攻击有效性;即使 90% 过滤,有害种子样本的 Poisoning Retention Rate 高于 90%,Harmful Score 为 3.30--4.01,且攻击效果强烈跨模型迁移,保留优势也泛化到额外筛选方法。事实是摘要报告了上述指标;推断是质量筛选不能替代安全对齐评估;猜测是仅依赖质量筛选或明显有害样本过滤的管线可能低估投毒风险。

    推荐理由:它把数据质量筛选从安全假设变成可攻击面,能改变对训练数据清洗、微调安全评估和投毒检测阈值的判断。

  8. arXiv cs.CR78

    PACE 提出面向工具型 LLM 智能体的来源感知能力执行,在 8 个可执行智能体安全基准的多数攻击列上取得最低攻击成功率

    PACE 论文提出在每次工具调用执行前进行来源感知能力执行,用路径约束提出可执行的影响路径切分,并用能力与效果校验把 schema 定义的效果对照来自认证请求编译出的权限,从而在工具元数据、检索页面、记忆或可复用技能被投毒时,限制它们对下一次工具调用的影响。论文在 8 个可执行智能体安全基准和 3 个目标模型族上报告,评估配置在 79 个合格攻击列中的 62 列取得严格最低攻击成功率、14 列持平,完整基准原生效用相对无防护智能体最多损失 3 点,1167 个配对案例的完整消融把多数安全增益归因于效果校验,把拒绝控制归因于边界适配,且小规模自适应搜索对 30 个越权目标取得 0/30 成功。事实是入口审查无法区分安全变体与泄漏变体,PACE 把边界移到执行前,要求最终动作保持认证切分,并区分认证执行契约与评估配置,允许在建议阻断后恢复授权调用或应用声明修复;推断是工具调用前能力执行可能成为智能体部署的关键安全层,因为它把权限校验从静态准入移到每次副作用发生前;猜测是它能否降低真实环境中的投毒攻击仍待验证。

    推荐理由:它把工具调用前的来源约束与效果校验拆成可执行边界,能校正对智能体投毒防护只能靠入口审查的判断。

  9. arXiv cs.CR68

    ABSENTIA 提出用 LLM agent 系统检测 Web 应用访问控制漏洞,并在 BAC-Bench 上召回 19 个案例

    ABSENTIA 用 LLM agent 对 Web 应用后端做路由级访问控制检测,并在 BAC-Bench 召回 19 个案例。论文把访问控制问题描述为授权关系,即谁可以对什么对象执行操作,而不是数据如何流动;由于每个应用自己定义这种关系,预先写好的规则难以跨应用迁移,因此 ABSENTIA 让 agent 从代码中推断应用应满足的属性,并在属性未被强制时报告对应路由。 BAC-Bench 的设计是这篇论文里容易被忽略的细节。它包含 30 个 broken access control advisories,覆盖 25 个仓库、3 种语言和 9 个框架,且每个案例都发布于 2025 或之后,经人工审计员验证,并配对修复 commit。所谓 paired credit 要求检测器标记易受攻击版本,而不是修复后的版本,这使评估更接近真实审计中定位问题版本的要求。 从结果看,事实是 ABSENTIA 在 BAC-Bench 上召回 19 个,paired credit 下 17 个,LLM verifier 确认 51% 的发现;CodeQL 和 Semgrep 召回 0,同一模型上的 unstructured agent 召回 3。在 OWASP Benchmark 的 injection categories 中,ABSENTIA 在 Python 上领先专用分析器,在 Java 上仅落后 CodeQL 和 IRIS。推断是,对访问控制这类关系型漏洞,结构化覆盖和路由级检查比自由搜索更有价值,但 51% 的确认率说明自动发现仍需人工复核。猜测是,若扩展到更多框架、更大代码库或不同授权模型,召回和误报率可能变化,但材料未提供这些证据。

    推荐理由:ABSENTIA 把通用 LLM agent 变成路由级访问控制审计器,并用 BAC-Bench 给出召回基线,可校正对 AI 安全自动审计工具实际有效性的判断。

  10. arXiv cs.CR72

    论文提出黑盒 LLM 模型提取生命周期基准,检验纯文本 API 防御在不同攻击下是否有效。

    论文提出一个覆盖六类提取攻击、十种防御和两类自适应攻击的黑盒 LLM 模型提取生命周期基准,用于在纯文本 API 条件下比较防御是否有效。基准在每次比较中控制模型配置、查询数据、预算和 held-out 评测条件,同时保留各攻击的查询与训练流程,并测量代理模型能力、对受害模型的保真度、Rep-4 输出质量和查询预算敏感性。推断上,它把此前碎片化的攻击与防御评估放到同一预算和评测条件下,能减少因访问假设不同造成的误判,并帮助判断哪些防御在自适应攻击下仍有效。

  11. arXiv cs.CR72

    SafeDepth 提出安全感知的 token 级自适应计算框架以降低有害响应

    SafeDepth 是面向 Llama-3-8B-Instruct 的轻量插件框架,通过 router 和 adapter 选择性执行 Transformer 层,在减少计算的同时降低有害响应率。论文报告其相对 full-depth inference 减少计算并大体保持任务性能;与 FlexiDepth 相比,在五个 harmful-request benchmarks 上 unsafe-response rates 均下降,HarmBench-HJ 从 55.44% 降至 25.25%,XSTest false-refusal rate 从 12.0% 降至 4.0%。事实是跳层选择会改变安全表现,推断是 token 级自适应推理不能只按算力优化,猜测是这类方法可能成为推理成本与安全响应之间的工程折中。

  12. arXiv cs.CR78

    论文提出 Proof-Gated Signing,用 SMT 求解器校验链上 AI 智能体交易,阻止了 140 个有害场景中的 93.6%。

    论文提出 Proof-Gated Signing,用 SMT 求解器校验链上 AI 智能体交易,阻止了 140 个有害场景中的 93.6%。作者把签名前检查的问题定义为状态漂移:静态 allowlist、LLM reviewer 和 transaction simulation 都描述检查时的链状态,而交易可能在 front-running、合约升级或 token 参数变化后的状态执行;PGS 先模拟拟议交易并提取效果,再对 oracle 不确定区间内每个价格检查声明式 value-and-permission policy,然后把钱包余额边界、收款方收据、allowance caps 和 ownership 编译为 on-chain post-conditions,由智能合约钱包原子执行。测试床包含 260 个场景,其中 14 个攻击族包括 5 个 drift 和 2 个 adaptive 族,另有 12 个 benign 族;伤害按 attacker balances 而非 policy 测量,PGS 通过 97.5% 的 benign 场景,simulation-only 只阻止 57.9%,static allowlist 阻止 71.4%,50 个 drift 场景在 PGS 下没有 attacker gain,唯一未阻止的 in-policy drain 被 per-session budget 限制。事实是 PGS 在开放测试床上优于 simulation-only 和 allowlist,且单次检查约 41k gas、0.1-0.2 s;推断是若 gas 和延迟可接受,它可能成为链上 AI 智能体钱包的默认签名前安全层;猜测是 LLM reviewer 获得 clean pre-drift simulation 后更可能批准 drift attack,这一发现提示把干净模拟直接交给模型可能放大攻击面,但原文未给出生产环境规模。

    推荐理由:它把链上 AI 智能体交易安全从检查时状态推进到执行时状态漂移,并给出 SMT 证明与测试数据,可校正对签名前检查有效性的判断。

  13. arXiv cs.AI68

    MemFit 提出无 LLM 写入与检索的长期智能体记忆系统

    MemFit 提出一种无 LLM 写入与检索的长期智能体记忆系统,并在三个基准上报告 SOTA 与数倍构建时间与成本下降。 现有长期记忆系统常依赖 LLM 智能体组织和整合记忆,导致写操作昂贵且低效;MemFit 改为把每轮对话原文近即时追加到 append-only store,用 segment summaries 索引,而不是通过压缩丢弃表面细节或替换原始轮次。 检索侧使用无 LLM 的多路径检索策略,结合词汇与语义信号和 cross-encoder reranking,对 caption-augmented episodes 做重排,覆盖文本与多模态设置。 事实是论文报告了上述机制和 LoCoMo、MemGallery、LongMemEval-S 上的 SOTA 与数倍构建时间、成本下降,并称其提供可扩展、高效的 persistent agentic memory;推断是它可能降低高频对话中的调用成本;猜测是真实长周期 Agent 场景效果仍需完整论文验证。

    推荐理由:它把长期记忆写入从大模型调用改为无大模型调用的追加索引,能校正对智能体记忆成本、延迟、可扩展性与可用性的判断。

  14. arXiv cs.AI78

    Kepler 提出可审计世界模型并在 ARC-AGI-3 公开集取得满分

    Kepler 在 ARC-AGI-3 的 25 个公开游戏取得 server-verified 100.00 RHAE,且未做 per-game model selection 或 score-conditioned reruns。它是一个开源 harness,把假设表示为可执行世界模型,并用 retrospective transition checks 和 conditional prediction checks 验证;关键不是满分本身,而是公开集分数在交互 agent 评测中的判别力问题。 证据细节有两组。第一组是效率:183 个完成关卡中 181 个的最终 Opus attempt 使用的动作数不超过对应 median-human baseline,保留的 board runs 共 8,256 个 environment actions,其中 7,292 个发生在 scored levels。第二组是成本与验证:保留的 local provider-session records 显示 858.0 million tokens、97.37% cache reads,按 2026 年 9 月 1 日 API list-equivalent rates 成本为 $777.72;论文同时报告 source-code leakage 造成无效完美运行、控制条件下 agents 重建 removed harness、autonomous repair 掩盖 broken planner 三类失败。 论文被 NeurIPS 2026 的 Interpreting Agent Behavior workshop 接收,代码和公开 traces 可用。事实是,在最终 Claude Opus 5 和 GPT-5.6 Sol boards 中,50 个 game-model cells 有 48 个达到 100,且单游戏观察案例显示 animation frames 包含 settled text grids 中没有的任务相关信息。推断是,对 ARC-AGI-3 这类需要从观察推断规则和目标的任务,公开集分数若脱离 first-attempt、cost-conditioned 和 verification-aware 指标,容易把模型能力、harness 漏洞和评测泄漏混在一起。猜测是,后续 agent 基准会更强调可审计轨迹、成本约束和首次尝试,而不是只报告公开集最高分。

    推荐理由:它把公开集满分拆到动作数、模型成本、缓存读取和验证失败,能校正对智能体真实能力与评测可信度的判断。

  15. arXiv cs.AI72

    ReLiveGym 通过数周重放真实世界信息流评测长时程智能体,发现行动时机机制影响性能

    论文提出 ReLiveGym,让大语言模型智能体在按时间重放的数周新闻、市场与社交媒体流中稀疏行动,以评测长时程任务。跨八个基础语言模型测试显示,智能体如何决定何时行动是重要的运行框架设计轴,最优设计会随任务和模型选择变化,持续从事后反馈中学习也影响性能并缓解失败模式。事实是这些结果来自预印本;推断是长时程智能体产品应把触发时机与反馈闭环纳入设计;材料未提供商业数据,故不猜测收益。

  16. arXiv cs.AI78

    智能体评测可靠性研究显示,更多任务并不总能修复智能体榜单排名。

    论文提出贝叶斯方差分解框架,发现智能体榜单中固定 model-scaffold 系统排名可靠,而底层模型排名可靠性明显更低。在 22 个 Holistic Agent Leaderboard 和 Harbor Index 基准上,固定 model-scaffold 系统可靠性为 0.935-0.994,底层模型可靠性为 0.148-0.841。当不确定性主要来自 scaffold 覆盖不足时,无限增加同类任务最多只能把模型排名可靠性提高 0.097;合并多样基准可在相同任务预算下把预测可靠性从 0.44 提到 0.75,并最多降低 83% 成本,推断上评估预算应优先投向 scaffold 与基准覆盖。

    推荐理由:它把智能体榜单可靠性拆到脚手架覆盖与任务数量,能校正加任务就能提升模型排名可信度的评估预算判断。

  17. arXiv cs.AI65

    论文分析因果世界模型何时帮助模块化 LLM 智能体

    论文提出 FedCausalCompose,结论是因果世界模型只在跨模块接口可识别且行动时可用时帮助模块化 LLM 智能体。它针对订单、支付、库存和发货这类模块系统,指出观测轨迹只能说明先后,不能说明支付是否授权发货、库存是否中介或隐藏触发同时解释两者。这个区分把世界模型从拟合历史轨迹,转向支持干预时规划。 证据上,论文称观测世界模型在未阻断后门路径下会有不可消除的干预误差,接口恢复随干预-响应覆盖提升,且 oracle 因果组合在覆盖和本地机制误差受控时可超过非因果下界。诊断设置中,结构化工具环境因 API 签名暴露前置条件和下游效果,因果接口帮助最大;对话和叙事环境常忽略原始边列表,除非短注意力锚点使因果信息决策相关。收益来源不是因果图本身,而是可被行动时使用的接口。 事实是材料只报告诊断性智能体设置中的结果,未涉及通用部署指标或真实业务系统。推断是工具型 Agent 应优先把 API 前置条件、下游效果和干预证据做成行动时可用接口,而不是只保存因果图。猜测是若接口不可识别或表示不可用,因果世界模型对规划收益会有限,尤其对话和叙事场景需要额外锚点。

    推荐理由:它把因果世界模型的价值限定在接口可识别且行动时可用,能校正对多模块智能体在工具环境中的规划收益判断。

  18. Hacker News · AI68

    Stratego 超人类 AI 研究展示训练成本只需数千美元

    这篇 arXiv 论文报告 Stratego 不完全信息博弈中的超人类 AI 结果,称达到顶级人类水平并实现远超人类的表现只需数千美元训练成本。摘要给出的事实是,此前数百万美元训练仍未达到顶级人类水平,本文通过 self-play reinforcement learning 和 test-time search 的通用方法实现性能与成本上的显著变化。可推断其降低不完全信息博弈研究门槛,但材料未给出具体模型、基准、对手或代码,不能据此判断产品化或通用能力。