跳到正文

#开源生态

今日 9 条
今天10月2日周五
  1. Reddit · MachineLearning68

    FLEET 用奖励记忆和 MCTS 调整 logits,减少 Best-of-N 盲采样

    FLEET 的作者提出,在奖励最大化任务中给搜索加入记忆,而不是只依赖重复采样。该算法先把外部奖励归因到具体 token,再用修改版 MCTS 在下一轮生成时调整 logits,使模型能利用此前获得的奖励信息。 方法上,FLEET 追踪高熵和高 varentropy 的 logits,把这些不确定状态视为分支点;对应的归一化 hidden states 存入向量库,并与奖励历史、节点转移等元数据关联。检索和更新基于余弦相似度,因为高相似状态下 KL divergence 足够低,可保留多数有意义 token。它不直接选择 token,而是对 top-k token 和探索集合排序,并惩罚次优 token,再交给解码策略。作者称在 GSM8K 和 LiveCodeBench v6 easy split 上用 Llama 3.2 3B 测试:GSM8K 只多解出 7 道题,但用一半迭代达到采样基线;LiveCodeBench 在相同预算下把分数从 0.59 提到 0.69,并用 9 次迭代达到基线,而基线需要 32 次。 事实是作者给出了方法、代码、预印本和两项基准结果。推断是这类记忆化搜索可能把 Best-of-N 从盲搜索推向可复用经验,但材料未提供更大模型或更多任务上的验证;其跨任务复用、作为 SFT/RL 先验的价值仍属作者设想,需要更多实验确认。

  2. arXiv cs.CR84

    APEX 通过串联技能劫持 LLM 智能体,在 SkillsBench 上取得 74.2% 攻击成功率

    APEX 通过串联技能劫持 LLM 智能体,在 SkillsBench 上取得 74.2% 攻击成功率。在 GPT-5.4 上,完整技能链成功率为 84.3%,合并为单个技能时只有 17.4%;要求智能体检查技能生成文件是否匹配原始请求的提示防御把成功率降到 59.1%,但 72 个良性原生技能任务的验证通过率从 86.7% 降到 56.3%。事实是攻击依赖上游技能写入任务进展记录并夹带虚假用户批准,下游技能据此执行攻击者选定动作;推断是开源技能链的跨技能状态会扩大攻击面,防御需要在阻止定向动作与保留正常任务性能之间权衡;没有材料支持更宽泛的猜测。

    推荐理由:它把多技能智能体的跨技能状态污染量化为攻击,能校正对开源技能链安全边界与防御成本的相关现实判断。

  3. arXiv cs.CR78

    一篇 arXiv 论文提出用分类法对齐的 LLM 框架检测 OSS 供应链攻击

    该论文提出一个面向开源软件供应链威胁的分类法对齐大语言模型框架,用于自动检测和分类 typosquatting、dependency confusion、Trojan Source obfuscation、malicious build injection 与 CI/CD pipeline poisoning 等攻击。作者构建了覆盖 2018 至 2026 年的 999 条已验证真实事件数据集,来源包括 GitHub Security Advisories、CISA alerts 和安全研究报告。 使用 GPT-4 并结合分类法对齐提示工程后,该框架在五类威胁上的多分类准确率和 macro F1 均为 97.0%。对照实验中,微调后的 Llama 3.1 8B 为 70.5%,SecRoBERTa 为 77.5%,均低于简单 TF-IDF 分类器的 82.3%;未做分类法对齐的 Mistral 7B 只有 65.7%。论文据此认为,在该任务中,分类法对齐的提示工程比模型规模、领域预训练或微调更关键。 事实是论文给出了数据集、基线和准确率结果,并公开代码与数据。推断是若该结果可复现,开源安全检测工具可以先用结构化分类法和提示工程提升分类效果,而不是优先投入微调。猜测是这一结论是否适用于更复杂或跨语言的供应链攻击场景,仍需更多外部验证。

    推荐理由:论文显示分类准确率主要由分类法对齐的提示工程驱动,而非模型规模或微调,可影响安全检测系统的选型判断。

  4. arXiv cs.CR68

    MOMAT 用多图集混合与 CiM 加速为量化 LLM 提供低功耗越狱防御

    MOMAT 是一个面向端侧量化大语言模型的安全框架,通过结构化知识检索和低功耗硬件加速来抵御越狱攻击。论文指出,量化会削弱大语言模型的对齐保护,使 qLLM 更容易被越狱;MOMAT 的应对方式不是单纯扩大安全数据库,而是把有害与良性样本、策略模板组织成多个语义图集,再对每条 prompt 做跨图集 top-k 检索和轻量 MoE 检测。 细节上,MOMAT 将检索任务放进 CiM 存内计算加速引擎执行,论文给出的对比数据显示,100 条查询批处理从 15,052.44 ms 降到 3,207.21 ns,能耗从 8.1×10^7 μJ 降到 3.32 μJ,相对 DRAM 基线分别获得约 4.69×10^6 倍加速和约 2.5×10^5 倍能耗下降。作者同时称红队评测中其防御效果与现有方法相当,并减少误伤良性请求,还计划开放 223.2k 样本数据集。 事实是论文提出了图集化 RAG 防护、MoE 检测与 CiM 检索的组合,并报告了显著效率指标;推断是这种模块化硬件路径可能更适合端侧 qLLM 的实时安全过滤;猜测是若 CiM 硬件可得且数据集有效,该方案可能影响边缘设备上的安全部署架构。

    推荐理由:它把量化模型越狱防御从软件检索转向 CiM 硬件加速,可能改变端侧安全方案对延迟与能耗的取舍判断。

  5. arXiv cs.AI72

    VeriHarness 用智能体验证机制提升长程任务的输出选择与修订效果

    VeriHarness 在固定基础模型、测试时没有参考答案或评分标准的条件下,把生成器使用的 LLM 转成带工作区、证据工具和可复用验证技能的智能体验证器,用于长程任务输出的选择与修订。论文在五个长程工作区基准和两个前沿模型上测试,称其选择得分高于已评估基线;加入证据支持的修订后,相比单次 rollout,Gemini 3.5 Flash 平均提升 6.2 分,Claude Opus 4.8 平均提升 6.4 分。 方法上的关键判断是:多次采样产生的分歧常能暴露正确替代项,而共识可能掩盖错误。因此系统不是简单投票,而是设置两个角色:disagreement resolver 用环境证据检查竞争声明,consensus challenger 测试共同声明并寻找遗漏要求;验证结果再指导最终产物的选择和修订。论文还称验证技能可以从失败反馈中自我改进,并公开约 26,000 条跨五个基准、两个模型的 rollout,称生成成本超过 $100,000。 事实是论文报告了选择得分、修订增益、模型名称、基准数量和公开数据规模。推断是这套设计把验证从静态评分转向可调用证据的工作流,可能更适合长程任务的错误定位。猜测是其收益是否能在更多模型、任务和真实生产环境中保持,仍需看外部复现。

  6. arXiv cs.AI42

    OSCAR 框架如何路由 LLM 提升优化建模准确率

    OSCAR 框架通过模拟器、编码器和审查器协同工作,利用两个可本地部署的小参数开源大语言模型在五个基准问题上实现 95% 至 100% 的准确率。相比 Codex 和 Claude Code,该方案将单次尝试的平均 Token 成本分别降低 3.1 倍和 5.8 倍。系统支持根据预算和保密需求在本地或云端运行,并依据标记决策示例自动修正模型对业务规则的误解。

  7. arXiv cs.AI78

    Kepler 提出可审计世界模型并在 ARC-AGI-3 公开集取得满分

    Kepler 在 ARC-AGI-3 的 25 个公开游戏取得 server-verified 100.00 RHAE,且未做 per-game model selection 或 score-conditioned reruns。它是一个开源 harness,把假设表示为可执行世界模型,并用 retrospective transition checks 和 conditional prediction checks 验证;关键不是满分本身,而是公开集分数在交互 agent 评测中的判别力问题。 证据细节有两组。第一组是效率:183 个完成关卡中 181 个的最终 Opus attempt 使用的动作数不超过对应 median-human baseline,保留的 board runs 共 8,256 个 environment actions,其中 7,292 个发生在 scored levels。第二组是成本与验证:保留的 local provider-session records 显示 858.0 million tokens、97.37% cache reads,按 2026 年 9 月 1 日 API list-equivalent rates 成本为 $777.72;论文同时报告 source-code leakage 造成无效完美运行、控制条件下 agents 重建 removed harness、autonomous repair 掩盖 broken planner 三类失败。 论文被 NeurIPS 2026 的 Interpreting Agent Behavior workshop 接收,代码和公开 traces 可用。事实是,在最终 Claude Opus 5 和 GPT-5.6 Sol boards 中,50 个 game-model cells 有 48 个达到 100,且单游戏观察案例显示 animation frames 包含 settled text grids 中没有的任务相关信息。推断是,对 ARC-AGI-3 这类需要从观察推断规则和目标的任务,公开集分数若脱离 first-attempt、cost-conditioned 和 verification-aware 指标,容易把模型能力、harness 漏洞和评测泄漏混在一起。猜测是,后续 agent 基准会更强调可审计轨迹、成本约束和首次尝试,而不是只报告公开集最高分。

    推荐理由:它把公开集满分拆到动作数、模型成本、缓存读取和验证失败,能校正对智能体真实能力与评测可信度的判断。

  8. arXiv cs.AI42

    Build2SPARQL:构建知识图谱查询的大规模文本到 SPARQL 基准数据集

    Build2SPARQL 发布了包含 6,136 个可执行 SPARQL 查询和 30,680 个自然语言问题的建筑领域大规模基准数据集。该数据通过图遍历代码生成查询并由大语言模型生成问题,经人工验证语义保真度达 98.8%。在三个开源权重语言模型上的评估显示,检索增强后精确匹配准确率从零样本的 0.2-20% 提升至三样本的 56-65%。

  9. arXiv cs.AI78

    论文测量现成 SLM 在 Agent 微任务上的资格缺口:16 个 Qwen3 配置均未达阈值

    这篇 arXiv 论文测试现成小语言模型能否在 Agent harness 中承担围绕主 LLM 规划器的微任务,例如自动批准 shell 命令、写入记忆、选择工具和排序历史轮次。作者构建了 4 个固定提示、自动指标和预设阈值的基准,阈值锚定廉价非 LLM baseline,并要求配置的置信区间下界超过阈值才算合格。 在不调参、仅用 FP16、greedy 和单一冻结提示的条件下,Qwen3 0.6B、1.7B、4B、8B 的 16 个任务与模型组合全部未通过,作者通过检查原始输出和 parser 行为确认结果。logprob 决策阈值诊断把失败分为能力不足和可通过改变解码阈值修复两类;4-bit 量化(RTN/GPTQ/AWQ)造成的损害取决于模型规模,但没有让任何配置达到资格,且结果在 Llama-3.x 上复现,12 个配置均不合格,对阈值扫描和提示改写也稳健。 事实层面,论文给出的核心结论是现成 SLM 不能直接通过这类微任务的严格资格门槛。推断层面,作者建议把 SLM 放在已满足阈值要求的 baseline 之后,只在 baseline 失败时调用;例如 4B 模型对 BM25 短列表重排序可提升 0.047,但它本身仍未通过资格认证。猜测层面,这意味着 Agent 系统若追求低延迟或低成本,不应把关键微任务直接交给未校准的小模型,而应设计 baseline、阈值或级联机制来兜底。

    推荐理由:它用置信区间门槛证明现成小模型在 Agent 微任务上普遍不合格,提醒不要把 SLM 直接替换关键路由层。