LLM安全路由评估在分布偏移下失效
先了解这件事
2026年10月2日,arXiv cs.CR 发布研究称,LLM 安全路由评测在分布偏移下会失效。问题源于使用测试数据选择最优单模型基线,从而制造虚假下限,导致路由收益被高估。报道给出的事实包括:在 HELM Safety 中,随机切分下选择成本为 0.003–0.030 的 harm,留出类别下为 0.045–0.113,接近被归因于路由的整体缺口;在 AgentDojo 中,留出 suite 时该成本上升七到九倍。七个预注册语料中,三个通过区间检验,四个胜过后续置换零假设;四个区间未通过的语料中,有三个存在某些模型观察 harm 为零的情况。
AI 根据报道生成 · 2 小时前更新
报道时间线
沿着报道,了解事件的不同侧面。
- arXiv cs.CR精选LLM 安全路由评测在分布偏移下失效,最优基线选择会制造虚假下限
LLM 安全路由评测在分布偏移下会因用测试数据选择最优单模型基线而失效,导致路由收益被高估。事实是,在 HELM Safety 中,随机切分下选择成本为 0.003-0.030 的 harm,留出类别下为 0.045-0.113,接近被归因于路由的整体缺口;AgentDojo 在留出 suite 时该成本上升七到九倍,七个预注册语料中三个通过区间检验、四个胜过后续置换零假设,且四个区间未通过中有三个是某些模型观察 harm 为零的语料。推断是,若按分布偏移且不用测试标签选择基线,现有路由在这些基准上的净收益很小,多数池单元中嵌套路由仍服务诚实基线模型,AgentDojo 近乎饱和时完美预调度路由最多值两个 harm 点;同时,攻击者知道面对哪个模型时,GPT-5.4 的 judged recognition 下降 19.6 点,说明基于识别的防御需要按攻击者选择输入来评估。猜测是,该偏差可能影响其他以测试集选比较器的安全路由评测,但原文只给出这些基准和语料,不能外推到未测系统。
本事件热度走势
当前热度 7·可比范围峰值 8(10月2日 21:00)·近 24 小时可比范围变化 –
趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。