arXiv cs.CR· Amit Singh Bhatti, Vishal Vaddina·· 10 小时前精选AI 评分78
LLM 安全路由评测在分布偏移下失效,最优基线选择会制造虚假下限
False Floors: LLM Safety Routing Evaluations Break Under Distribution Shift
AI 导读
LLM 安全路由评测在分布偏移下会因用测试数据选择最优单模型基线而失效,导致路由收益被高估。事实是,在 HELM Safety 中,随机切分下选择成本为 0.003-0.030 的 harm,留出类别下为 0.045-0.113,接近被归因于路由的整体缺口;AgentDojo 在留出 suite 时该成本上升七到九倍,七个预注册语料中三个通过区间检验、四个胜过后续置换零假设,且四个区间未通过中有三个是某些模型观察 harm 为零的语料。推断是,若按分布偏移且不用测试标签选择基线,现有路由在这些基准上的净收益很小,多数池单元中嵌套路由仍服务诚实基线模型,AgentDojo 近乎饱和时完美预调度路由最多值两个 harm 点;同时,攻击者知道面对哪个模型时,GPT-5.4 的 judged recognition 下降 19.6 点,说明基于识别的防御需要按攻击者选择输入来评估。猜测是,该偏差可能影响其他以测试集选比较器的安全路由评测,但原文只给出这些基准和语料,不能外推到未测系统。
推荐理由
它提示安全路由评测若用测试集选最优基线会高估收益,应改用分布偏移下无标签基线,并重新评估路由价值。
来源:arXiv cs.CR · arxiv.org