跳到正文
原文
arXiv cs.CR· Hamed Khosravi, Xiaoming Huo·· 5 小时前AI 评分75

论文提出认证腐败预算机制以应对自适应操纵的AI排行榜

Certified Corruption Budgets: Anytime-Valid Leaderboard Claims under Adaptive Rigging

AI 摘要

这篇来自arXiv cs.CR的论文针对AI模型公共排行榜面临的投票操纵、选择性披露和基准污染问题,提出了“认证腐败预算”(Certified Corruption Budget)概念。该机制允许在任意时刻发布成对比较声明时附带一个容忍度参数B_t,确保在概率1-α下同时成立:要么声明正确,要么至少有B_t条记录被篡改。这一方法突破了现有保证仅假设真实记录或限制每步腐败量的局限,能够抵御攻击者通过突发式腐败来规避约束的攻击策略。

核心证据显示,该机制区分了伪造记录和修改后看到的记录两种情况,前者证书在攻击者翻转已见投票时失效概率趋近于1,而后者即使攻击者预知未来也能保持有效且成本约为前者的两倍。在Chatbot Arena的180万票回放实验中,仅需数百张操纵票即可使标准置信区间认证出错误的排序,而新提出的证书依然有效;对于真实投票数据,该证书表明明显分离的模型能抵御约2000张伪造票。此外,发布V个私有变体中的最佳者,其成本增长仅为log V量级。

事实层面,该研究提供了对抗自适应攻击的数学框架及在大规模真实数据上的验证结果。推断层面,这意味着现有的排行榜评估体系若缺乏此类动态预算机制,在面对有组织的操纵时将迅速失去公信力。猜测层面,未来行业可能被迫将此类认证机制纳入基准测试的标准流程,但具体实施成本与计算开销仍需工程实践检验。

来源:arXiv cs.CR · arxiv.org