跳到正文
原文
arXiv cs.CR· Ines Ortega-Fernandez, Mateusz Kowalczyk, Keri Warr·· 5 小时前AI 评分68

arXiv 论文提出一种可 anytime 验证的 LLM 权重窃取检测方法

Anytime-valid detection of LLM weight exfiltration

AI 摘要

该论文针对 compromised LLM inference server 通过编码 payload bits 到 token 选择中泄露模型权重的攻击,提出了一种 prompt-level e-process 方法。该方法通过在可信良性流量上校准整体响应不匹配事件,并在无界监控时间窗口内控制任何误报概率,从而在存在良性数值非确定性的情况下实现序列证据累积。

评估显示,该方法在四个模型上针对 seed-blind 和更强的 seed-aware 攻击(仅在 near-ties 处隐藏 payload bits 以保持隐蔽)进行了测试。与硬性的单 token 报警相比,e-process 能够结合弱证据 across responses,同时提供显式的 anytime false-alarm control。论文分析了信道容量与可检测性之间的权衡关系。

事实层面,这是一篇发表于 arXiv cs.CR 的论文,已被 NeurIPS 2026 workshop E-Values: From Statistics to ML 接受为口头报告。推断层面,该工作表明单纯依赖单次响应的异常检测在面对精心设计的隐蔽攻击时可能失效,需要跨多次交互的统计校准机制。猜测层面,该方法在实际部署中的计算开销和对不同模型架构的泛化能力仍需进一步验证,目前仅基于四个模型的实验结果。

来源:arXiv cs.CR · arxiv.org