arXiv cs.CR· Edward Chen, Yuntao Du·· 5 小时前AI 评分70
Qwen2.5-7B与Llama-3.2-3B实验显示蒸馏推理检测在0.02显著性水平下真阳性率达1.0
Poster: A Preliminary Study of LLM Distillation Inference
AI 摘要
该论文提出一种名为“蒸馏推理”的假设检验方法,用于判定嫌疑模型是否经过未授权的模型蒸馏训练。研究者通过训练影子模型来模拟两种假设下的行为:蒸馏影子模型学习教师的推理轨迹,独立影子模型仅学习参考答案。审计者通过测量各模型预测教师推理输出的接近程度,并利用影子模型将嫌疑模型的得分转换为校准后的p值。
在初步研究中,作者使用Qwen2.5-7B作为教师模型,以Llama-3.2-3B作为嫌疑模型进行测试。结果显示,在0.02的显著性水平下,该测试实现了1.0的真阳性率。这一结果证明了利用蒸馏推理技术检测蒸馏攻击的可行性。
事实层面,该方法依赖影子模型的行为差异和统计校准;推断层面,这表明针对专有模型的未授权蒸馏可能面临新的检测风险;猜测层面,若此方法被广泛采用,可能会改变模型提供商在知识产权保护上的技术策略,但具体实施效果需更多不同架构模型的验证。
来源:arXiv cs.CR · arxiv.org