跳到正文
原文
arXiv cs.CR· Shuze Liu, Kaixiang Zhao, Runyang Xu, Jingzhi Chen, Nathan Wu, Yu Wang, Yushun Dong·· 11 小时前AI 评分72

论文提出黑盒 LLM 模型提取生命周期基准,检验纯文本 API 防御在不同攻击下是否有效。

Do Defenses Against LLM Extraction Work Across Attacks? A Lifecycle Benchmark of Black-Box Model Extraction

AI 摘要

论文提出一个覆盖六类提取攻击、十种防御和两类自适应攻击的黑盒 LLM 模型提取生命周期基准,用于在纯文本 API 条件下比较防御是否有效。基准在每次比较中控制模型配置、查询数据、预算和 held-out 评测条件,同时保留各攻击的查询与训练流程,并测量代理模型能力、对受害模型的保真度、Rep-4 输出质量和查询预算敏感性。推断上,它把此前碎片化的攻击与防御评估放到同一预算和评测条件下,能减少因访问假设不同造成的误判,并帮助判断哪些防御在自适应攻击下仍有效。

来源:arXiv cs.CR · arxiv.org