arXiv cs.CR· Teng-Ruei Chen·· 5 小时前精选AI 评分80
LLM 路由元数据泄露敏感话题:基于170万次请求的测量与防御研究
Sensitive-Topic Leakage Through LLM Routing Metadata: Measurement and Mitigation
AI 导读
该研究通过实测证明,即使关闭内容日志,仅凭 LLM 路由器的选择元数据(如将请求路由至昂贵模型还是廉价模型)即可推断用户是否涉及骚扰、自杀或医疗等敏感话题。作者对 WildChat-1M 和 LMSYS-Chat-1M 共170万次真实请求进行了预注册实验,发现 RouteLLM 在50%运行点下,针对未见过的提示词,骚扰和自杀类请求被路由至强模型的频率比同类请求低19个百分点,而性相关请求则高出10个百分点。
实验进一步显示,这种差异足以构建攻击通道:仅凭20次 RouteLLM 决策记录,攻击者即可达到 AUC 0.73 的分类准确率来识别特定用户;对于频繁询问医疗问题的用户,AUC 可达 0.71。相比之下,域路由器的区分度更高,AUC 达 0.92。研究测试了多种缓解方案,包括按类别长度匹配、按对话粘性控制及按用户预算带限制,但均未能有效消除隐私泄露风险,部分方案甚至因牺牲路由准确性而失效。
事实层面,路由元数据确实构成了高信息量的隐私侧信道,且现有常见防御手段效果有限。推断层面,当前广泛采用的“不记录内容仅记录路由”架构存在严重安全隐患,不能视为默认安全状态。猜测层面,若行业继续依赖此类元数据进行成本优化,可能需要引入更复杂的噪声注入或聚合机制,但这将直接增加工程复杂度并可能降低路由效率。
推荐理由
论文揭示路由元数据可泄露敏感话题,校正了“关闭内容日志即安全”的假设。
来源:arXiv cs.CR · arxiv.org