跳到正文
原文
arXiv cs.CR· Adam Faulkner, Nil-Jana Akpinar, Matthew Dressman·· 6 小时前AI 评分70

CorrectGuard 提出无需访问模型内部即可评估黑盒安全护栏准确性的框架

CorrectGuard: Eyes-Off Correctness Estimation for Black-Box Security Guardrails

AI 摘要

该论文针对依赖黑盒安全护栏的 AI 服务,提出 CorrectGuard 框架以在“无人眼”和“无机器”双重限制下评估护栏决策的正确性。该方法利用独立模型基于标注数据预测输入是否被正确拦截,无需访问护栏内部机制或用户原始输入,解决了隐私保护审计中无法直接测量生产环境表现的问题。

实验覆盖 13 个涵盖有害内容、越狱、提示注入及提取的安全数据集,对比了上下文学习、嵌入和微调三种策略。结果显示,基于上下文学习的分类器在宏观准确率上提升最高达 25 个百分点,微调方法带来近 15 个百分点的提升。此外,正确性评分支持对护栏决策进行排序和拒绝,最佳排序将 AURC(平均未校准风险曲线)从 0.33-0.44 降至 0.17-0.22,并在保留 37.5%-52.0% 决策的同时将观测风险控制在 15%。

事实层面,该框架通过外部模型实现了对黑盒护栏的系统性故障暴露;推断层面,这种能力意味着企业可在不泄露用户隐私的前提下优化护栏配置;猜测层面,若此类外部评估成为行业标准,可能推动更多厂商采用隐私优先的护栏架构,但具体实施效果仍取决于各护栏与评估模型的匹配度。

来源:arXiv cs.CR · arxiv.org