arXiv cs.CR· Nizhang Li, Ian G. Harris·· 11 小时前AI 评分72
SafeDepth 提出安全感知的 token 级自适应计算框架以降低有害响应
SafeDepth: Safety-Aware Token-Level Adaptive Computation
AI 摘要
SafeDepth 是面向 Llama-3-8B-Instruct 的轻量插件框架,通过 router 和 adapter 选择性执行 Transformer 层,在减少计算的同时降低有害响应率。论文报告其相对 full-depth inference 减少计算并大体保持任务性能;与 FlexiDepth 相比,在五个 harmful-request benchmarks 上 unsafe-response rates 均下降,HarmBench-HJ 从 55.44% 降至 25.25%,XSTest false-refusal rate 从 12.0% 降至 4.0%。事实是跳层选择会改变安全表现,推断是 token 级自适应推理不能只按算力优化,猜测是这类方法可能成为推理成本与安全响应之间的工程折中。
来源:arXiv cs.CR · arxiv.org