arXiv cs.CR· Xingru Zhou, Luis Sentis, Aarti Choudhary·· 3 小时前AI 评分70
SAFESHIELD 论文证明小模型部署安全取决于决策组织与协调而非仅靠单一防护组件
SAFESHIELD: A Decision-Organization Framework for Deployment-Time Safety of Small Language Models
AI 摘要
该论文提出 SAFESHIELD 框架,将语言模型的部署时安全重新定义为决策组织问题,核心在于责任分解与显式协调。系统针对小语言模型设计了准入、路由、证据和发布四个决策环节,并通过可审计的决策轨迹记录所有承诺的决策。研究通过机制级实验、聚合阶段消融及受控协调消融验证了该框架的有效性。
关键数据来自受控协调消融实验:在保留各防护组件能力的情况下,切断其依赖关系会导致显著性能下降。移除准入门控使误放率大幅上升;若向发布决策 withhold(扣留)上游证据,发布准确率从 96.0% 降至 69.5%。这直接证明了端到端安全性不仅取决于单个 guardrails 的能力,更依赖于它们之间的组织与协作方式。
事实层面,该研究证实了决策链条中信息传递的完整性对最终安全结果具有决定性作用。推断层面,这意味着单纯堆砌更多独立的输入过滤或输出拦截工具可能无法解决复杂的安全漏洞,必须引入系统级的决策编排逻辑。猜测层面,对于资源受限的小模型场景,这种轻量级的决策组织框架可能比训练大型对齐模型更具工程性价比,但具体实施成本需结合企业现有架构评估。
来源:arXiv cs.CR · arxiv.org