arXiv cs.CL· Santhosh Kumar Kasa, Siva Rajesh Kasa, Sumit Negi·· 6 小时前AI 评分68
同一文本不同预测:文本分类器在服务上下文中的非确定性现象
Same Text, Different Prediction: Serving-Context Nondeterminism in Text Classifiers
AI 摘要
该论文系统研究了在固定模型检查点和输入文本的情况下,批量大小、硬件或推理引擎等部署环境变化如何导致文本分类器的预测结果发生漂移。研究发现,标签稳定性并不等同于分数稳定性,仅改变批量形状在fp32精度下不会改变标签,但在bf16精度下可导致高达56.7个百分点的预测概率质量移动,且标签变化主要集中在置信度较小的样本上。
研究对比了判别式、伪生成式和全生成式三种分类器形式,发现全生成式分类器在相同的部署变更下比判别式分类器产生更多的标签变化。作者推导了每种部署变更下的标签稳定性充分条件,并针对浮点非结合性、形状依赖的内核选择等数值执行层面的实现差异提出了具体的缓解机制。
事实层面确认了文本分类服务存在显著的非确定性风险;推断层面表明当前依赖单一推理配置的分类系统可能缺乏鲁棒性,需将部署参数纳入验证范围;猜测层面认为若未明确控制这些变量,自动化评估基准和线上监控系统的可靠性将受到挑战。
来源:arXiv cs.CL · arxiv.org