跳到正文
原文
arXiv cs.AI· Seyedarmin Azizi, Erfan Baghaei Potraghloo, Massoud Pedram·· 3 小时前精选AI 评分78

Jev风格类型决策模型中标签权重压倒定义规则导致分类偏差

Labels Override Definitions in Jev-Style Typed Decision Models

AI 导读

该研究通过实测四个开源加权类型决策模型发现,当选项标签与书面定义冲突时,Qwen2.5骨干模型生成的概率分布主要遵循标签而非定义,这种现象被作者称为“选项 - 标签偏差”。在十一项分类任务和作者引入的合成路由套件PolicyBench中,删除所有定义并未降低准确率(laya-td模型从0.8487微升至0.8559),而将选项重命名为A和B则使准确率提升0.1511。

深入分析表明,这种偏差并非源于模型受限的决策头结构,而是由提示词渲染方式决定。代码库laya将选项格式化为"{label}: {definition}",而von仅写入定义;实验显示,强制统一两种格式后,laya的三个检查点完全不变,而von模型在标签与定义矛盾时准确率从0.8511暴跌至0.2281。这一发现推翻了早期归因于架构限制的结论,将问题定位到了输入处理层面。

基于此,作者提出了一个双调用测试方法,帮助从业者判断其模型属于哪种情况,并评估了四种缓解措施的有效性。事实部分确认了标签主导现象及其对定义的覆盖机制;推断部分指出这是提示工程层面的系统性缺陷;猜测部分认为若不修正渲染逻辑,任何依赖定义进行路由或审核的应用都可能面临不可控的分类错误风险。

推荐理由

揭示标签覆盖定义的现象源于提示渲染而非模型架构,为修复分类器偏差提供了可验证的测试与修正路径。

来源:arXiv cs.AI · arxiv.org