arXiv cs.AI· Rahul Sharma, Andrew B. Ducan, Ga\'etan Marceau Caron, Sebastian J. Vollmer·· 4 小时前AI 评分70
TypedBench 基准揭示系统一模型在概率校准、措辞敏感性与成本下的决策缺陷
TypedBench: A Benchmark for Calibration, Framing Sensitivity, and Cost in System One Decision Models
AI 摘要
arXiv 论文 TypedBench 提出针对输出类型化答案(如分类、有序等级或二元结果)的系统一模型的评估基准,重点考察概率校准度、框架敏感性和成本影响。该基准由七个策略标注生成器和九个评估套件构成,测试了托管模型、开源编码器及 0.8B-9B 参数范围的开源解码器家族。研究发现,托管模型虽遵循既定策略,但存在明显的措辞敏感性且系统性低估置信度;在不对称成本矩阵下,直接使用其概率进行决策的效果甚至不如直接采纳其最高概率选项。
实证细节显示,解码器在路由选择上表现精确,但随着选项或问题数量增加而显著变慢;其在策略类问题上准确率最低,且随选项增多性能下降。评估方法不仅报告了准确率的中位数和范围,还引入了相对于完美校准预测器的有限样本噪声底线的校准误差,并通过选择性预测、有序严格评分规则和实际成本来衡量概率质量。这些指标共同表明,仅依赖传统准确率无法反映模型在真实决策场景中的可靠性。
事实层面确认了当前公开数据集评估缺乏清晰参考系的问题,推断出若软件基于未校准或易受措辞影响的概率执行操作,可能导致非预期行为且缺乏可解释文本依据。推测未来工业界需将策略遵循性、措辞鲁棒性、概率质量和诱导的决策结果纳入联合评估体系,而非单独看待单一指标。此结论基于对特定模型族在特定基准上的实测数据,不适用于所有生成式模型。
来源:arXiv cs.AI · arxiv.org