arXiv cs.AI· Harry Lyu, Neil Thompson·· 4 小时前AI 评分62
论文指出LLM裁判在职业AI测量中排名一致但接受率估计严重偏离人类基准
Right Order, Wrong Scale: Auditing LLM Judges for Occupational AI Measurement
AI 摘要
该研究通过构建O*NET-BENCH审计套件,评估了33种预训练LLM裁判配置在4,501个测试评分上的表现,发现尽管25种配置在成对排序上达到至少0.60的准确率,但其估算的可接受响应比例范围极宽(3.0%-97.9%),而匹配职业的人类工人基准仅为61.1%。这一结果直接证明仅凭排序一致性无法确立对职业聚合数据的准确测量。
进一步分析显示,即使将评分协议从点式打分改为捆绑少样本/列表式协议以提升排序性能,反而降低了与任务及职业层面人类均值的一致性;交叉验证校准虽能消除平均偏差,但校准后的分数仅能解释个体工人评分变异的8.5%以内。此外,预测辅助估计在既定标签预算下仅带来微小的精度提升,且一个基于TF-IDF的简单基线模型几乎能与最强裁判相匹敌。
事实层面,研究证实了LLM裁判在排序任务上的有效性与其在绝对接受率估计上的失效并存;推断层面,这意味着当前依赖LLM裁判进行职业替代性分析或劳动力市场预测的方法存在系统性风险;猜测层面,若行业继续忽视校准问题而盲目扩大应用,可能导致对特定职业AI渗透率的误判,进而影响政策制定或企业战略部署。
来源:arXiv cs.AI · arxiv.org