跳到正文
原文
Hacker News · AI· sonabinu·· 8 小时前AI 评分63

斯坦福新书提出 AI 测量科学框架,将评估重构为推断潜在能力的统计问题

AI Measurement Science

AI 摘要

斯坦福 AIMS Lab 发布《AI Measurement Science》教材,核心主张是将 AI 评估从收集数据集并计算指标的流程,重新定义为从观测响应中推断系统潜在属性(如推理、规划、安全)的统计推断问题。该书由 Truong 和 Koyejo 撰写,旨在解决当前基准测试出现速度快于理论刻画、排行榜缺乏明确标度定义、平均准确率无法解释成败原因等现状。

书中构建了完整的概率模型体系,包括项目反应理论(IRT)、Bradley-Terry 成对比较模型及因子模型,用于分解测量误差并设计能提取更多信息的评估方案。特别地,第 5 章通过方差分解定义了信度为人力贡献的方差占比,并指出 LLM-as-a-judge 中的系统性偏差(如位置偏差)可能具有高度信度却逃过常规分析;第 10 章引入 Goodhart 定律的经济视角,分析当基准成为优化目标时,构建者与评估者如何博弈导致信号失真。

该材料区分了事实与方法论推论:事实层面提供了 70+ 基准的分类图谱及具体的统计估计方法(如最大似然估计、贝叶斯推断);推论层面指出若忽略这些测量学基础,行业对模型能力的认知将建立在不可靠的噪声之上;猜测层面认为随着基准被广泛优化,未来评估将更多依赖机制设计与对抗性测试来维持有效性。

来源:Hacker News · AI · aimslab.stanford.edu