AI 基准分数为何从 82% 实际只有 57%:金融场景下的评估偏差分析
AI Benchmark Scores: Why 82% is actually 57%
文章指出当前 AI 基准测试的 headline scores(如 APEX-Agents 上 Gemini 4 Argon 的 82.2%)往往因输入预处理和简化环境而被高估,实际在真实金融工作流中的有效能力可能需打七折至 57% 左右。作者通过对比 OfficeQA Pro 等基准发现,仅将原始 PDF 转换为干净文本这一环节就能带来 19 到 29 个百分点的分数提升,远超模型本身在同期发布的性能增益,这意味着许多高分实际上测量的是“完美提取后的推理”而非端到端处理能力。
核心偏差源于三个被忽略的工程现实:一是数据发现与检索的缺失,公开基准常预设文件路径或提供精选文档,跳过了真实尽职调查中处理数百个版本混乱、含手写批注的扫描 PDF 及复杂 Excel 模型的挑战;二是评估指标的单维性,Pass@1 平均通过率掩盖了执行方差,而 Pass^k(多次运行全通过)显示商业智能体在稳定性上存在 17 到 31 个百分点的差距,且二元评分无法区分格式错误与关键数值幻觉;三是环境与交互的简化,现有测试多在静态沙箱中进行,禁止澄清提问,且由较弱模型担任裁判,未能捕捉破坏性副作用或验证引用来源的真实性。
推论是,对于需要部署 Agent 处理长周期任务的团队,单纯依赖公开排行榜会导致严重的误判。事实层面,预解析文本确实能大幅提升分数,但这是以牺牲真实场景的鲁棒性为代价的;推断层面,当前的 SOTA 模型在未经过严格多轮验证和真实系统集成前,其自动化边界远小于榜单所示;猜测层面,若行业继续忽视 Pass^k 和引用验证标准,未来将出现大量因“看似正确实则不可靠”的输出导致的业务损失。建议建立包含随机性测试、真实数据室集成及专家复核的内部评估套件,而非盲目采信单一跑分。
材料拆解了基准测试中预解析文本与单轮运行带来的虚高,能直接校正对 Agent 在真实金融工作流中可靠性的判断。
来源:Hacker News · AI · lessuncertain.substack.com