跳到正文
原文
arXiv cs.CL· Radhika Gaonkar·· 5 小时前AI 评分70

TRACE 协议证明工具命名等评估设置改变可致 Agent 评分大幅波动

TRACE: Diagnosing Verifier Brittleness in Agentic Evaluation

AI 摘要

该研究提出 TRACE 协议,用于区分大语言模型智能体(LLM agents)在评估中分数的变化是源于真实能力提升还是评估设置本身的变动。研究发现,仅将工具名称重命名即可使脚本化智能体的得分降低 0.250,而恢复原名后分数完全回升,证明评分规则本身对结果有显著影响。

在包含 88 个新任务的更大规模复现实验中,重命名工具或重新格式化输出对七组智能体变更对的奖励分数影响不超过±0.10,但故意使用误导性工具名则导致所有智能体奖励下降 0.20-0.44。此外,相同轨迹的重复运行会导致 15-36% 的任务结果翻转,表明单次运行比较无法区分呈现效应与随机波动。两个前沿 LLM 裁判在固定轨迹下表现一致,但在同一记录上却有 57% 的分歧,主要因为一个侧重程序执行而另一个侧重最终结果。

事实层面,评估设置的微小改动(如命名、格式)足以掩盖或制造虚假的性能差异,且单次运行存在高方差。推断层面,当前广泛使用的基于验证器分数的训练奖励和基准指标可能严重失真,单纯追求分数提升未必代表智能体能力的实质性进步。猜测层面,若行业继续依赖此类不稳定的单一运行评分进行模型迭代,可能导致资源错配至优化评估鲁棒性而非真实智能行为。

来源:arXiv cs.CL · arxiv.org