跳到正文
原文
arXiv cs.CL· Yekun Chai, Qiwei Peng, Haoyi Xiong·· 4 小时前AI 评分70

XiangqiBench 揭示大语言模型在象棋闭环评估中存在显著能力缺口

Finding the Move Is Not Winning the Game: XiangqiBench for Closed-Loop Evaluation of LLM Agents

AI 摘要

该研究提出 XiangqiBench,一个基于中国象棋的闭环可执行基准,旨在衡量 LLM Agent 从“走出正确第一步”到“达成验证结果”的真实能力差异。研究基于 119 个由引擎支持的强制将死残局,要求 Agent 对抗引擎防守方完成将死,并记录了 12 个前沿 LLM 在两种观察协议下的 8,568 条多轮轨迹。

分析发现三个关键信号严重高估了模型的闭环成功:一是转化差距(Conversion Gap),模型在可见测试中按存储参考走出首步的比例为 26.1%,但其中仅 13.9% 最终获胜;二是一致性差距(Consistency Gap),领先模型在 pass@3 指标上达到 38.7%,但在连续三次试验均获胜的 pass^3 指标上仅为 5.9%,且仅在 46 个位置中的 7 个实现了全胜;三是模拟差距(Simulation Gap),32.3% 的接受模拟调用因非法移动而停止,且在 49.3% 的可比案例中,真实防守方的回应与 Agent 模拟的线路不同,表明自撰推演虽能检查合法性却无法预判对手。

事实层面,该基准通过交互式 REPL 接口分离了真实移动、状态查询和前向模拟,量化了上述三个差距的具体数值。推断层面,这表明当前主流评估方法若仅关注单步决策或静态路径匹配,会系统性高估 Agent 在动态对抗环境中的可靠性。猜测层面,未来 Agent 评估体系需从单一覆盖率转向同时报告闭环结果与可靠性指标,否则无法准确反映模型在复杂任务中的实际表现。

来源:arXiv cs.CL · arxiv.org