跳到正文
热点事件持续更新

XiangqiBench揭示LLM Agent在象棋闭环评估中存在显著能力缺口

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

2026年10月5日,研究团队发布XiangqiBench基准,旨在衡量LLM Agent从走出正确第一步到达成验证结果的能力。该基准基于119个引擎支持的强制将死残局,记录了12个前沿LLM在两种观察协议下的8,568条多轮轨迹。分析发现三个关键信号严重高估了模型的闭环成功,其中包括转化差距(Conversion Gap),即模型在可见测试中按存储参数行动与实际执行结果存在差异。

AI 根据报道生成 · 3 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月5日
  1. arXiv cs.CL
    XiangqiBench 揭示大语言模型在象棋闭环评估中存在显著能力缺口

    该研究提出 XiangqiBench,一个基于中国象棋的闭环可执行基准,旨在衡量 LLM Agent 从“走出正确第一步”到“达成验证结果”的真实能力差异。研究基于 119 个由引擎支持的强制将死残局,要求 Agent 对抗引擎防守方完成将死,并记录了 12 个前沿 LLM 在两种观察协议下的 8,568 条多轮轨迹。 分析发现三个关键信号严重高估了模型的闭环成功:一是转化差距(Conversion Gap),模型在可见测试中按存储参考走出首步的比例为 26.1%,但其中仅 13.9% 最终获胜;二是一致性差距(Consistency Gap),领先模型在 pass@3 指标上达到 38.7%,但在连续三次试验均获胜的 pass^3 指标上仅为 5.9%,且仅在 46 个位置中的 7 个实现了全胜;三是模拟差距(Simulation Gap),32.3% 的接受模拟调用因非法移动而停止,且在 49.3% 的可比案例中,真实防守方的回应与 Agent 模拟的线路不同,表明自撰推演虽能检查合法性却无法预判对手。 事实层面,该基准通过交互式 REPL 接口分离了真实移动、状态查询和前向模拟,量化了上述三个差距的具体数值。推断层面,这表明当前主流评估方法若仅关注单步决策或静态路径匹配,会系统性高估 Agent 在动态对抗环境中的可靠性。猜测层面,未来 Agent 评估体系需从单一覆盖率转向同时报告闭环结果与可靠性指标,否则无法准确反映模型在复杂任务中的实际表现。

本事件热度走势

当前热度 9·可比范围峰值 10(10月5日 13:00)·近 24 小时可比范围变化 –

02.557.51010月5日13:0010月5日14:0010月5日14:0010月5日15:00

趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。