跳到主要内容
返回时间线
arXiv来源发表:

XiangqiBench 用 119 个残局和 8568 条轨迹证明:能走出正确着法不等于能赢下对局

相关研究与后续进展

核心概要

作者提出 XiangqiBench——一个可执行的中国象棋基准,从 119 个有强制杀法的战术残局出发,要求 LLM 智能体在与引擎防守方对弈中真正将死对手,并记录 12 个前沿 LLM 在两种观测协议下的 8568 条多轮轨迹,结果发现三种看似代表能力的信号都高估了闭环成功率:26.1% 的 Sighted 试验走出存储的参考首着但仅 13.9% 获胜,领先模型 pass@3 达 38.7% 而 pass^3 仅 5.9%,32.3% 被接受的模拟调用停在非法着法上且 49.3% 的可比情形中真实防守方回应与模拟线路不同。

Source-provided article image: Finding the Move Is Not Winning the Game: XiangqiBench for Closed-Loop Evaluation of LLM Agents
Figure 1 ·

Figure 1 : XiangqiBench at a glance. Left: a task instance with the real trajectory overlaid on the initial board (numbered plies; deep red for the agent, charcoal for the defender; curves separate annotations and are not piece paths), tool availability by setting, and the scale of the evaluation. Right: the second Red decision of Gemini 3.1 Pro in Sighted trial 3 on case SQYQ-251, after real plies 1–2 (Appendix G ). The complete pre-simulation think response is shown; simulate then checks three model-specified plies, including an assumed Black reply, on a copy of the board. The defender’s actual reply informs the next decision, and the terminal Red win determines task success.

arXiv

深度剖析

论文提出 XiangqiBench,一个可执行的中国象棋闭环基准:从 119 个由引擎或仅将军搜索支持的强制杀法战术残局出发,LLM 智能体必须对引擎防守方完成将死。 与静态评测只奖励模型说出正确着法不同,该基准要求智能体在对手持续回应下把计划执行到可验证的结果,并通过交互式 REPL 接口把真实着法、状态查询与前向模拟区分开来。 基于 119 个残局、12 个前沿 LLM、两种观测协议下记录的 8568 条多轮轨迹。

论文报告了“转化差距”:模型在 26.1% 的 Sighted 试验中走出存储的参考首着,但这些试验中只有 13.9% 最终获胜。 这说明识别正确着法与在对手回应下完成将死是两种不同的能力,静态评测会高估闭环成功。 来自 Sighted 协议下的试验统计,比较了走出参考首着的比例与这些试验的最终胜率。

论文报告了“一致性差距”:领先模型达到 38.7% 的 pass@3,但 pass^3 只有 5.9%,在它曾经获胜的 46 个局面中只有 7 个三次试验全部获胜。 这把覆盖率与可靠性区分开来,表明单次成功并不代表稳定可重复的成功。 基于领先模型在多次试验中的 pass@3 与 pass^3 对比,以及 46 个曾获胜局面中 7 个三次全胜的计数。

论文报告了“模拟差距”:32.3% 被接受的模拟调用停在非法着法上,且在 49.3% 的可比情形中真实防守方的回应与智能体模拟的线路不同。 这表明智能体自撰的推演即使能检查合法性,也无法预判对手的实际回应,因此模拟能力本身不足以支撑闭环成功。 基于被接受模拟调用的非法着法比例,以及可比情形中真实回应与模拟线路不一致的比例。

启示与展望

该工作面向中国象棋战术残局中的强制杀法场景,适用于需要在对手回应下把计划执行到可验证结果的智能体评测;其 REPL 接口把真实着法、状态查询与前向模拟分开,便于在受控条件下比较不同观测协议下的表现。对希望设计闭环评测、区分覆盖率与可靠性的研究者与工程师,这一基准提供了可直接复用的任务形式与统计口径。

摘要层面呈现的是总体统计,读者可能仍会关注不同模型、不同残局难度与两种观测协议之间的差异细节,以及模拟调用被接受与非法着法判定之间的具体关系;这些在正文的图表与轨迹分析中才能进一步看清。此外,闭环成功与可靠性并重的评测结论在其他棋类或非棋类交互任务上的适用范围,仍是值得继续观察的开放问题。

来源