跳到主要内容

研究进展

相关研究与后续进展

同一研究事件下的公开文章与后续进展。

arXiv

XiangqiBench 用 119 个残局和 8568 条轨迹证明:能走出正确着法不等于能赢下对局

作者提出 XiangqiBench——一个可执行的中国象棋基准,从 119 个有强制杀法的战术残局出发,要求 LLM 智能体在与引擎防守方对弈中真正将死对手,并记录 12 个前沿 LLM 在两种观测协议下的 8568 条多轮轨迹,结果发现三种看似代表能力的信号都高估了闭环成功率:26.1% 的 Sighted 试验走出存储的参考首着但仅 13.9% 获胜,领先模型 pass@3 达 38.7% 而 pass^3 仅 5.9%,32.3% 被接受的模拟调用停在非法着法上且 49.3% 的可比情形中真实防守方回应与模拟线路不同。