跳到主要内容
返回时间线
arXiv来源发表:

用工具增强的演绎推理让大语言模型“线索”更清晰

核心概要

该工作把经典桌游《Clue》改造成文本多智能体环境,用GPT-4o-mini与Gemini-2.5-Flash各三名玩家进行18局游戏,并引入一个维护“可能性矩阵”(YES/NO/MAYBE及accusation_ready信号)的外部工具来外化信念状态跟踪,结果显示工具增强玩家的指控准确率接近满分(Gemini-2.5-Flash达1.00、GPT-4o-mini达0.96),混合局中未用工具的玩家准确率也从基线约0.81/3提升到约2.71/3,但工具并未改变智能体在已知答案后仍延迟指控的决策自主性。

Source-provided article image: Clueing up LLMs with Tool-Augmented Deductive Reasoning
Figure 1 ·

Figure 1: Example turn in Clue game environment with the possibility matrix tool highlighted; the matrix records Yes, No, and Maybe values for possible cards in other players’ hands.

arXiv

深度剖析

提出并实现了一个面向交互式游戏环境的结构化“可能性矩阵”工具,包含envelope_candidates、known_cards_by_player与game_matrix三个组件,用YES/NO/MAYBE编码每张牌在每个持有者(六名玩家与信封)处的状态,并在每回合以“Use this matrix state as the authoritative belief state for this turn”注入提示。 相较以往依赖自然语言推理日志隐式维持信念状态的做法,该工具把长程记忆与演绎约束从智能体内部表征卸载到外部结构化表示,且不要求模型自身具备原生工具调用能力。 方法在18局游戏(基线、矩阵、混合各6局)中一致实施,并配有工具输出示例(如GPT4o_MINI_3的已知手牌与Rope牌的game_matrix条目),属于系统实现层面的证据。

工具增强显著提升指控准确率:矩阵局中94.5%的玩家识别出正确解,Gemini-2.5-Flash达到1.00、GPT-4o-mini达到0.96的归一化准确率,而基线局中无玩家能得出最终解,47%仅识别一张牌、36%一张都没识别对。 此前Ansell与Toney(2026)的文本版Clue中模型即使经过相关逻辑谜题的文本微调仍表现不佳,本工作表明外化信念状态可带来接近满分的表现。 基于每条件6局、共36个玩家-局观测的对比,并配有逐玩家准确率图(Figure 3);作者同时指出该提升不能归因于信息暴露增加,因为基线玩家反而更接近知识上限。

工具增强降低了错误演绎:Gemini-2.5-Flash的错误演绎从基线每局2.4降至0.1,GPT-4o-mini从2.39降至1.67;但GPT-4o-mini在两种条件下错误率相近,说明结构化输出并未对所有模型都消除无依据推理。 把“减少不一致推理”这一效果与具体模型行为差异联系起来,指出不同模型对矩阵的利用方式不同(Gemini倾向将其视为硬约束)。 基于对玩家日志的程序化标注,将每条推断与真实牌局状态比对后判定正确或错误,属于可复核的日志级证据。

结构化信念状态的好处具有外溢性:混合局中未使用工具的基线提示玩家平均准确率达2.71/3(基线局仅0.81/3),提示质量提升使共享证据对所有玩家都更有用;但混合局所有胜局均由GPT-4o-mini取得,Gemini-2.5-Flash在两种角色下均未获胜。 把工具增强的影响从“使用者自身”扩展到“同局其他智能体”,同时提示胜负可能更多受模型行为(如是否愿意指控)影响,而非是否使用矩阵。 来自混合局6局中按提示类型分层的对比,样本规模有限,作者将其表述为可能的游戏环境效应。

启示与展望

该结果面向需要跨多步维持一致信念状态的演绎推理任务,尤其是状态可被显式编码为约束矩阵的交互式环境;对使用轻量模型、希望在不做微调的情况下提升智能体表现的开发者最有直接参考价值。作者指出,可能性矩阵是围绕Clue的牌权结构专门设计的,因此其适用设定是结构清晰、约束可枚举的演绎环境,而非一般性的开放推理场景。

作者列出三点待解问题:矩阵的通用性尚未验证,是否适用于归纳或溯因推理及其他状态结构不同的演绎环境仍待考察;评估规模有限,仅两个模型家族、18局游戏,更大规模与更多模型的比较(尤其是更强的推理模型)才能判断收益是补偿轻量模型短板还是结构化信念跟踪的普遍优势;基线只对比了自然语言历史推理,尚未隔离出究竟是上下文长度缩短、显式约束表示还是记忆保持带来改进,需要摘要历史、模型自生成表格等中间基线来区分。此外,工具虽给出accusation_ready信号,玩家仍在已知解后平均延迟8.2至18.0个回合才指控,这一决策时机问题如何通过提示干预调整,仍是开放问题。

来源