AlphaGo核心成员Thore Graepel离开DeepMind,主张以AlphaGo式搜索架构替代大模型思维链来实现真正机器推理
核心概要
AlphaGo核心成员Thore Graepel以2016年首尔对局中第37手为例,论证该手棋来自AlphaGo的搜索机制而非直觉,并指出当今大语言模型仅靠下一词元预测与思维链并不构成科学家意义上的推理,进而提出应借鉴AlphaGo的博弈树结构,为通用推理系统建立可显式检查、可随证据更新的认知状态,并由独立组件按“是否真正消解不确定性”评估每一步推理。
深度剖析
文章重新解释了AlphaGo第37手:策略网络认为这一手很普通,专家人类下出的概率约为万分之一,真正选择它的是搜索机制,即显式构建并搜索包含数千分支的博弈树,权衡各候选着法的未来后果。 流行叙事把第37手当作“纯机器直觉”的闪光,作者作为AlphaGo团队成员指出这是误读,创造性来自推理(搜索)而非直觉。 属于第一手参与者叙述与机制说明,给出策略网络概率量级与博弈树分支规模,但未提供新的实验数据或对照。
文章把AlphaGo类比为Kahneman的双系统理论:神经网络提供直觉(这一手看起来有希望、这个局面看起来赢了),搜索提供审慎(对着法与应手进行检验),两者缺一不可。 将机器架构与行为科学的双系统框架对应起来,为“直觉加审慎”的混合结构提供具体机器实例。 概念类比与机制描述,引用的是既有理论框架,非新实证结果。
文章指出当今大语言模型本质上是逐词元预测,相当于只运行System 1;思维链虽在数学与编程上带来真实收益,但中间推理仍由同一套下一词元预测过程生成,只是迭代更久,并未引入真正独立的推理机制。 把“思维链等于推理”的常见假设区分为“同一过程的延长”与“独立推理机制”,并给出三项具体差距:缺乏显式持久可检查的认知状态、知识与操作知识在权重中纠缠、思维链常是事后编造。 以架构层面的论证为主,引用“研究已表明”聊天机器人常事后编造推理链,但文中未给出具体研究名称、样本或数据。
文章提出替代方案:像AlphaGo维护博弈树那样,通用推理系统应维护一个认知状态,记录已确定、存疑、已排除与仍开放的问题,推理即改变该状态的一系列动作(推导后果、拆分问题、决定下一步问什么、算什么、做什么实验),并由独立组件按“是否真正消解不确定性”评估每一步,仅在证据支持时更新信念。 把AlphaGo的博弈树数据结构推广为开放世界中的认知状态与信念修正机制,并强调可审计性,作者称之为“打了兴奋剂的科学方法”。 属于立场性提案与设计原则,作者同时承认开放世界推理比棋类更难:状态仅部分可知、动作集合大且可变、后果随机或未知;文中未给出原型系统或评测结果。
启示与展望
文章面向的是关心AI可信性与科学发现的读者,尤其是医学、工程与科研等高风险应用场景的从业者。它给出的是一套设计方向而非成品:把AlphaGo的博弈树思路推广为通用推理系统的认知状态,让推理成为可审计的证据、推断与信念修正序列,并借助大语言模型提出解题思路、通过API或代码调用工具、评估主张是否有证据支持。作者明确表示该方案适用于开放世界问题,同时承认开放世界比棋类更难,因此这套思路更适合作为研究与系统设计的起点,而非可直接部署的现成方案。
读者仍需留意:文章对“聊天机器人常事后编造思维链”只以“研究已表明”带过,未给出具体研究、样本或数据,因此这一断言的适用范围需要读者自行追溯原始文献。所提认知状态与独立评估组件的方案没有原型系统、评测指标或与现有方法的对比,其可行性、成本与在部分可观测、随机后果环境中的表现仍是开放问题。此外,文章对“推理”的定义以科学家式标准展开,与工程实践中更宽泛的用法不同,读者在跨语境引用时需注意这一差异。
