大语言模型通过可解释机制预测人类社会行为
核心概要
本研究提出 MindEvolve 这一自主工作流,让多个大语言模型针对涵盖经济偏好、社会偏好、社会推理(心理理论)与递归规划四类社会认知领域的社会经济博弈生成可解释的符号化认知模型,并由人类专家评估其可解释性与理论一致性,结果显示多数模型在较简单策略情境下能稳健捕捉经济与社会偏好、部分模型甚至提出比人类专家整合更广知识的新模型,但对更复杂心理过程的建模能力仍有限,而部分最先进模型在心理理论与递归规划等高阶推理上展现出有前景的表现。
深度剖析
提出 MindEvolve 自主工作流,用大语言模型生成可解释的符号化认知模型来预测社会互动中的行为,而非仅做行为模仿。 以往工作多强调行为模仿,对决策背后认知机制的透明、可解释建模关注有限;该工作把重点转向生成可解释的符号模型。 论文以自主工作流的形式提出并系统评估该思路,属于方法层面的贡献,具体实现细节在所提供的摘要性文本中未展开。
在覆盖经济偏好、社会偏好、社会推理(心理理论)与递归规划四类社会认知领域的一组社会经济博弈上,系统评估了多个大语言模型的建模能力。 将评估范围扩展到四类核心社会认知领域,而非单一博弈或单一偏好维度。 评估基于一组社会经济博弈任务,覆盖四个领域,属于多任务、多模型的系统性评测设计。
多数大语言模型在相对简单的策略情境中能稳健捕捉经济与社会偏好,部分模型还能生成整合更广知识、超越人类专家所提模型的新模型。 表明大语言模型不只是复现既有偏好结构,还可能提出具有新意、知识整合更广的符号模型。 结论来自对多个模型的评测,并由人类专家评估其可解释性与理论一致性;具体模型数量与评估者规模在所提供的文本中未给出。
对更复杂心理过程的建模能力仍有限,但部分最先进模型在心理理论与递归规划等高阶推理上表现有前景。 区分了简单偏好建模与高阶推理建模两类能力,指出后者是当前的能力边界与潜在突破点。 该判断基于同一批博弈任务中不同认知领域的对比结果,属于能力分层描述而非单一指标结论。
启示与展望
该工作面向社会互动中的行为预测,适用于以社会经济博弈为载体的社会认知研究场景,其价值在于为研究者提供可解释的符号化认知模型与专家评估路径;对希望借助大语言模型构建可检验认知假设、并关注模型可解释性的研究者与理论构建者最为相关。
所提供文本为摘要性内容,未包含具体模型清单、博弈任务细节、专家评估者数量与评分方式,也未给出各领域表现的量化对比;因此不同认知领域之间能力差异的具体幅度、以及“部分最先进模型”的具体范围,仍需查阅原文的图表与实验细节才能确认。
