Deep Persona 用三层人格架构与 ADOS 启发的评测框架,让两个临床模拟人格在综合基线下与人类对话统计上不可区分
核心概要
该工作提出 Deep Persona——一个把角色组织为外部表达层、中层信念层与内层动机驱动层的三层心理架构,并配合脚本化决定论与有限能动性原则,同时提出一套无参考评测框架(借鉴 ADOS 的语用流畅性、共同注意、情感一致性与情绪表达多样性指标,以及基于马氏距离的对话自然度分数 DNS);在 DailyDialog 与 CounselChat 等人类与人类—LLM 对话数据上,LLM 表现出高语用流畅性(0.88–0.97)但在情绪表达与共同注意上存在系统性差距,而两个 Deep Persona 案例(Sarah 与 Evelyn)在综合基线下 DNS 高于所有被评测的人类—LLM 数据集,并在全部对话中与人类互动统计上不可区分。
深度剖析
提出把角色建模为三层内部结构:外部层(可观察的表达、语气与情绪)、中层(仅在特定触发下显露的信念、态度与抗拒模式)、内层(从不被明说、却持续影响生成的核心动机与隐藏约束),并强调内层是最关键且反直觉的一层。 以往的角色建模多依赖扁平的角色描述或短提示,只刻画表层特质与角色设定;该工作把人格拆成可分别编码、可分别约束的层级,并明确声明这些层只是设计抽象,并非声称实例化了真正的心理构念。 属于架构与设计原则层面的贡献,论文以设计原则章节与提示模块说明支撑,并给出从领域专家访谈中抽取各层内容的维度表(叙事背景、初始情境、情绪基调、沟通模式、意识目标、半意识材料、无意识驱动、心理需求、抗拒模式、演化、变化触发点、伦理与行为边界)。
提出两条支配性原则:脚本化决定论(不依赖模型自身“智能”或训练数据来维持一致性,而把提示写成角色的详细规格,未显式编码的行为会因随机漂移而退化)与有限能动性(把模型限制在反应式、边界明确的角色上,而非需要主动领导或开放式专业能力的角色)。 与把 LLM 当作有自主判断的智能体的做法不同,该工作把提示工程者定位为导演、把 LLM 定位为执行既定角色的演员,从而降低幻觉、角色漂移与出戏。 论文以设计假设的形式陈述这两条原则,并引用长上下文使用与随机漂移相关文献作为依据;其效果主要通过后续压力测试案例(幻觉陷阱、越界请求、伦理压力源)中的具体表现来展示。
提出一套无参考评测框架:借鉴 ADOS 的维度构造自动化代理指标,包括语用流畅性与回声言语(用户—智能体词汇重叠、自我重复)、共同注意能力、情感一致性(言语内容与方括号内非言语动作的情绪向量余弦相似度)、情绪表达多样性与强度,并用马氏距离构造对话自然度分数 DNS 与统计检验。 以往工作多评估孤立回复或模型层面的语言相似性,或把检测机器生成文本当作分类任务;该框架针对交互式模拟中的情绪表达、行为一致性与对话动态,并允许对“是否与人类分布统计上不可区分”做形式化假设检验。 论文在两类人类—人类数据集(DailyDialog 13,118 段多轮对话;CounselChat 人类—人类部分 3,507 条专家回复)与三类人类—LLM 数据集(Role-Play 85 段对话、1,742 条话语;ABC-Eval 400 段开放域对话;CounselChat 人类—LLM 部分由 Mistral 7B 生成)上计算评分剖面,并报告了各数据集的均值与标准差以及不可区分对话的比例。
在两个临床相关模拟中给出初步验证:Sarah(17 岁、有自杀风险、以希伯来语与持照临床心理学家进行 49 轮自杀风险评估)与 Evelyn(受同伴压力、在校冒险吸电子烟的青少年,与家长进行 16 段、平均 13 轮的亲子心智化训练),两者均用 Gemini 2.5 Pro 实现。 论文称这是对所提架构的首次直接评测,并指出在综合基线下两个人格的 DNS 高于所有被评测的人类—LLM 数据集,且在全部对话中与人类互动统计上不可区分;Sarah 的具身表达模块在 84%(41/49)的轮次产生非言语线索,Evelyn 为 100%。 属于有限的概念验证:Sarah 为单次会话、单一临床医生,Evelyn 的互动由角色开发者本人而非陌生用户进行,且两者都没有与扁平提示基线做直接架构对比;人类—人类数据集不含非言语线索,因此这些例子的 DNS 未纳入该维度。
启示与展望
该工作面向需要长时间保持心理一致性的对话式角色模拟,尤其是心理健康与临床技能培训场景,例如自杀风险评估与亲子心智化训练;它把模型限定为反应式、边界明确的角色,而非需要主动领导或开放式专业能力的角色。对使用者而言,论文给出的可操作产物包括:从领域专家访谈中抽取角色规格的维度清单、把规格翻译成模块化提示(简介、互动结构、叙事背景与动机、三层人格、控制与逻辑、可选具身表达)的流程,以及一套可复用的无参考指标与 DNS 统计检验,用于在开发中调试角色漂移与结构违规。论文也指出,访谈与提示构建最好在角色设计者或角色预期交流所用的母语中进行,因为语域、节奏、习语与语用规范被视为角色的组成部分。
论文自身列出若干待解问题:所提指标主要应用于并非由 Deep Persona 架构生成的人类—LLM 数据集,案例研究只是有限的概念验证,Sarah 为单次会话、单一临床医生,Evelyn 的互动由角色开发者而非陌生用户进行,且两者都缺少扁平提示基线做直接架构对比。情感一致性指标需要非言语线索,而人类—人类数据集不含此类线索,因此相关 DNS 未纳入该维度;若干指标依赖情绪分类器与词典方法,跨领域与跨语言泛化尚不确定。论文还指出,当前框架把言语与非言语的情绪不一致一律视为负面信号,但在模拟病人时,这种不一致可能正是需要治疗者去推断隐藏情绪的有意设计。此外,论文强调维持角色一致性可能与安全要求冲突,高度拟人的互动存在被误用与误导的风险,在心理健康语境中模拟人格可能简化或误现复杂的心理状况。未来工作方向包括隔离各架构组件贡献的消融研究、跨更多语言与领域的验证,以及人在回路中的评测。
