跳到主要内容
返回时间线
OpenAI来源发表:

MentalHealthBench:面向真实心理健康对话的开放评测基准

核心概要

该工作与来自22个国家的80多位持证心理健康专家共同构建了开放基准MentalHealthBench,用隐私保护技术生成的合成心理健康对话覆盖非急性、高急性与紧急三类情境以及成人、13-17岁青少年、照护者和临床医生四类用户,由专家撰写权重从-10到+10的评分细则(每条对话至少三位专家评审、仅保留至少两人同意且无第三人反对的条目),并用自动评分器GPT‑5.6 Sol对模型回答打分,结果显示AI系统在帮助人们应对心理健康情境方面持续进步,且模型能力可分解为十个行为维度,其中“恰当追问背景”的能力随模型迭代而提升。

AI-generated editorial illustration: Introducing MentalHealthBench

深度剖析

提出并开放发布MentalHealthBench,把心理健康场景下的模型评测从以紧急情境和宽泛预设标准为主,扩展到覆盖非急性、高急性和紧急三类情境的完整谱系。 原文指出以往评测“主要聚焦紧急场景”并使用“宽泛、预设的标准”,该基准改为按每条对话逐条撰写专家细则,从而能判断回答是否与针对该情境的专家指导一致,而不只是是否避免了被禁止的回答。 基准由80多位来自22个国家、使用19种语言、覆盖近20个心理健康亚专科的持证心理学家与精神科医生共同创建,每条对话至少经三位专家评审。

建立了可解释的多维评分体系:专家为每条对话的最后一条用户消息撰写单点细则,权重从-10到+10,正向奖励有益行为、负向惩罚有害行为,数值越大代表临床重要性越高。 相较笼统的成功判定,该设计把“问对问题”“给出最佳建议”等具体行为拆成独立条目并赋予临床权重,使总分可分解为十个心理健康行为维度。 细则仅保留至少两位专家同意且未被第三位专家否定的条目,因此最终评分反映的是专家共识;评分由自动评分器GPT‑5.6 Sol依据专家细则完成。

在基准上评测多种模型后发现AI系统在心理健康情境中的表现稳步提升,并观察到“恰当追问背景”的能力随模型更先进而增强。 原文将这一提升归因于OpenAI及其他模型提供方在改进模型处理心理健康对话方式上的投入,并强调总分相近的模型在十个行为维度上可能有不同强项。 结果基于对整个数据集的评测,衡量模型回答是否体现专家为该情境识别的全部理想行为并避免不理想行为;原文未给出具体分数或模型名单。

通过44位曾用AI获取心理健康或情感支持的成人(来自16个国家、14种语言)的独立分析,比较了专家指导与用户实际感受之间的异同。 用户更看重专家指导中较少强调的实用下一步建议与语气,专家则更强调收集相关背景与谨慎解读模糊情境;该分析未改变基准以专家共识为准的最终评分标准。 用户评审仅限非急性对话,以避免让参与者接触可能令人不适的高急性内容;原文说明这是与基准并行的独立分析。

启示与展望

该基准面向成人、13-17岁青少年、照护者与临床医生四类用户,覆盖非急性、高急性与紧急三类情境,适用于多语言与多地区设置;其评分以专家共识为准,用于衡量模型回答是否体现专家识别的理想行为并避免不理想行为。原文明确ChatGPT不能替代治疗或专业照护,基准的用途是引导人们获得本地危机热线或可信任之人等现实支持。青少年画像通过系统消息声明年龄,这一做法旨在跨模型提供方通用,但原文说明它可能无法涵盖各产品自身内置的全部防护措施。

原文未给出各模型的具体得分、排名或评测模型清单,也未披露合成对话的数量与语言分布细节,因此无法从本文判断提升幅度的大小。用户视角分析仅覆盖非急性对话,高急性与紧急情境下用户感受与专家判断是否一致仍是开放问题。此外,评分依赖自动评分器GPT‑5.6 Sol,其与专家人工判断的一致程度、以及基准在不同模型提供方产品内置防护差异下的可比性,都是读者可持续关注的方向。

来源