OpenAI 2026年9月23日该工作与来自22个国家的80多位持证心理健康专家共同构建了开放基准MentalHealthBench,用隐私保护技术生成的合成心理健康对话覆盖非急性、高急性与紧急三类情境以及成人、13-17岁青少年、照护者和临床医生四类用户,由专家撰写权重从-10到+10的评分细则(每条对话至少三位专家评审、仅保留至少两人同意且无第三人反对的条目),并用自动评分器GPT‑5.6 Sol对模型回答打分,结果显示AI系统在帮助人们应对心理健康情境方面持续进步,且模型能力可分解为十个行为维度,其中“恰当追问背景”的能力随模型迭代而提升。该工作与来自22个国家的80多位持证心理健康专家共同构建了开放基准MentalHealthBench,用隐私保护技术生成的合成心理健康对话覆盖非急性、高急性与紧急三类情境以及成人、13-17岁青少年、照护者和临床医生四类用户,由专家撰写权重从-10到+10的评分细则(每条对话至少三位专家评审、仅保留至少两人同意且无第三人反对的条目),并用自动评分器GPT‑5.6 Sol对模型回答打分,结果显示AI系统在帮助人们应对心理健康情境方面持续进步,且模型能力可分解为十个行为维度,其中“恰当追问背景”的能力随模型迭代而提升。MentalHealthBench:面向真实心理健康对话的开放评测基准该工作与来自22个国家的80多位持证心理健康专家共同构建了开放基准MentalHealthBench,用隐私保护技术生成的合成心理健康对话覆盖非急性、高急性与紧急三类情境以及成人、13-17岁青少年、照护者和临床医生四类用户,由专家撰写权重从-10到+10的评分细则(每条对话至少三位专家评审、仅保留至少两人同意且无第三人反对的条目),并用自动评分器GPT‑5.6 Sol对模型回答打分,结果显示AI系统在帮助人们应对心理健康情境方面持续进步,且模型能力可分解为十个行为维度,其中“恰当追问背景”的能力随模型迭代而提升。该工作与来自22个国家的80多位持证心理健康专家共同构建了开放基准MentalHealthBench,用隐私保护技术生成的合成心理健康对话覆盖非急性、高急性与紧急三类情境以及成人、13-17岁青少年、照护者和临床医生四类用户,由专家撰写权重从-10到+10的评分细则(每条对话至少三位专家评审、仅保留至少两人同意且无第三人反对的条目),并用自动评分器GPT‑5.6 Sol对模型回答打分,结果显示AI系统在帮助人们应对心理健康情境方面持续进步,且模型能力可分解为十个行为维度,其中“恰当追问背景”的能力随模型迭代而提升。