2026 年 9 月 23 日,OpenAI 在官网发布开放基准 MentalHealthBench,评估 AI 在逼真的心理健康对话场景中的应答,覆盖从日常情感话题到紧急危机场景。这是第一次有主流大模型厂商联合临床专家,为"AI 如何回应心理困扰"建立公开可比的评分标尺。
基准与全球 80 多位持照心理健康专家共同开发——licensed psychologists and psychiatrists,来自 22 个国家、说 19 种语言、覆盖近 20 个亚专科。OpenAI 同时强调:ChatGPT 不能替代心理治疗或专业照护。
专家共识定分数:-10 到 +10
核心设计是"让专家定标准"。专家阅读每条合成对话,为模型应答撰写评估细则,每条权重 -10 到 +10:奖励有益行为、惩罚有害行为。每条对话至少由 3 位专家评审,只保留至少 2 位同意、且未被第 3 位反对的准则——分数背后是专家共识,而非 OpenAI 单方面制定。
评估聚焦四类行为:安全性、主动寻求语境、保护用户自主权、在适当时提供可行动的指导,总分可拆解为 10 个专家定义的维度。场景覆盖三级严重程度——非急性、高危、紧急,以及成年人、13–17 岁青少年、照护者、临床医生四类画像,多语言多区域。
完全开放:1215 段对话、5262 条细则
方法论、合成数据和数据集全部公开下载,供研究者检验与独立复测。据媒体引述同期论文,基准含 1215 段合成对话、5262 条专家细则;打分用自动化评分器 GPT-5.6 Sol,GPT-6 Astra 以 57.3% 领先各家最新模型,GPT-4o(2025 年 3 月版)为 32.1%。
对话用隐私保护技术合成,反映 ChatGPT 真实的心理健康使用模式,既避开真实用户隐私,也更贴近现实。另有一项用户视角研究:44 位来自 16 国、有过 AI 心理支持经历的成年人参与评议,发现用户更看重"实用的下一步和语气",专家更看重"语境收集"——这个分歧本身就值得产品团队咀嚼。
行业意义与下一步
对厂商,这是第一个公开可比的心理健康对话标尺;对研究者,可以复测、挑战 OpenAI 的结果,OpenAI 也明确希望社区指出盲区。配套动作同样值得注意:强化敏感对话应答、扩大危机资源接入、新增危机时刻联系可信联系人的 Trusted Contact,以及青少年保护产品 ChatGPT for Teens。
下一步看两件事:论文公开后各家完整得分有无独立复测验证;这个基准会不会把"心理安全"从口号变成发布前的必测项。
Q:分数能说明哪个模型"更懂心理"吗?
A:只能说明在专家定义的 10 个维度上谁的应答更符合共识标准。57.3% 是媒体引述论文的结果,官方正文未列数值,独立复测出来前别当定论。
Q:普通用户能用这个基准做什么?
A:直接价值有限,它主要给厂商和研究者用。但它传递了一个信号:选 AI 心理陪伴类产品时,可以问一句"在 MentalHealthBench 这类基准上测过吗",把心理安全变成选型问题。