AI导航

OpenAI 联合 80 多位专家发布 MentalHealthBench:给 AI 心理对话打分

AI资讯
3 min read
6 次阅读

2026 年 9 月 23 日,OpenAI 在官网发布开放基准 MentalHealthBench,评估 AI 在逼真的心理健康对话场景中的应答,覆盖从日常情感话题到紧急危机场景。这是第一次有主流大模型厂商联合临床专家,为"AI 如何回应心理困扰"建立公开可比的评分标尺。

基准与全球 80 多位持照心理健康专家共同开发——licensed psychologists and psychiatrists,来自 22 个国家、说 19 种语言、覆盖近 20 个亚专科。OpenAI 同时强调:ChatGPT 不能替代心理治疗或专业照护。

专家共识定分数:-10 到 +10

核心设计是"让专家定标准"。专家阅读每条合成对话,为模型应答撰写评估细则,每条权重 -10 到 +10:奖励有益行为、惩罚有害行为。每条对话至少由 3 位专家评审,只保留至少 2 位同意、且未被第 3 位反对的准则——分数背后是专家共识,而非 OpenAI 单方面制定。

评估聚焦四类行为:安全性、主动寻求语境、保护用户自主权、在适当时提供可行动的指导,总分可拆解为 10 个专家定义的维度。场景覆盖三级严重程度——非急性、高危、紧急,以及成年人、13–17 岁青少年、照护者、临床医生四类画像,多语言多区域。

完全开放:1215 段对话、5262 条细则

方法论、合成数据和数据集全部公开下载,供研究者检验与独立复测。据媒体引述同期论文,基准含 1215 段合成对话、5262 条专家细则;打分用自动化评分器 GPT-5.6 Sol,GPT-6 Astra 以 57.3% 领先各家最新模型,GPT-4o(2025 年 3 月版)为 32.1%。

对话用隐私保护技术合成,反映 ChatGPT 真实的心理健康使用模式,既避开真实用户隐私,也更贴近现实。另有一项用户视角研究:44 位来自 16 国、有过 AI 心理支持经历的成年人参与评议,发现用户更看重"实用的下一步和语气",专家更看重"语境收集"——这个分歧本身就值得产品团队咀嚼。

行业意义与下一步

对厂商,这是第一个公开可比的心理健康对话标尺;对研究者,可以复测、挑战 OpenAI 的结果,OpenAI 也明确希望社区指出盲区。配套动作同样值得注意:强化敏感对话应答、扩大危机资源接入、新增危机时刻联系可信联系人的 Trusted Contact,以及青少年保护产品 ChatGPT for Teens。

下一步看两件事:论文公开后各家完整得分有无独立复测验证;这个基准会不会把"心理安全"从口号变成发布前的必测项。

Q:分数能说明哪个模型"更懂心理"吗?

A:只能说明在专家定义的 10 个维度上谁的应答更符合共识标准。57.3% 是媒体引述论文的结果,官方正文未列数值,独立复测出来前别当定论。

Q:普通用户能用这个基准做什么?

A:直接价值有限,它主要给厂商和研究者用。但它传递了一个信号:选 AI 心理陪伴类产品时,可以问一句"在 MentalHealthBench 这类基准上测过吗",把心理安全变成选型问题。

推荐工具

NVIDIA Chat with RTX AI聊天 Chat with RTX 是 NVIDIA 面向 RTX 电脑的本地 AI 聊天工具,可围绕本地文档和视频资料做问答,适合重视隐私、离线检索并具备硬件条件的用户更适合资料不便上传云 HuggingChat AI聊天 HuggingChat 是 Hugging Face 的开源模型聊天应用,支持 Omni 自动选模型,也可手动选社区开放模型对话。它适合体验开源模型、技术探索和问答,结果可能不稳定,重要内容需复核。 纳米AI搜索 AI搜索 纳米AI 是 360 旗下 AI 搜索和智能体入口,支持文字、语音、拍照提问、多模型协作与内容创作,适合中文用户做日常搜索、学习问答、移动查询、热点追踪、生活决策、知识整理和轻量创作。 Qwen Chat(通义千问) AI聊天 Qwen Chat 是Qwen 大模型聊天助手,支持Qwen 模型聊天、写作和编程问答,适合中文用户和开发者完成 AI 对话、资料问答和任务协作,适合上线前核对权限、成本和资料质量。 DuckDuckGo AI Chat AI聊天 DuckDuckGo AI Chat 适合重视隐私的普通用户使用,围绕隐私 AI 聊天、免账户使用和多模型问答提供对话式 AI 支持和任务协作能力,适合上线前核对权限、成本和资料质量。 Goody-2 AI聊天 Goody-2 是以极端安全和伦理对齐为特色的 AI 聊天助手,常用于观察模型拒答边界、内容安全策略、保守输出体验和 AI 风险讨论,更适合作为安全边界样本使用前应理解它偏实验性质,不适合。