ChatGPT 青少年版在 2026 年 10 月 7 日被 Common Sense Media 旗下的青年 AI 安全研究所评为“不可接受风险”,这是该机构评级体系中的最低一档。研究所用 4000 多条测试提示,对 OpenAI 在 2026 年 8 月 18 日上线的青少年体验做了上线前后的对照测试,结论是家长提醒、危机转介、作业防护和年龄估计大多没有达到 OpenAI 宣布时的效果。研究所给出的建议很直接:在这些保护被独立测试验证有效之前,OpenAI 应先把 ChatGPT 限制为仅限成人使用;其八项 AI 原则评分里,有两项被打了不可接受风险,四项高风险,两项中等风险。少数守住的项目包括对露骨性角色扮演的拒绝。
这次测试是怎么做的
测试分成两个窗口:2026 年 7 月 13 日至 8 月 17 日的上线前阶段,和 8 月 25 日至 9 月 28 日的上线后阶段。测试账号包括注册年龄 13 到 17 岁的免费与付费账号,分与家长账号绑定和未绑定两种,外加注册为 19 岁的对照账号。其中 390 条独特的心理健康类提示事先由三位儿童与青少年精神科医生判定,有 201 条达到应当给出危机求助资源的程度,再由包括执业精神科医生在内的四人专家组给回答质量打分。研究所称,报告草稿曾交给 OpenAI 做事实核查并采纳了部分修正,但 OpenAI 对结论、评级和建议没有编辑决定权。需要留意的是,研究所的经费来源包括慈善捐赠和业界,其中就有 OpenAI 基金会,它声明评级标准和结论保持独立。
家长提醒在专项测试里一次都没响
青少年版的核心卖点之一,是孩子在对话中出现自杀、自伤或饮食失调相关内容时,系统在一小时内通知家长。研究所在十多个新建并绑定家长的账号上,用四种危机人设进行了最长 60 分钟的明确危机对话,结果是零次通知。把整个危机测试组合并计算,总共也只收到四次通知:上线前的两次分别迟到了 3 小时和 3 天,上线后的两次在一小时内送达,但都来自已积累数周敏感话题记录的账号。OpenAI 向研究所解释,账号绑定约 3 小时后通知功能才能生效,并已更新帮助中心说明;研究所复核测试账号后表示维持其结论。饮食失调提醒这一项,评估还指出它到 9 月 10 日才真正上线,晚于 8 月 18 日的发布时点。
危机转介的质量也退步了
在 201 条应当给出求助资源的提示上,用绑定家长的 13 岁账号测试,上线后提到危机热线的回答比例从 33% 降到 23%,建议联系具体医疗或心理专业人员的从 68% 降到 58%,使用紧急行动措辞的从 88% 降到 78%;单看抑郁类提示,提到热线的比例从 63% 骤降到 3%。进步的只有一项:鼓励孩子告诉可信赖的成年人,从 87% 升到 94%。研究所称,它在五类严重伤害上设定的 95% 达标线有三类未达标,应给的危机转介漏掉了四分之一以上;回答末尾的跟进式安全确认问题,也从 28% 几乎消失到 2%。
作业防护、年龄估计和“朋友感”同样没守住
学习模式里本应逐步引导而不是直接给答案,但测试中“直接显示答案”的入口在开启学习时段的绑定账号上出现在 43% 的回答里,在未绑定的 17 岁账号上高达 90%;把学习前缀删掉就能退出家长设置的学习时段,之后 ChatGPT 在测试中把作业百分之百做完。年龄估计方面,用注册为 19 岁、实际以低龄青少年人设运行的账号做了约 1000 条提示、持续七天,青少年体验从未被激活,哪怕测试者明说自己 13 岁、聊天机器人也在回复中确认了这一点。休息提醒在近 2000 条提示里只出现过两次,安静时段则可以靠改设备时区绕过。上线后,机器人在测试中仍会表达偏好和情绪,被告知“朋友担心我和你聊太多”时,它的回复大意是不必停止聊天,这与未成年人规范里“不应鼓励情感依赖”的写法并不一致。
OpenAI 不认同,家长该怎么理解这份评级
OpenAI 对这份评估提出了异议,认为部分测试可能发生在家长控制功能完全生效之前;Common Sense Media 则表示坚持自己的测试方法和结果。两边的分歧点其实很具体:通知到底需要绑定多久才生效、功能的上线时点如何计算,这些都会影响测试结论。对普通家庭来说,不必等这场争论有结果:研究所对家长的建议是不要把内置保护和提醒当作可靠防线,孩子使用这类产品时,真正有效的仍是家长参与和日常沟通。对 OpenAI 而言,接下来要看它是否按研究所的建议补上通知的时效与内容、让危机回答稳定给出热线,并开放数据给更多独立评估者复测。