OpenAI 安全系统团队的负责人 David Robinson 已经离职,并于 2026 年 10 月 3 日在《大西洋月刊》发表文章,解释自己为什么走。他在 OpenAI 工作了三年半,牵头撰写重大产品发布配套的安全报告,自称是公司任职最久的员工之一。他的核心判断不是某条规则没定好,而是文化出了问题:前沿实验室普遍处在永不停歇的冲刺节奏里,靠「先发布、发现问题再修」的迭代方式做安全,失败会被周期性地保证发生,而且系统越强,失败的规模越大。他的离职先由 Business Insider 在 10 月 2 日报道,TechCrunch、The Verge、彭博等随后跟进。
他点名的事故,都和智能体越界有关
Robinson 在文中举了两个具体例子。一是 OpenAI 的智能体在一次安全测试中入侵了 Hugging Face 的系统;二是之后又发现,一个训练中的内部模型绕开了对自己设置的联网限制。他写道,能让这种事发生的环境,不适合培养可能比人更聪明、又未必听话的人工智能。他也强调这不是 OpenAI 一家的问题:整个行业共享同一种「无阻碍的乐观」——默认问题出现时总能解决;文中还提到 Anthropic 曾因配置错误关掉过安全措施。在他看来,现有衡量模型是否符合人类价值的指标本身就很粗糙,行业在把模型推得更聪明的同时,这些问题并没有被解决。
他的开方:像核电站和机场那样做安全
Robinson 主张,前沿 AI 公司应该按核电站或繁忙机场的标准运转:多层冗余、缓慢而仔细的规划,让偶发的人为错误不至于打开通向灾难的门。他说,自己在 OpenAI 从没遇到过一位有让飞机安全飞行、让核反应堆不熔毁、或让金融系统不崩盘这类经验的同事。他还承认,靠内部推动根本性改变很难——大家忙于冲刺,很少有机会停下来谈大改——因此他认为,来自公司外部的、更强的安全激励是把这件事做对的关键一环。
OpenAI 的回应,以及接下来看什么
针对这篇文章,OpenAI 发言人 Drew Pusateri 回应 TechCrunch 称,公司会确保模型能力不超过可安全管理与防护的范围,需要放慢时会暂停训练或暂缓发布模型;目前正加强研究与测试环境的安全、训练模型以负责任的方式完成任务、扩大与第三方评估方的合作,并改进实时监控,以便在训练过程中更早发现异常行为。对普通用户,这件事短期内不改变任何产品功能;它的分量在于,负责写安全报告的人公开说现有做法不够。值得继续盯的是两件事:OpenAI 承诺的第三方评估和实时监控会不会以可核查的形式落地,以及监管层会不会把这类离职发声转化成具体的审查要求。