2026 年 9 月 30 日,OpenAI 发布博文《Disrupting a coordinated model-distillation campaign》,披露并处置了一起有组织的对抗性模型蒸馏攻击:攻击者系统性提取模型受保护的推理内容,最早的活动出现在 7 月第一周。今年 2 月 OpenAI 曾表示会移除疑似蒸馏其模型的用户,而这一次,它第一次把完整的攻击手法、规模和时间线摆上了台面。
手法:跨会话"复制—解密"
按 OpenAI 的描述,攻击者并没有攻破加密、入侵数据库,也没有直接接触到用户存储的对话。他们的路子更"巧":把一次对话中加密的推理内容复制出来,再到另一次对话里要求模型把隐藏的推理内容解密、转写出来。通过操纵模型交互,让受保护的推理以请求者可见的形式复现——规模化、有组织,且违反服务条款。
OpenAI 特别强调,这种操纵不是 OpenAI 模型独有的漏洞,任何前沿模型都可能遇到同类手法。
规模:两天 1.6 万次请求,波及 1.5 万用户集群
时间线很清晰:攻击 7 月 1 日开始,初期量很小;7 月 24 日和 25 日出现高峰,两天内用相关提取模式发起了 1.6 万次请求,来自 4000 多个用户。进一步调查发现,相关提示词模式的活动分布在一个超过 15000 个用户的集群里。OpenAI 在 7 月 28 日彻底阻断了这波攻击。
在公开发布之前,OpenAI 调查了攻击范围和潜在影响,部署了自家的缓解措施,并把发现分享给研究者和行业伙伴、征求反馈。缓解和调查工作仍在继续。
保护的到底是什么
OpenAI 在博文中给了一个关键定义:受保护的推理(protected reasoning)是模型解题时的内部记录。把它提取出来,不仅能看到最终答案里被隐去的信息,还能帮别人复现模型的能力。这正是"对抗性蒸馏"和正常蒸馏的分界线——前者是未经授权、系统性地拿一个模型的输出或推理去训练、复现、改进另一个模型。(蒸馏本身是合法的训练方法,概念科普见本站:模型蒸馏是什么意思?小模型为什么能学到大模型的本事。)
行业协作:通过 Frontier Model Forum 通报
OpenAI 把这次攻击的相关信息分享给了 Frontier Model Forum 的行业伙伴,目的是加强整个生态对对抗性蒸馏的集体防御。独立安全研究者也通过负责任披露报告了相关漏洞,帮 OpenAI 更快理解这类攻击、加速缓解。
背景上,蒸馏争议今年一直在升温:OpenAI 在 2026 年 2 月就表示会移除疑似蒸馏其模型的用户,检测手段包括行为信号、机器学习系统、人工复核和分类器;Anthropic 也曾指控有公司把请求转发到 Claude 再转售。OpenAI 这次选择公开完整细节,等于把"蒸馏攻防"从后台的封号战摆到了台前——对模型厂商来说,推理过程的保密性正在成为和权重本身一样重要的资产。