AI导航

OpenAI 披露并处置有组织模型蒸馏攻击:攻击者系统性提取受保护推理内容

AI资讯
3 min read
0 次阅读

2026 年 9 月 30 日,OpenAI 发布博文《Disrupting a coordinated model-distillation campaign》,披露并处置了一起有组织的对抗性模型蒸馏攻击:攻击者系统性提取模型受保护的推理内容,最早的活动出现在 7 月第一周。今年 2 月 OpenAI 曾表示会移除疑似蒸馏其模型的用户,而这一次,它第一次把完整的攻击手法、规模和时间线摆上了台面。

手法:跨会话"复制—解密"

按 OpenAI 的描述,攻击者并没有攻破加密、入侵数据库,也没有直接接触到用户存储的对话。他们的路子更"巧":把一次对话中加密的推理内容复制出来,再到另一次对话里要求模型把隐藏的推理内容解密、转写出来。通过操纵模型交互,让受保护的推理以请求者可见的形式复现——规模化、有组织,且违反服务条款。

OpenAI 特别强调,这种操纵不是 OpenAI 模型独有的漏洞,任何前沿模型都可能遇到同类手法。

规模:两天 1.6 万次请求,波及 1.5 万用户集群

时间线很清晰:攻击 7 月 1 日开始,初期量很小;7 月 24 日和 25 日出现高峰,两天内用相关提取模式发起了 1.6 万次请求,来自 4000 多个用户。进一步调查发现,相关提示词模式的活动分布在一个超过 15000 个用户的集群里。OpenAI 在 7 月 28 日彻底阻断了这波攻击。

在公开发布之前,OpenAI 调查了攻击范围和潜在影响,部署了自家的缓解措施,并把发现分享给研究者和行业伙伴、征求反馈。缓解和调查工作仍在继续。

保护的到底是什么

OpenAI 在博文中给了一个关键定义:受保护的推理(protected reasoning)是模型解题时的内部记录。把它提取出来,不仅能看到最终答案里被隐去的信息,还能帮别人复现模型的能力。这正是"对抗性蒸馏"和正常蒸馏的分界线——前者是未经授权、系统性地拿一个模型的输出或推理去训练、复现、改进另一个模型。(蒸馏本身是合法的训练方法,概念科普见本站:模型蒸馏是什么意思?小模型为什么能学到大模型的本事。)

行业协作:通过 Frontier Model Forum 通报

OpenAI 把这次攻击的相关信息分享给了 Frontier Model Forum 的行业伙伴,目的是加强整个生态对对抗性蒸馏的集体防御。独立安全研究者也通过负责任披露报告了相关漏洞,帮 OpenAI 更快理解这类攻击、加速缓解。

背景上,蒸馏争议今年一直在升温:OpenAI 在 2026 年 2 月就表示会移除疑似蒸馏其模型的用户,检测手段包括行为信号、机器学习系统、人工复核和分类器;Anthropic 也曾指控有公司把请求转发到 Claude 再转售。OpenAI 这次选择公开完整细节,等于把"蒸馏攻防"从后台的封号战摆到了台前——对模型厂商来说,推理过程的保密性正在成为和权重本身一样重要的资产。

推荐工具

NVIDIA Chat with RTX AI聊天 Chat with RTX 是 NVIDIA 面向 RTX 电脑的本地 AI 聊天工具,可围绕本地文档和视频资料做问答,适合重视隐私、离线检索并具备硬件条件的用户更适合资料不便上传云 HuggingChat AI聊天 HuggingChat 是 Hugging Face 的开源模型聊天应用,支持 Omni 自动选模型,也可手动选社区开放模型对话。它适合体验开源模型、技术探索和问答,结果可能不稳定,重要内容需复核。 纳米AI搜索 AI搜索 纳米AI 是 360 旗下 AI 搜索和智能体入口,支持文字、语音、拍照提问、多模型协作与内容创作,适合中文用户做日常搜索、学习问答、移动查询、热点追踪、生活决策、知识整理和轻量创作。 Qwen Chat(通义千问) AI聊天 Qwen Chat 是Qwen 大模型聊天助手,支持Qwen 模型聊天、写作和编程问答,适合中文用户和开发者完成 AI 对话、资料问答和任务协作,适合上线前核对权限、成本和资料质量。 DuckDuckGo AI Chat AI聊天 DuckDuckGo AI Chat 适合重视隐私的普通用户使用,围绕隐私 AI 聊天、免账户使用和多模型问答提供对话式 AI 支持和任务协作能力,适合上线前核对权限、成本和资料质量。 Goody-2 AI聊天 Goody-2 是以极端安全和伦理对齐为特色的 AI 聊天助手,常用于观察模型拒答边界、内容安全策略、保守输出体验和 AI 风险讨论,更适合作为安全边界样本使用前应理解它偏实验性质,不适合。