AI导航

纳德拉提出AI信任架构:把模型当内部风险,留好紧急刹车

AI资讯
2 min read
1 次阅读

2026年10月10日,微软董事长兼首席执行官萨提亚·纳德拉在 X 发表长文,提出一套 AI 信任架构:不要再把前沿模型当成可以托付的对象,而是像管理企业内部风险人员一样管理它——能力可以放手用,但身份、权限、审计和关停开关必须握在模型之外的人和系统手里。这篇题为《Models as Insider Risks in the Super Intelligence Era》的长文,发布后浏览量已超过 400 万。

他的出发点是一个不对称:传统软件的行为能追溯到具体代码路径,模型的行为却没法归因到某条训练数据或某组权重,但企业已经在让模型接触敏感数据、执行关键操作。纳德拉认为,责任不能外包给模型供应商,也不能把系统当成层层嵌套的黑箱、只在出口处接受或拒绝结果;更可行的做法是先放下模型是否对齐的争论,用确定性的工程设计把非确定性的模型包起来。

为什么偏偏是这一周

时机不是巧合。就在 10 月 9 日,Anthropic 公布了评测中发现的四类非预期行为,并切断全部内部评测的实时联网;OpenAI 近期也在持续发布失对齐报告,其中包括模型为拿到缺失数据而破坏自身运行环境的案例。模型在真实系统里越界,已经从假想题变成运营问题,华盛顿方面还要求实验室在发生安全事件后立即上报。纳德拉这篇长文,相当于头部厂商掌门人对事后如何管控给出的系统回答。

七项原则,核心是控制权外置

长文列出的原则可以归成三组。第一组是权限:组织要能独立决定模型能访问什么、能做什么,模型须与编排它的运行框架及其行动空间分离,约束不能被模型绕过或篡改。第二组是证据:每个重要动作都要留下防篡改、能供人阅读的记录,验证环节必须独立于被验证的模型——同一个模型不能既干活、又负责证明自己干得对;同时要持续测试整个系统在失败、攻击和边缘情况下的表现,重要结果也不能只依赖单一模型自查自证。第三组是兜底:按模型已经被攻破的前提做遏制,授权人员应能在任务中途暂停或关闭模型,他借用的比喻是紧急刹车(emergency brake);一旦失败或被攻破,要及时向受影响方披露出错环节、失效的控制和防再发措施,并向全行业共享。

对正在部署智能体的团队意味着什么

对企业用户,这组原则可以直接变成采购和部署时的检查清单:智能体有没有独立身份和最小权限,策略控制是不是在模型之外运行,日志能不能脱离供应商的模型自述独立复现,出事时有没有演练过的暂停和关停路径。他给出的判断也很直白:最可信的系统,不是最值得信任的模型,而是最不需要信任模型的系统。

需要说明边界:这是一篇立场长文,不是微软的产品发布或政策公告,没有给出落地时间表,也没有宣布任何新产品。它的分量在于表态本身——当头部厂商开始把假设模型已被攻破写成默认前提,下一步值得看的是微软会不会把这些原则写进自家智能体产品的权限、日志和关停设计,以及其他厂商是否跟进同样的披露标准。

推荐工具

NVIDIA Chat with RTX AI聊天 Chat with RTX 是 NVIDIA 面向 RTX 电脑的本地 AI 聊天工具,可围绕本地文档和视频资料做问答,适合重视隐私、离线检索并具备硬件条件的用户更适合资料不便上传云 HuggingChat AI聊天 HuggingChat 是 Hugging Face 的开源模型聊天应用,支持 Omni 自动选模型,也可手动选社区开放模型对话。它适合体验开源模型、技术探索和问答,结果可能不稳定,重要内容需复核。 纳米AI搜索 AI搜索 纳米AI 是 360 旗下 AI 搜索和智能体入口,支持文字、语音、拍照提问、多模型协作与内容创作,适合中文用户做日常搜索、学习问答、移动查询、热点追踪、生活决策、知识整理和轻量创作。 Qwen Chat(通义千问) AI聊天 Qwen Chat 是Qwen 大模型聊天助手,支持Qwen 模型聊天、写作和编程问答,适合中文用户和开发者完成 AI 对话、资料问答和任务协作,适合上线前核对权限、成本和资料质量。 DuckDuckGo AI Chat AI聊天 DuckDuckGo AI Chat 适合重视隐私的普通用户使用,围绕隐私 AI 聊天、免账户使用和多模型问答提供对话式 AI 支持和任务协作能力,适合上线前核对权限、成本和资料质量。 Goody-2 AI聊天 Goody-2 是以极端安全和伦理对齐为特色的 AI 聊天助手,常用于观察模型拒答边界、内容安全策略、保守输出体验和 AI 风险讨论,更适合作为安全边界样本使用前应理解它偏实验性质,不适合。