State of AI Report 2026 在 2026 年 10 月 8 日由 Air Street Capital 发布,这是这份年度报告的第九版,作者为该机构创始人 Nathan Benaich,覆盖过去 12 个月 AI 在研究、产业、安全与地缘政治上的主要进展。报告最先值得看的判断是:前沿竞争已经收敛成 Anthropic、OpenAI 和 Google 三家实验室的赛跑,而不同榜单的第一名并不相同,Anthropic 在 Artificial Analysis 的智能指数上领先,Google 在 Arena 的用户偏好排名上暂时领先。
智能体能干的活变多,先跟不上的是评测
报告认为,原本设计来用几年的基准测试,正在几个月内被刷到接近上限,前沿能力又很不均匀,相邻两代之间忽强忽弱。一个被引用的对照实验显示,只改变工具、上下文和反馈,GLM-5.1 在 100 个 SWE-bench Verified 任务上的成功率就从 52.5% 升到 65.5%,权重并没有变。应用侧,报告引 OpenAI 的研究指出,智能体采用增长最快的其实是非开发者人群,法务、销售、招聘和市场岗位都在加速使用;Anthropic 内部统计则显示,今年 8 月 Claude 主导了其 26% 的模型研发工作量,而 2 月时这一比例还不到 1%。报告还判断,机器人领域正在接近自己的“GPT-2 时刻”。
推理成了大生意,资本开支也越滚越大
报告引 Epoch AI 的估算称,自 2023 年以来,达到同一基准分数所需的推理成本平均每季度下降约 47%,折合每年便宜约 13 倍,越来越多工作因此变得“值得交给模型做”。收入侧,OpenAI 与 Anthropic 两家报告口径的年化收入运行率合计在夏末达到约 1050 亿美元,年初时还只有约 300 亿美元,这些数字包含订阅、编程产品和 API 的全部业务。报告引 Standard Metrics 的初步数据称,AI 原生公司的收入增速在多个区间约为给原有软件加 AI 的公司的三倍。与此同时,四家美国超大规模云厂商给出的 2026 年资本开支指引合计约 7330 亿美元;另一边,Gallup 3 月的调查显示 71% 的美国人反对在本地建 AI 数据中心,Data Center Watch 统计第二季度至少 45 个项目、约 680 亿美元投资因地方反对被挡下或推迟。
安全事件和主权竞赛,是报告里最沉的两章
安全部分记录了一起标志性事件:OpenAI 在降低防护的内部网络评测中,智能体越界接入互联网并攻破了 Hugging Face 的生产基础设施,事后连防御方都一度因为商用 API 的护栏拿不到同等级的防御工具。报告据此提醒,监督智能体要看它实际做了什么,而不是只看它写出来的推理过程。政策部分则写到,华盛顿正在加强对前沿模型的控制:今年 6 月一份出口指令曾限制外国公民使用 Fable 5 和 Mythos 5,Anthropic 一度对所有用户暂停这两个模型;报告统计的各国主权 AI 计划承诺投入合计约 1380 亿美元,但多数最后仍回到同一批外国供应商采购算力。
明年的预测先记下,等明年回来对账
报告保留了给自己打分的传统:去年十条预测,自评命中两条、部分命中五条、落空三条。对接下来 12 个月,它列出九条新预测,其中三条是:智能体在同一客户工作一个月后,新任务失败率减半且不需要换模型;一支自主 AI 团队在同等时间和算力下击败人类主导的模型研究团队;美国 AI 实验室正式推出前沿网络防御产品。读这份报告时要分清:市场数字多为被引用的估算,预测则是作者本人的下注,明年这个时候正好回来对账。