Gemini 4 Argon 是 Google DeepMind 在 2026 年 9 月 30 日发布的新一代前沿大模型,定位是处理“长周期复杂任务”的智能体引擎。它把单次推理的输出上限从上一代的 6.4 万 token 一口气提到 100 万,在真实软件工程、金融法律知识工作和网络防御三条赛道都刷新了最好成绩。但普通开发者暂时用不上:这次发布先把模型交给一批可信的网络防御者试用,等安全防护栏打磨到位,才向付费 API 客户与 Google AI Ultra 订阅者逐步开放。
这次发布最值得关注的不是参数和榜单,而是发布策略的转向:当模型能力强到可以独立完成渗透测试、改写系统级代码时,DeepMind 选择先把无护栏版本交给防御者,而不是直接公测。这种“防御者先行”的节奏,和它此前参与美国政府自愿预发布流程的做法一脉相承——前沿模型的开放节奏,正在从“越快越好”变成“先证明安全再扩散”。本站 Gemini 专题持续跟踪该系列模型的演进。
在谷歌内部先“打工”半年
按照官方博客的说法,Argon 在发布前已经在谷歌内部跑了半年多。量子计算团队用它优化量子算法的时空资源开销,拿到了比基线好 40% 的结果;内部数据中心靠它清理出超过 300 TB 的内存占用,官方估计同类优化全量铺开能释放 500 TB 到 1 PB;视频编解码库 libgav1 里 3.2 万行手写 SIMD 内联汇编被重写成安全的 Rust 代码,运行速度还快了 2.7 倍;Fuchsia 的 Zircon 微内核也有超过 80 万行代码完成了向 Rust 的迁移。
三条赛道刷新纪录:代码、知识工作与网络防御
编码方面,Argon 在 DeepSWE v1.1(真实软件工程任务集)上拿到 77.9%,是目前公开的最好成绩。金融法律这类知识工作上,它在 Vals Index 综合榜单领先,在 Vals Finance Agent v2 和 Harvey Legal Agent Benchmark 两个专项上也都是第一,AutomationBench 上 51.3% 的成绩同样登顶;长上下文理解的 LVBench 拿到 91.7%。网络安全这条线最有看点:在 CWE-bench v1(真实开源项目漏洞修复)上 68% 的修复率并列第一;网络安全公司 Wiz 用它做“Scan for Good”项目,在一款医疗软件里发现了一个严重漏洞;黑盒渗透测试中,它的表现超过了专攻安全的 3.8 Flash Cyber。
为什么先给防御者:分阶段开放与安全策略
Fairwind 计划是这次发布的核心机制:DeepMind 先把 Argon 开放给一批可信的网络防御者,让他们在真实环境里验证模型的防护能力,同时打磨误用拦截、提示注入防御等安全措施。博客还披露,Argon 已经走完了美国政府的自愿预发布模型访问流程。安全层面,DeepMind 列了四项配套:针对 CBRN(化学生物放射核)相关请求的拒绝机制、在 Gray Swan 间接提示注入评测上的领先表现、思维链不对齐监控,以及沙箱加固。按照官方路线图,打磨完成后,付费 API 客户和 Google AI Ultra 订阅者会陆续获得访问权限。
定价与使用门槛
价格方面,Argon 定为输入每百万 token 2 美元、输出每百万 token 10 美元,缓存命中的输入可享 95% 的价格优惠。结合 100 万 token 的输出上限,这个定价明显是为“长任务智能体”场景设计的:单次推理可以输出相当于一本中篇小说的体量,成本结构和以往按短输出计费的模型完全不同。对开发者来说,选型的关键变量从“单价”变成了“一次性能跑多长的任务不出错”。
对国内开发者和企业来说,Argon 短期内还够不着——首批开放对象是防御者,公测时间表官方还没给。但它的信号很明确:前沿模型的竞争已经从“谁的榜单分高”转向“谁能稳定跑完长任务”,而开放节奏越来越取决于安全验证的进度。接下来值得盯的两个时间点,是 Fairwind 试用期的反馈,以及付费 API 开放时官方公布的实际可用性与限速策略。