AI导航

Gemini 4 Argon 发布:100 万 token 输出上限,率先开放给网络防御者试用

AI资讯
3 min read
0 次阅读

Gemini 4 Argon 是 Google DeepMind 在 2026 年 9 月 30 日发布的新一代前沿大模型,定位是处理“长周期复杂任务”的智能体引擎。它把单次推理的输出上限从上一代的 6.4 万 token 一口气提到 100 万,在真实软件工程、金融法律知识工作和网络防御三条赛道都刷新了最好成绩。但普通开发者暂时用不上:这次发布先把模型交给一批可信的网络防御者试用,等安全防护栏打磨到位,才向付费 API 客户与 Google AI Ultra 订阅者逐步开放。

这次发布最值得关注的不是参数和榜单,而是发布策略的转向:当模型能力强到可以独立完成渗透测试、改写系统级代码时,DeepMind 选择先把无护栏版本交给防御者,而不是直接公测。这种“防御者先行”的节奏,和它此前参与美国政府自愿预发布流程的做法一脉相承——前沿模型的开放节奏,正在从“越快越好”变成“先证明安全再扩散”。本站 Gemini 专题持续跟踪该系列模型的演进。

在谷歌内部先“打工”半年

按照官方博客的说法,Argon 在发布前已经在谷歌内部跑了半年多。量子计算团队用它优化量子算法的时空资源开销,拿到了比基线好 40% 的结果;内部数据中心靠它清理出超过 300 TB 的内存占用,官方估计同类优化全量铺开能释放 500 TB 到 1 PB;视频编解码库 libgav1 里 3.2 万行手写 SIMD 内联汇编被重写成安全的 Rust 代码,运行速度还快了 2.7 倍;Fuchsia 的 Zircon 微内核也有超过 80 万行代码完成了向 Rust 的迁移。

三条赛道刷新纪录:代码、知识工作与网络防御

编码方面,Argon 在 DeepSWE v1.1(真实软件工程任务集)上拿到 77.9%,是目前公开的最好成绩。金融法律这类知识工作上,它在 Vals Index 综合榜单领先,在 Vals Finance Agent v2 和 Harvey Legal Agent Benchmark 两个专项上也都是第一,AutomationBench 上 51.3% 的成绩同样登顶;长上下文理解的 LVBench 拿到 91.7%。网络安全这条线最有看点:在 CWE-bench v1(真实开源项目漏洞修复)上 68% 的修复率并列第一;网络安全公司 Wiz 用它做“Scan for Good”项目,在一款医疗软件里发现了一个严重漏洞;黑盒渗透测试中,它的表现超过了专攻安全的 3.8 Flash Cyber。

为什么先给防御者:分阶段开放与安全策略

Fairwind 计划是这次发布的核心机制:DeepMind 先把 Argon 开放给一批可信的网络防御者,让他们在真实环境里验证模型的防护能力,同时打磨误用拦截、提示注入防御等安全措施。博客还披露,Argon 已经走完了美国政府的自愿预发布模型访问流程。安全层面,DeepMind 列了四项配套:针对 CBRN(化学生物放射核)相关请求的拒绝机制、在 Gray Swan 间接提示注入评测上的领先表现、思维链不对齐监控,以及沙箱加固。按照官方路线图,打磨完成后,付费 API 客户和 Google AI Ultra 订阅者会陆续获得访问权限。

定价与使用门槛

价格方面,Argon 定为输入每百万 token 2 美元、输出每百万 token 10 美元,缓存命中的输入可享 95% 的价格优惠。结合 100 万 token 的输出上限,这个定价明显是为“长任务智能体”场景设计的:单次推理可以输出相当于一本中篇小说的体量,成本结构和以往按短输出计费的模型完全不同。对开发者来说,选型的关键变量从“单价”变成了“一次性能跑多长的任务不出错”。

对国内开发者和企业来说,Argon 短期内还够不着——首批开放对象是防御者,公测时间表官方还没给。但它的信号很明确:前沿模型的竞争已经从“谁的榜单分高”转向“谁能稳定跑完长任务”,而开放节奏越来越取决于安全验证的进度。接下来值得盯的两个时间点,是 Fairwind 试用期的反馈,以及付费 API 开放时官方公布的实际可用性与限速策略。

推荐工具

NVIDIA Chat with RTX AI聊天 Chat with RTX 是 NVIDIA 面向 RTX 电脑的本地 AI 聊天工具,可围绕本地文档和视频资料做问答,适合重视隐私、离线检索并具备硬件条件的用户更适合资料不便上传云 HuggingChat AI聊天 HuggingChat 是 Hugging Face 的开源模型聊天应用,支持 Omni 自动选模型,也可手动选社区开放模型对话。它适合体验开源模型、技术探索和问答,结果可能不稳定,重要内容需复核。 纳米AI搜索 AI搜索 纳米AI 是 360 旗下 AI 搜索和智能体入口,支持文字、语音、拍照提问、多模型协作与内容创作,适合中文用户做日常搜索、学习问答、移动查询、热点追踪、生活决策、知识整理和轻量创作。 Qwen Chat(通义千问) AI聊天 Qwen Chat 是Qwen 大模型聊天助手,支持Qwen 模型聊天、写作和编程问答,适合中文用户和开发者完成 AI 对话、资料问答和任务协作,适合上线前核对权限、成本和资料质量。 DuckDuckGo AI Chat AI聊天 DuckDuckGo AI Chat 适合重视隐私的普通用户使用,围绕隐私 AI 聊天、免账户使用和多模型问答提供对话式 AI 支持和任务协作能力,适合上线前核对权限、成本和资料质量。 Goody-2 AI聊天 Goody-2 是以极端安全和伦理对齐为特色的 AI 聊天助手,常用于观察模型拒答边界、内容安全策略、保守输出体验和 AI 风险讨论,更适合作为安全边界样本使用前应理解它偏实验性质,不适合。