AI导航

Google 让 AI Agent 离线运行:Antigravity SDK 支持 Gemma 4 本地模型

AI资讯
2 min read
0 次阅读

2026 年 9 月 24 日凌晨(北京时间),Google 开发者博客宣布:Antigravity SDK 开始支持本地模型,智能体工作流可以完全离线运行。首批支持的是 Gemma 4 26B A4B,通过 Google AI Edge 的 LiteRT 在本地 GPU 上跑。

简单说,写代码、审代码、修 bug 这些智能体任务,不再必须把代码发到云端。官方列了四个理由:省钱(没有 API 费用和速率限制)、隐私(代码和请求不出本机)、断网也能干活、以及可以和云端模型混搭。

混合编排是这次最有看头的一段演示。任务是审计并修复三个有漏洞的模块(auth.py、billing.py、database.py):云端的 Gemini 3.8 Flash 当“架构师”,只看文件名和任务描述就拆好策略、指挥全局,全程只花了 95 个云端 token,源代码一行没上传;本地的一群 Gemma 4 26B 实例在 GPU 上当“施工队”,复现漏洞、写修复、互相挑刺、跑回归测试。官方数据:这次运行里 97.2% 的 token(3322 个)在本地离线完成,补丁全部验证通过。

除了自己优化的 LiteRT 路线,SDK 还兼容任何 OpenAI 协议的本地推理后端——Ollama、LM Studio、vLLM 都能直接插进来,换后端不用改智能体的编排代码。博客里另一个例子很接地气:只给一句话提示,本地智能体就自己写了个终端资源监控工具,连依赖清单和测试都包了。

两道门槛先看清

第一是硬件。官方建议 24GB 以上显存或统一内存,普通轻薄本基本没戏,这是给工作站和高内存一体机准备的。第二是能力差距。Gemma 4 26B 再强也是本地小模型,复杂推理和超长上下文还是得靠云端旗舰模型,离线模式更适合“执行密集、规划轻量”的任务——官方的架构师加施工队分工已经说明了这一点。

适合谁、不适合谁

适合三类人:在合规严格的公司写代码、代码不许出内网的开发者;经常断网或弱网环境(出差、高铁、海外)还要干活的人;以及 Agent 用量大、想省 API 钱的团队。不适合:只想尝鲜、机器显存不够,或者主要做复杂架构设计、依赖超大上下文的人——这些场景云端模型仍然是正解。下一步可以看 Google 会不会把更多 Gemma 尺寸和端侧优化路线(比如手机端)接进来,以及 Ollama 生态的第三方模型在这种编排里表现如何。

推荐工具

NVIDIA Chat with RTX AI聊天 Chat with RTX 是 NVIDIA 面向 RTX 电脑的本地 AI 聊天工具,可围绕本地文档和视频资料做问答,适合重视隐私、离线检索并具备硬件条件的用户更适合资料不便上传云 HuggingChat AI聊天 HuggingChat 是 Hugging Face 的开源模型聊天应用,支持 Omni 自动选模型,也可手动选社区开放模型对话。它适合体验开源模型、技术探索和问答,结果可能不稳定,重要内容需复核。 纳米AI搜索 AI搜索 纳米AI 是 360 旗下 AI 搜索和智能体入口,支持文字、语音、拍照提问、多模型协作与内容创作,适合中文用户做日常搜索、学习问答、移动查询、热点追踪、生活决策、知识整理和轻量创作。 Qwen Chat(通义千问) AI聊天 Qwen Chat 是Qwen 大模型聊天助手,支持Qwen 模型聊天、写作和编程问答,适合中文用户和开发者完成 AI 对话、资料问答和任务协作,适合上线前核对权限、成本和资料质量。 DuckDuckGo AI Chat AI聊天 DuckDuckGo AI Chat 适合重视隐私的普通用户使用,围绕隐私 AI 聊天、免账户使用和多模型问答提供对话式 AI 支持和任务协作能力,适合上线前核对权限、成本和资料质量。 Goody-2 AI聊天 Goody-2 是以极端安全和伦理对齐为特色的 AI 聊天助手,常用于观察模型拒答边界、内容安全策略、保守输出体验和 AI 风险讨论,更适合作为安全边界样本使用前应理解它偏实验性质,不适合。