AI导航

EmbeddingGemma 2 发布:Google 开源多模态嵌入模型可按需裁剪

AI资讯
2 min read
0 次阅读

EmbeddingGemma 2 是 Google 在 2026 年 10 月 6 日通过 Google Developers Blog 发布的开放嵌入模型,基于 Gemma 4 构建,采用 Apache 2.0 许可。它把文本、代码、图像、视频和音频映射进同一个 768 维向量空间,总参数不到 10 亿,却用模块化结构让开发者只加载自己需要的部分,目标是端侧和低算力环境里的跨模态检索。

同一个检查点,四种体量随便换

这个模型的新意在拆装方式:纯文本和代码只需 270M 参数的基础部分,加视觉编码器是 440M,加音频编码器是 570M,全模态加载才是 740M,四种配置共享同一向量空间。Google 特别说明,先用纯文本配置建好的索引,之后加装图像或音频编码器时不必重算已有向量。对做本地代码库索引、设备端媒体搜索的团队,这意味着可以从小配置起步,需求长出来再扩,而不是一开始就背上全模态的内存开销。它与 Gemma 4 还共享文本分词器和音频编码结构,搭配做端侧 RAG 时能进一步省内存。

向量能从 768 维截到 128 维,代价写得很清楚

模型用 Matryoshka 表示学习支持把向量截短到 512、256 或 128 维。Google 给的参考是:截到 256 维时,文本和代码检索保留大部分质量,图像、视频和语音检索约为完整质量的 95%,存储降到三分之一;截到 128 维时存储降到六分之一,文本代码约保留九成质量,但多模态检索会掉到约 75%。换算成实际占用,100 万条 768 维向量在 bfloat16 下约 1.5GB,128 维只要约 250MB。官方同时提醒,多模态场景用 128 维前要先在自家数据上验证,这个边界比单纯报喜更值得注意。

成绩与上手门槛

按 Google 公布的数据,EmbeddingGemma 2 在 MTEB 代码检索上比上一代高 14%,并新增了图像、视频和音频检索能力,多语言文本表现与上一代相当。接入走 sentence-transformers 6.1.0 以上版本,权重已上 Hugging Face,也支持 vLLM、Ollama、LM Studio 等常见运行工具,上下文窗口为 8192 token。正在为端侧搜索选嵌入模型的团队,可以直接拿它和现有方案在自己的语料上对测;它真正的卖点不是单项分数,而是同一套向量同时管五种内容、还能按预算伸缩。

推荐工具

NVIDIA Chat with RTX AI聊天 Chat with RTX 是 NVIDIA 面向 RTX 电脑的本地 AI 聊天工具,可围绕本地文档和视频资料做问答,适合重视隐私、离线检索并具备硬件条件的用户更适合资料不便上传云 HuggingChat AI聊天 HuggingChat 是 Hugging Face 的开源模型聊天应用,支持 Omni 自动选模型,也可手动选社区开放模型对话。它适合体验开源模型、技术探索和问答,结果可能不稳定,重要内容需复核。 纳米AI搜索 AI搜索 纳米AI 是 360 旗下 AI 搜索和智能体入口,支持文字、语音、拍照提问、多模型协作与内容创作,适合中文用户做日常搜索、学习问答、移动查询、热点追踪、生活决策、知识整理和轻量创作。 Qwen Chat(通义千问) AI聊天 Qwen Chat 是Qwen 大模型聊天助手,支持Qwen 模型聊天、写作和编程问答,适合中文用户和开发者完成 AI 对话、资料问答和任务协作,适合上线前核对权限、成本和资料质量。 DuckDuckGo AI Chat AI聊天 DuckDuckGo AI Chat 适合重视隐私的普通用户使用,围绕隐私 AI 聊天、免账户使用和多模型问答提供对话式 AI 支持和任务协作能力,适合上线前核对权限、成本和资料质量。 Goody-2 AI聊天 Goody-2 是以极端安全和伦理对齐为特色的 AI 聊天助手,常用于观察模型拒答边界、内容安全策略、保守输出体验和 AI 风险讨论,更适合作为安全边界样本使用前应理解它偏实验性质,不适合。