Google DeepMind 发布 EmbeddingGemma 2 开源轻量多模态嵌入模型
EmbeddingGemma 2: an open, lightweight multimodal embedding model
Google DeepMind 发布 EmbeddingGemma 2,这款基于 Gemma 4、采用 Apache 2.0 许可的 740M 参数模型,可在端侧把文本、代码、图像、视频和音频映射到统一嵌入空间。
它把文本、图像、音频和视频放进同一端侧嵌入空间,开发者可以按任务裁剪参数量和向量维度来做本地检索与RAG。
Oct 06, 2026
|
EmbeddingGemma 2 是端侧多模态嵌入能力最强的模型,可原生将文本、图像、音频和视频的组合映射到统一的嵌入空间。
Sahil Dua
研究工程师,Google DeepMind
Henrique Schechter Vera
研究工程师,Google DeepMind
收听文章
[[duration]] 分钟
本内容由 Google AI 生成。生成式 AI 尚处于实验阶段
去年,我们推出了 EmbeddingGemma,为高质量文本嵌入提供轻量级选择,帮助你的应用直接在消费级硬件上整理、搜索和关联信息。开发者社区的反响远超我们的预期。下载量超过 2000 万次,开发者已用它驱动更智能的端侧搜索工具和隐私优先的检索增强生成(RAG)流水线。
今天,我们推出 EmbeddingGemma 2,将能力从文本扩展到在共享嵌入空间中统一代码、图像、视频和音频。它基于 Gemma 4 架构打造,并以商业宽松的 Apache 2.0 许可发布。EmbeddingGemma 2 拥有 740 million 个参数,非常适合端侧推理。它可以根据语音备忘录找到特定视频片段,或根据文本查询搜索数小时的音频录音,全部由单一的原生多模态模型处理。
EmbeddingGemma 2 基于与 Gemini Embedding 模型相同的技术打造:
- 同尺寸中的最佳:在同尺寸的 sub-1B 多模态嵌入模型中,于 MTEB(Massive Text Embedding Benchmark)Code 和 MAEB(Massive Audio Embedding Benchmark)等基准测试上取得领先分数,同时在文本、视觉和音频任务上媲美或超越许多更大的模型。
- 模块化设计:纯文本工作负载最少仅需 270M 参数,并可选用视觉(170M)和音频(300M)编码器以实现完整多模态支持。
- 存储高效:借助 Matryoshka Representation Learning(MRL),开发者可将输出向量从 768 维动态截断至 512、256 或 128 维。这可为本地向量数据库和内存使用带来最高 6 倍的存储缩减。
- 针对端侧性能优化:可在严格的资源限制下高效运行。经过量化,在 Google Pixel 11 Pro 上,EmbeddingGemma 2 的纯文本权重最少仅需约 191MB 活动 RAM,完整多模态模型约需 567MB。
- 支持扩展上下文:配备 8K token 上下文窗口(是 EmbeddingGemma 1 的 4 倍),可直接在本地硬件上处理最长 5.5 分钟的音频、29 张图像、58 帧视频,或它们的交错组合。
在代码、视觉和音频方面达到顶尖质量
EmbeddingGemma 2 在多语言文本性能上与 EmbeddingGemma 相当,同时在代码性能上显著提升 9.92 分(在 MTEB Code 中从 68.76 提升至 78.68),因而非常适合本地代码库索引、语义代码搜索和编程智能体检索。在图像、视频、文档和音频方面,它为 sub-1B 模型树立了单位参数质量的新标准,甚至超越了一些规模超过其两倍的专用模型。
完整的评估指标和模型信息请见 EmbeddingGemma 2 模型卡。
完全在端侧实现语义搜索、路由和检索
EmbeddingGemma 2 将强大的能力直接带到边缘硬件上。在本地生成嵌入有助于确保数据隐私、降低流水线延迟,并让开发者能够构建完全离线运行的跨模态搜索与检索。
与 Gemma 4 等生成式模型搭配时,EmbeddingGemma 2 可实现能够理解复杂多模态数据的端侧 RAG 流水线。由于 EmbeddingGemma 2 基于 Gemma 4 构建,并共享其文本分词器和音频编码器,开发者可以在统一流水线中同时运行这两个模型,且合计总内存占用更低。
要了解如何使用 LiteRT 构建端侧搜索和 RAG 系统,请阅读 Google AI Edge 博客文章。
EmbeddingGemma 2 入门
我们与以下合作伙伴密切合作,确保 EmbeddingGemma 2 能在你进行构建的地方即刻可用:
- 下载模型:可在 Hugging Face 和 Kaggle 上获取模型权重,Gemini Enterprise Agent Platform Model Garden 即将上线。访问 Hugging Face 上的 LiteRT Community,获取针对端侧优化的模型。
- 端侧部署:使用 Google AI Edge 的 MediaPipe 开发跨平台应用,以完成开箱即用的嵌入、检索与决策任务,或使用 LiteRT 进行自定义模型集成。借助 transformers.js 或 WebGPU 为浏览器构建。
- 使用你喜欢的开发工具:借助 transformers、sentence-transformers、MLX、vLLM、llama.cpp、SGLang、Ollama 和 LMStudio 高效地提供模型服务。使用 Qdrant 存储嵌入向量。
- 微调:按照 Unsloth 的指南,了解如何针对你的用例微调 EmbeddingGemma 2。
来源:Google DeepMind · deepmind.google