Google 发布了 EmbeddingGemma 2 模型。这是一款多模态嵌入模型,可将文本、图像、音频和视频,以及代码,连接到统一的表示空间中。该模型面向希望在设备本地构建语义搜索、检索和 RAG 应用的开发者,无需将数据发送到外部服务器。
该模型包含 7.4 亿个参数,并以允许商业使用的 Apache 2.0 许可证发布。Google 表示,该模型基于 Gemma 4 架构构建,例如可以利用一条语音备忘录查找特定视频片段,或通过文本查询搜索长篇音频录音,且使用的是同一个多模态模型。
该模型实际提供什么?
EmbeddingGemma 2 的主要特点是将不同类型的数据整合到共享表示中,从而支持跨模态搜索和检索。它可用于通过文本或图像搜索媒体库,通过文本或语音查询定位视频中的特定时刻,或在将结果传递给 Gemma 4 等生成模型以提供上下文和推理之前,支持本地文件检索。
- 它包含 8,000 个 token 的上下文窗口,是上一代 EmbeddingGemma 的四倍,并支持最多 5.5 分钟的音频、29 张图像或 58 个视频帧。
- 借助 Matryoshka Representation Learning 技术,可将输出向量从 768 维缩减为 512、256 或 128 维,从而可能将向量数据库中的存储空间和内存占用降低最多六倍。
- 它提供更轻量的纯文本任务配置,并支持使用可选的视觉和音频编码器来实现多模态应用。
- Google 表示,量化后,在 Google Pixel 11 Pro 手机上,纯文本权重的活动内存占用约为 191 MB,完整多模态模型约为 567 MB。
代码能力和本地运行得到改进
Google 表示,EmbeddingGemma 2 在 MTEB Code 测试中的成绩提高了 9.92 分,从 68.76 分升至 78.68 分,因此适合对代码库建立索引、进行语义搜索,并支持编程代理检索。该公司还表示,相对于其规模,该模型在文本、视觉和音频任务中取得了强劲结果,并且在部分比较中超过了规模大一倍以上的专业模型。
本地运行所需的资源相对有限,有助于缩短延迟、保护数据隐私,并支持离线工作。此外,在构建结合检索与推理的本地流水线时,该模型与 Gemma 4 共享文本分词器和音频编码器,可能降低所需的总体内存。
可用工具和限制
Google 已通过 Hugging Face 和 Kaggle 提供模型权重,预计之后还将通过 Gemini Enterprise Agent Platform 中的 Model Garden 提供。该模型可使用 Google AI Edge MediaPipe 或 LiteRT 部署,并支持 transformers、sentence-transformers、MLX、vLLM、llama.cpp、SGLang、Ollama 和 LMStudio 等环境与工具,此外还支持用于浏览器的 transformers.js 和 WebGPU。
这意味着 EmbeddingGemma 2 不仅限于现成的搜索体验,还提供了一个可集成到多种本地应用中的组件。不过,本文所列的性能和内存数据由 Google 提供,而模型的实际适用性仍将取决于数据类型、所需的检索精度、硬件限制以及独立测试结果。此外,公告没有明确每种使用场景的详细条件,也未给出模型在 Model Garden 中的具体可用时间表。