Google 推出了 EmbeddingGemma 2,这是一种开放、轻量级的嵌入模型,可以将文本、图像、音频和视频的组合本地映射到单个统一的嵌入空间中。该公告由 Google DeepMind 研究工程师 Sahil Dua 和 Henrique Schechter Vera 于 2026 年 10 月 6 日发布,将 7.4 亿参数模型定位为设备上多模态嵌入的最强大选项,该模型根据商业许可的 Apache 2.0 许可证发布,并基于 Gemma 4 架构构建。
第一个 EmbeddingGemma 超出了 Google 的预期,下载量超过 2000 万次,为设备上的搜索工具和隐私优先的检索增强生成管道提供支持。续集立即引起了开发人员的兴趣,引发了当天最大的 Hacker News 讨论之一,因为开发人员评估了单个多模式嵌入器对于本地 AI 新闻 应用程序、媒体库和从不接触云的 RAG 系统意味着什么。
文本、代码、图像、音频和视频的一种模型
EmbeddingGemma 2 的主要功能是原生多模态。该模型不是为每种模态运行单独的编码器并将结果拼接在一起,而是将文本、代码、图像、视频和音频的组合嵌入到一个共享空间中。谷歌的例子包括使用语音备忘录作为查询来查找特定的视频剪辑,或者使用文本提示搜索几个小时的录音,所有这些都由本地硬件上的单个模型处理。
该架构是模块化的。纯文本核心仅需要 2.7 亿个参数,可选的视觉(1.7 亿个参数)和音频(3 亿个参数)编码器添加了完整的多模式支持。因此,开发人员现在可以部署紧凑的文本嵌入器,并发展为完整的多模式检索,而无需更改模型系列。
基准测试结果和存储效率
谷歌报告称,EmbeddingGemma 2 在 MTEB(大规模文本嵌入基准)代码和 MAEB(大规模音频嵌入基准)等基准测试中取得了低于 1B 多模态嵌入器的领先分数,同时在文本、视觉和音频任务中匹配或优于许多更大的模型。最具体的收益是在代码中:MTEB 代码性能跃升了 9.92 点,从 68.76 上升到 78.68,谷歌表示,这使得该模型非常适合本地代码库索引、语义代码搜索和编码代理检索。该公司声称在图像、视频、文档和音频方面为低于 1B 模型的每参数质量制定了新标准,称其性能甚至超过了一些专业模型的两倍以上。
存储效率来自俄罗斯套娃表示学习(MRL)。输出向量可以从 768 维动态截断至 512、256 或 128 维,从而将本地向量数据库的存储空间和内存使用量减少多达 6 倍。对于在手机或嵌入式硬件上运行检索的开发人员来说,这种差异通常决定了某个功能是否可以发布。
专为紧张的硬件预算而设计
设备上的占用空间是该模型的核心卖点。谷歌报告称,通过量化,EmbeddingGemma 2 仅需要大约 191MB 的活动 RAM 来处理纯文本权重,而在 Google Pixel 11 Pro 上处理完整的多模态模型则需要大约 567MB 的活动 RAM。上下文窗口也增长到 8,000 个令牌,比 EmbeddingGemma 1 大四倍,足以在单次传递中处理长达 5.5 分钟的音频、29 个图像或 58 个视频帧或其交错组合。
由于该模型与 Gemma 4 共享其文本分词器和音频编码器,因此开发人员可以在统一管道中与 Gemma 4 一起运行 EmbeddingGemma 2,并减少组合内存占用,从而实现设备上 RAG,其中检索和生成均在本地进行。谷歌在其 AI Edge Foresight 应用程序中展示了这一点,将本地文件检索与 Gemma 4 上下文推理相结合。
工具和可用性
该模型可通过 Google 的 AI Edge 工具获得。 Google AI Edge Gallery应用程序展示了即时媒体搜索,它通过文本或图像查询的语义相似性来查找库匹配,以及视频时刻查找器,它使用文本或音频查询来定位特定场景。实时分类、路由和预测用例通过 MediaPipe Decision Task API 公开,Google 的 AI Edge 博客记录了如何使用 LiteRT 构建设备上搜索和 RAG 系统。模型卡中提供了完整的评估指标。
为什么设备上嵌入很重要
嵌入模型很少像前沿聊天模型那样成为头条新闻,但它们位于最实用的 AI 功能之下:语义搜索、推荐、重复数据删除、分类和 RAG 检索。在本地运行它们完全改变了隐私和延迟计算。数据永远不会离开设备,查询可以离线工作,并且没有每次调用 API 成本,这对于数十亿嵌入式设备的规模来说非常重要。
EmbeddingGemma 2 还加剧了高效开放模型领域的竞争,Google、Meta、Mistral 和一群小型实验室正在竞相证明有用的人工智能可以在没有数据中心的情况下运行。在手机上处理五种模式的 740M 参数模型是这场比赛中的一个显着标志。如果从其前身的下载轨迹来看,预计 EmbeddingGemma 2 将在未来几个月内出现在各种移动和边缘产品中。
保持人工智能曲线的领先地位
设备上人工智能的发展速度比大多数人意识到的要快。 阅读 aibuzzwire.news 上的最新人工智能新闻,了解每个主要模型发布、基准测试和开发人员工具发布的报道。
阅读更多人工智能新闻 →