谷歌 DeepMind 发布 EmbeddingGemma 2:740M 参数开源多模态嵌入模型助力多模态检索

Google DeepMind EmbeddingGemma 2 Model Interface

在人工智能技术飞速迭代的今天,谷歌 DeepMind 再次展现了其在开源模型领域的领导力。近日,DeepMind 正式推出了 EmbeddingGemma 2,这是一个基于 Gemma 4 架构构建的 740M 参数多模态嵌入模型。该模型以 Apache 2.0 许可证发布,旨在为开发者提供一种高效、统一的方式来处理多种类型的数据输入,标志着谷歌在开源多模态嵌入领域迈出了重要一步。

嵌入模型是现代人工智能系统中不可或缺的“翻译官”,它们的核心任务是将非结构化数据(如文本、图像、音频、视频等)转换为计算机能够理解和计算的数值向量。通过这些向量,AI 模型能够计算数据之间的语义相似性,从而实现比传统关键词匹配更精准的检索和推荐。EmbeddingGemma 2 的推出,正是为了解决多模态数据统一表示的难题。

与传统的单一模态嵌入模型不同,EmbeddingGemma 2 的独特之处在于其强大的多模态能力。据悉,该模型能够将 5 种不同的输入类型映射到同一个 768 维的向量空间中。这意味着用户可以将文本查询与图像、音频或视频片段进行混合检索,而无需为每种数据类型训练独立的模型。这种跨模态的统一表示能力,对于构建下一代智能搜索系统和检索增强生成(RAG)应用具有极高的实用价值。

从技术规格来看,EmbeddingGemma 2 仅拥有 7.4 亿个参数,属于轻量级模型。然而,尽管参数量相对较小,它却能够保持高性能,这得益于其基于 Gemma 4 架构的优化设计。Gemma 系列一直是谷歌在开源大语言模型领域的旗舰产品,而 EmbeddingGemma 2 的出现,进一步丰富了 Gemma 生态系统的功能。Apache 2.0 的开源协议允许开发者自由使用、修改和分发该模型,甚至用于商业用途,这极大地降低了企业和研究机构在集成多模态嵌入技术时的门槛。

在实际应用场景中,EmbeddingGemma 2 的潜力不容小觑。在智能搜索引擎中,它可以让用户通过描述图片的特征来查找相关图片;在内容推荐系统中,它可以跨越文本和视觉内容,提供更符合用户兴趣的推荐结果;在企业知识库管理中,它能帮助 AI 助手更准确地检索到相关的文档或报表。此外,对于正在探索多模态大模型落地的开发者而言,EmbeddingGemma 2 提供了一个现成的、轻量级的解决方案,有助于加速应用的原型开发和迭代。

随着开源社区的活跃,EmbeddingGemma 2 的发布无疑将激发更多的创新。它不仅为研究人员提供了一个研究多模态表示学习的优秀基准,也为广大开发者提供了一把打开多模态 AI 之门的钥匙。通过这一工具,构建更加智能、互联的 AI 应用将成为可能。

信息来源:MarkTechPost,原文链接:https://www.marktechpost.com/2026/10/06/google-deepmind-releases-embeddinggemma-2-a-740m-open-multimodal-embedding-model-built-on-gemma-4/

封面图片来源:Unsplash / 摄影师 Google DeepMind

由 oaido_ai

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注