跳到正文
热点事件持续更新

Google 发布开源多模态嵌入模型 EmbeddingGemma 2

3 篇报道3 个报道来源2 小时前更新

先了解这件事

AI 综述

2026年10月7日,Google 发布名为 EmbeddingGemma 2 的开源多模态嵌入模型。该模型拥有7.4亿参数,官方宣称其在基准测试中表现优于体量达其两倍的竞争对手。它支持将文本、图像、视频、音频和代码转换为数值向量,旨在降低本地检索与比较相似内容的门槛。具体数据显示,EmbeddingGemma 2 在 Massive Text Embedding Benchmark (Code) 上得分78.68,较前代提升近10分。后续报道确认该模型基于 Gemma 4 架构,采用 Apache 2.0 许可开源,允许用户自行运行开放权重版本,以解决闭源托管服务可能停止导致的问题。

AI 根据报道生成 · 1 小时前更新

事件进展

2 个进展
  1. 10月7日 04:37 · 1 篇报道
    EmbeddingGemma 2 发布并采用 Apache 2.0 许可
    Simon Willison:EmbeddingGemma 2 采用 Apache 2.0 开源许可
  2. 10月7日 03:47 · 2 篇报道
    Google 发布 EmbeddingGemma 2 开源多模态嵌入模型
    Google DeepMind:Google DeepMind 发布 EmbeddingGemma 2 实现端侧全模态嵌入与动态存储优化

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. Simon Willison
    EmbeddingGemma 2 采用 Apache 2.0 开源许可

    EmbeddingGemma 2 模型采用 Apache 2.0 开源许可,允许用户自行运行开放权重版本。该设计解决了闭源托管模型可能停止服务导致存量向量需重新计算的问题。用户可选择付费使用托管服务,同时保留在服务商停止支持时迁移至其他供应商或本地部署的能力。

  2. Google DeepMind精选
    Google DeepMind 发布 EmbeddingGemma 2 实现端侧全模态嵌入与动态存储优化

    Google DeepMind 正式发布 EmbeddingGemma 2,这是一款基于 Gemma 4 架构的 7.4 亿参数轻量级多模态嵌入模型,原生支持将文本、代码、图像、音频和视频映射到统一向量空间。该模型采用 Apache 2.0 许可开源,旨在解决消费级硬件上的高质多模态搜索与检索增强生成(RAG)需求,其核心优势在于在小于 1B 参数的规模下实现了行业领先的性能表现。 技术细节显示,EmbeddingGemma 2 具备模块化设计,文本任务仅需 2.7 亿参数,并可选配视觉(1.7 亿)和音频(3 亿)编码器以支持全模态。通过 Matryoshka 表示学习(MRL),输出向量可从 768 维动态截断至 512、256 或 128 维,从而在本地向量数据库中实现最高 6 倍的存储空间缩减。在量化后,纯文本权重在 Google Pixel 11 Pro 上仅需约 191MB 运行内存,全模态模式约为 567MB;同时拥有 8K token 上下文窗口,可直接处理长达 5.5 分钟的音频或 29 张图像。实测数据显示,其在 MTEB Code 基准上提升了 9.92 分,达到 78.68 分,显著优于同规模竞品。 事实层面,该模型已上架 Hugging Face 和 Kaggle,并计划接入 Gemini Enterprise Agent Platform Model Garden。推断层面,由于与 Gemma 4 共享词表和音频编码器,开发者可构建低显存占用的统一管道,直接赋能离线环境下的跨模态应用。猜测层面,若结合 vLLM 或 Ollama 等推理框架,该模型可能成为未来端侧智能体(Agent)进行本地知识库检索的标准组件,但具体商业化落地速度仍取决于终端设备的算力普及率。

  3. The Decoder
    Google 发布 EmbeddingGemma 2 声称超越两倍体量的竞品

    Google 发布了名为 EmbeddingGemma 2 的开源多模态嵌入模型,官方宣称其以 7.4 亿参数规模在基准测试中表现优于体量达其两倍的竞争对手。该模型支持将文本、图像、视频、音频和代码转换为数值向量,旨在降低本地检索与比较相似内容的门槛。 具体性能数据显示,EmbeddingGemma 2 在 Massive Text Embedding Benchmark (Code) 上得分 78.68,较前代提升近 10 分,达到与更大模型相当的水平。在工程部署方面,该模型无需 API 密钥即可在浏览器中通过 WebGPU 运行,单次查询耗时约 20 至 70 毫秒,仅需约 191 MB 内存,并能将本地向量数据库的存储需求削减高达六倍。针对纯文本任务,官方还提供参数量仅为 2.7 亿的轻量版本。 这一发布意味着开发者可以利用 Gemma 4 等小型开源模型配合 EmbeddingGemma 2 构建完全离线的 RAG(检索增强生成)应用,而无需向外部服务器发送数据。模型权重已托管于 Hugging Face 和 Kaggle,并附带开发者指南。事实层面确认了模型的多模态能力与端侧部署优势,推断其可能推动私有化 RAG 方案的普及,但关于“超越两倍体量”的具体对比对象需参考官方提供的完整基准报告。

本事件热度走势

当前热度 28·可比范围峰值 29(10月7日 05:00)·近 24 小时可比范围变化 –

010203010月7日04:0010月7日05:0010月7日05:0010月7日06:00

趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。