跳到正文
原文
Google DeepMind·· 3 小时前精选AI 评分78

Google DeepMind 发布 EmbeddingGemma 2 实现端侧全模态嵌入与动态存储优化

EmbeddingGemma 2: an open, lightweight multimodal embedding model

AI 导读

Google DeepMind 正式发布 EmbeddingGemma 2,这是一款基于 Gemma 4 架构的 7.4 亿参数轻量级多模态嵌入模型,原生支持将文本、代码、图像、音频和视频映射到统一向量空间。该模型采用 Apache 2.0 许可开源,旨在解决消费级硬件上的高质多模态搜索与检索增强生成(RAG)需求,其核心优势在于在小于 1B 参数的规模下实现了行业领先的性能表现。

技术细节显示,EmbeddingGemma 2 具备模块化设计,文本任务仅需 2.7 亿参数,并可选配视觉(1.7 亿)和音频(3 亿)编码器以支持全模态。通过 Matryoshka 表示学习(MRL),输出向量可从 768 维动态截断至 512、256 或 128 维,从而在本地向量数据库中实现最高 6 倍的存储空间缩减。在量化后,纯文本权重在 Google Pixel 11 Pro 上仅需约 191MB 运行内存,全模态模式约为 567MB;同时拥有 8K token 上下文窗口,可直接处理长达 5.5 分钟的音频或 29 张图像。实测数据显示,其在 MTEB Code 基准上提升了 9.92 分,达到 78.68 分,显著优于同规模竞品。

事实层面,该模型已上架 Hugging Face 和 Kaggle,并计划接入 Gemini Enterprise Agent Platform Model Garden。推断层面,由于与 Gemma 4 共享词表和音频编码器,开发者可构建低显存占用的统一管道,直接赋能离线环境下的跨模态应用。猜测层面,若结合 vLLM 或 Ollama 等推理框架,该模型可能成为未来端侧智能体(Agent)进行本地知识库检索的标准组件,但具体商业化落地速度仍取决于终端设备的算力普及率。

推荐理由

740M 参数实现全模态嵌入且支持动态截断,为端侧 RAG 提供了可验证的隐私与延迟优化方案。

来源:Google DeepMind · deepmind.google