谷歌推出EmbeddingGemma 2多模态嵌入模型

AI 驱动中国 陈默 426次阅读
分享 微 Q 信
AI摘要
由 AI 生成 · 仅供参考

谷歌发布EmbeddingGemma 2,将文本嵌入能力扩展至代码、图像、视频和音频,基于Gemma 4架构,采用Apache 2.0许可,总参数7.4亿,支持模块化多模态组件、向量维度截断与端侧量化运行。

驱动中国10月7日消息,谷歌推出EmbeddingGemma 2,将此前面向文本的嵌入能力扩展到代码、图像、视频和音频,并把上述内容统一映射到同一个嵌入空间。

此前,谷歌推出EmbeddingGemma,为开发者提供轻量文本嵌入方案,下载量超过2000万次,主要用于端侧搜索工具和隐私优先检索增强生成(RAG)管线。EmbeddingGemma 2在此基础上扩展多模态能力。

EmbeddingGemma 2基于Gemma 4架构开发,采用Apache 2.0许可发布,总参数为7.4亿,面向端侧推理场景。该模型基于Gemini嵌入模型同源技术打造,在子1B参数多模态嵌入模型中,于MTEB Code、MAEB等基准测试取得领先分数,性能接近或超过部分更大尺寸模型。

该模型采用模块化设计,纯文本任务仅需2.7亿参数,可按需添加1.7亿参数的视觉编码器和3亿参数的音频编码器,实现完整多模态支持。借助Matryoshka表示学习(MRL),开发者可将输出向量从768维动态截断至512、256或128维,本地向量数据库存储和内存占用可缩减6倍。

端侧运行方面,EmbeddingGemma 2量化后在谷歌Pixel 11 Pro上,纯文本权重约需191MB运行内存,完整多模态模型约需567MB。模型配备8K Token上下文窗口,比初代EmbeddingGemma大4倍,可在本地硬件直接处理5.5分钟音频、29张图像、58个视频帧,或上述内容的交错组合。

性能表现上,EmbeddingGemma 2保留前代多语言文本性能,代码性能提升9.92分,在MTEB Code测试中从68.76提升至78.68,可用于本地代码库索引、语义代码搜索和编程代理检索。在图像、视频、文档和音频任务中,该模型在子1B参数模型中提升单位参数质量表现,并超过部分尺寸为其两倍的专业模型。

版权声明:本文由驱动中国整理发布,转载需注明出处与原文链接。如有疑问请联系 editor@qudong.com。
来源:驱动中国 · 原文链接:https://www.qudong.com/article/525353.html
本文价值 ★★★★★ 4 1 人已评
登录后为本文打分
网友评论0 条评论
正在回复 的评论取消
评论加载中…
🔐

登录后参与互动

评论、点赞均可赚积分
连续签到、邀请好友也有奖励 🎁

电脑端: 微信扫码登录 微信内: 一键登录

微信扫一扫

打开微信「扫一扫」,分享本文到朋友圈或好友

分享卡已生成

长按下方图片保存,转发到朋友圈或微信群

分享卡