手机里一直缺一块拼图:能理解并搜索你自己的东西,却不用把它传到服务器上。Google 发布的 EmbeddingGemma 2 想补上这块拼图——这是它第一个原生多模态的端侧嵌入开放模型,采用 Apache 2.0 许可。
它把文本、代码、图像、音频和视频放进同一个可搜索空间,全部在手机上完成。模型规模 740M 参数,基于 Gemma 4 架构。
打开网易新闻 查看精彩图片
模块化拆开,按需加载
它的各个部件是模块化的,这意味着应用不必一次性背上全部重量:
- 纯文本应用只需要 270M 参数
- 170M 的视觉编码器和 300M 的音频编码器,只在需要时才加载
在 Pixel 11 Pro 上,量化后的文本权重占用约 191MB 活跃内存,完整多模态模型占用约 567MB。
上下文窗口扩大了 4 倍,达到 8K token——单次输入大约够放 5.5 分钟音频、29 张图像或 58 帧视频。
代码搜索涨得最猛
各项能力里,代码搜索的收益最明显:MTEB Code 分数从 68.76 升到 78.68,同时多语言文本分数保持持平。
Google 还声称,它在音频和视觉基准上取得了 10 亿参数以下模型的最好结果,并赢过了一些规模是它两倍的专业模型。
把这些数字放在一起看,端侧多模态的账本其实很清楚:过去要在手机上做跨模态检索,要么把数据送出去,要么塞一个跑不动的模型。EmbeddingGemma 2 给出的答案是拆——文本、视觉、音频各管一段,用的时候再拼起来,内存占用按需浮动。
对开发者来说,Apache 2.0 意味着可以把它直接嵌进产品里。对用户来说,变化可能更朴素:手机开始能搜自己的东西,而这些东西不必先离开手机。
热门跟贴