EmbeddingGemma 2的代码检索得分,比前代提升了9.92分——在MTEB Code基准上,从68.76涨到了78.68,增幅约14%。这是Google DeepMind新出的多模态嵌入模型,刚上线就能跑。
一个模型搞定全模态嵌入
之前的嵌入模型,文本、图像、音频各一套,跨模态匹配总出问题。EmbeddingGemma 2把所有内容都映射到同一个768维的向量空间:文本、代码、图像、视频、音频全算一套。它的架构是模块化的:文本代码主干270M参数,图像编码器170M(可选),音频编码器300M(可选)。开发者按需加载:只跑文本270M,加图像440M,加音频570M,全量740M,所有配置共享同一个向量空间,不管输入是语音还是图片,生成的向量都能互相匹配。上下文窗口8192 tokens,比前代大4倍,能放下约29张图、58帧视频或5.5分钟音频,足够应付大部分短内容场景。
轻量到能塞在手机里
量化后,它的体积小到能在手机上跑。Google测的Pixel 11 Pro上,text-only版本占191MB内存,全模态版本才567MB。MacBook M5 Pro跑单张图的时间是37.3ms,速度够快。还有Matryoshka表示学习的优化,可以把向量缩到512、256甚至128维。缩到256维时,多语种文本的得分只从61.36降到60.41,几乎没损失;缩到128维时,只适合纯文本场景,MMEB得分掉到45.65,刚好满足不同的存储和性能需求。现在就能从Hugging Face或Kaggle拉权重,支持Ollama、llama.cpp等工具,不用等部署。
和竞品比,核心优势在哪
看一圈竞品,它的特点很明确。对比同系列的EmbeddingGemma 1,后者只有308M参数,只支持文本代码,没有音视频。对比Qwen的3-VL-Embedding,它的2B参数是740M的2.7倍,还不支持音频,而EmbeddingGemma 2是全模态的。对比Google自家的Gemini Embedding,后者是付费API,而EmbeddingGemma 2是Apache 2.0开源,权重可商用,没有授权费的顾虑。而且它的多语种文本质量基本和前代持平,只有代码检索的提升是实打实的亮点——对需要处理代码文档的开发者来说,这个提升直接影响检索效率。
这种小而全的开源多模态嵌入模型,刚好补了设备端AI的一个缺口:之前要么是大参数的闭源模型,要么是轻量但单模态的模型,隐私优先的RAG场景一直没好的选择。现在EmbeddingGemma 2把门槛降下来了,开发者不用再纠结多模态的成本和授权。你觉得,这种模型会不会成为手机AI搜索的下一个小突破?
素材来源:MarkTechPost · AI情报、大模型、AI应用落地、开源生态
查看报道原文

发表第一条评论吧