EmbeddingGemma 2登场!Google AI搜寻可离线跑 语音找影片 文字搜音讯

Alphabet (GOOGL-US)旗下Google DeepMind宣布推出新一代开放式多模态嵌入模型EmbeddingGemma 2,将原本以文字为主的EmbeddingGemma扩充至程式码、图片、影片及音讯,并把不同类型的资料映射到同一个768维向量空间,让开发者可以在装置本地直接进行跨模态搜寻、资料检索及生成式AI应用。

(图:REUTERS/TPG)

EmbeddingGemma 2建立于Gemma 4架构,拥有7.4亿个参数,採Apache 2.0授权,可用于商业产品。Google表示,这款模型的设计重点是以较小的模型规模提供多模态嵌入能力,让AI搜寻及检索工作可以直接在手机、个人电脑等消费性硬体上执行,而不必将资料全部传送至云端。

EmbeddingGemma 2採模组化架构,文字与程式码功能只需要2.7亿个参数,加入视觉编码器后为4.4亿个参数,加入音讯编码器后为5.7亿个参数,完整启用文字、程式码、图片、影片与音讯功能则使用7.4亿个参数。视觉编码器增加1.7亿个参数,音讯编码器增加3亿个参数,开发者可以按照实际需求选择需要载入的模组。

‌

这种设计让EmbeddingGemma 2能够将不同来源的资讯放进同一个语意空间。例如,使用者可以输入文字搜寻特定照片,也可以利用语音备忘录寻找相关影片片段,甚至以文字查询数小时的音讯内容。不同模态的资料虽然经过不同编码器处理,最后仍会被转换成可以直接比较语意相似度的向量。

Google表示,EmbeddingGemma 2特别适合需要本地搜寻及检索的应用,包括个人媒体库搜寻、文件及程式码搜寻、影音资料检索,以及结合生成式AI的检索增强生成(RAG)系统。由于嵌入运算可以直接在装置上完成,开发者可降低资料传输需求与延迟,同时提高隐私保护能力,部分应用也能在没有网路连线的情况下运作。

EmbeddingGemma 2的上下文视窗扩大至8192个token,是第一代EmbeddingGemma的4倍。在单一模态、没有加入文字的情况下,模型最多可处理约5.5分钟音讯、29张图片或58个影片画面,也能处理文字与多种媒体交错的输入。

在效能方面,Google表示EmbeddingGemma 2在MTEB Code测试的分数从第一代的68.76提高至78.68,增加9.92分。Google开发者资料则指出,这相当于约14%的效能提升,同时维持第一代EmbeddingGemma在多语言文字上的表现,并进一步加入图片、影片及音讯检索能力。

‌

EmbeddingGemma 2也採用Matryoshka Representation Learning(MRL),让开发者可以把原本768维的输出向量动态缩减至512、256或128维,以降低向量资料库的储存与记忆体需求。Google表示,最多可以降低约6倍储存需求。

其中,使用256维向量时,文字及程式码仍可保留大部分原始嵌入品质,而图片、影片及语音检索约可维持95%的原始品质,储存空间则可降至原本约三分之一。若进一步缩减至128维,文字及程式码约可维持90%品质,但图片、影片及语音检索品质可能降至约75%,因此较适合大型文字索引或第一阶段搜寻筛选。

Google开发者指南指出,在bfloat16精度下,储存100万个768维向量约需要1.5GB记忆体,若缩减至128维,则约需要250MB,代表相同记忆体容量下可以储存约6倍数量的嵌入向量。

在装置端执行效率方面,Google表示,经量化后,EmbeddingGemma 2在Pixel 11 Pro上执行文字版本时,主动RAM需求最低约191MB;完整多模态版本则约需要567MB。这使模型能够在相对有限的装置资源下执行,而不必依赖大型云端运算基础设施。

EmbeddingGemma 2也可以与Gemma 4搭配使用,建立完整的装置端RAG流程。由于两者共享文字tokenizer及音讯编码器架构,Google表示,开发者可以降低两个模型同时运作时的整体记忆体占用,让嵌入、搜寻及生成式推理能够在同一套本地AI流程中完成。

在实际应用上,Google AI Edge Gallery已展示Instant Media Search及Video Moments Finder等功能。前者可利用文字或图片在装置上的媒体资料库寻找语意相近内容,后者则能利用文字或音讯搜寻影片中的特定片段。Google也展示将EmbeddingGemma 2与Gemma 4结合,用于本地档案检索及后续内容理解。

除了搜寻与RAG,EmbeddingGemma 2也可以用于分类、路由及即时决策。Google表示,开发者可以透过MediaPipe Decision Task API利用多模态资讯建立即时决策引擎,进一步把模型应用在需要根据文字、图片、音讯及影片内容做判断的装置端AI系统。

EmbeddingGemma 2的推出也延续第一代EmbeddingGemma的开发者生态。Google表示,第一代EmbeddingGemma自去年推出后已累积超过2000万次下载,开发者利用它建立装置端搜寻工具及强调隐私的RAG系统。此次第二代模型则将应用範围从文字扩展到多种媒体格式。

在开发工具方面,EmbeddingGemma 2可透过sentence-transformers 6.1.0以上版本使用,也支援Transformers、MLX、vLLM、llama.cpp、SGLang、Ollama及LM Studio等工具。开发者可以透过Google AI Edge的MediaPipe进行嵌入、检索及决策任务,也能使用LiteRT进行自订模型整合,并可透过transformers.js及WebGPU在浏览器环境部署。

模型权重目前可在Hugging Face及Kaggle取得,Google也表示,未来将在Gemini Enterprise Agent Platform Model Garden提供相关模型。针对需要进一步调整模型的开发者,Google同时提供Unsloth微调工具的相关支援。

EmbeddingGemma 2另一项重要特色是所有模组仍使用相容的768维共享向量空间。这意味着开发者即使一开始只建立文字索引,日后若要加入图片或音讯,也不必重新计算既有嵌入资料,只需载入额外编码器即可扩充系统。

Google表示,EmbeddingGemma 2的核心目标是让多模态搜寻与检索能力从云端进一步下沉至终端装置。对开发者而言,这不仅可以降低延迟及云端运算成本,也能让敏感资料留在使用者装置内。随着AI应用逐渐从单纯文字互动走向同时理解图片、声音、影片及程式码,能够在有限硬体资源下处理多模态资料的嵌入模型,将成为建立新一代装置端AI应用的重要基础。

发布于 2026-10-07 12:36
收藏
1
上一篇:三星明公布Q3初步业绩!市场忧韩元升值与长约侵蚀业绩 HBM4E能否延续AI记忆体景气? 下一篇:没有了