10 月 6 日,谷歌把 EmbeddingGemma 2 的完整权重挂上了 Hugging Face:一颗 740M 的全模态嵌入模型,文本、图像、音频共用同一个 768 维向量空间,官方口径下量化之后在 Pixel 11 Pro 上跑纯文本检索,活动内存约 191MB。权重仓库是 google/embeddinggemma-2,仓库地址:huggingface.co/google/embeddinggemma-2,下载不用申请,许可标注 Apache 2.0。
嵌入模型平时不出新闻。它是 RAG 系统的地基,检索质量的上限很大程度在选模型那一刻就被决定了,通常只有检索不对劲的时候,它才会被人想起来。也正因为如此,这个赛道每一次权重级别的发布都值得认真看:换嵌入模型不是改个配置的事,是全库重嵌的事。
谷歌这次发布有意思的地方在于,它把三件不太一样的事打包在了一起:模型做成四档加载,四种模态共用一个向量空间,许可证从上一代的门控加自定义协议换成了 ungated 加 Apache。而另一面,最能反映模型成色的分数表几乎原地踏步。一手信息来自 blog.google 的官方博客,这篇文章把这五个层面逐个拆开,先讲清楚它是什么,再讲清楚它到底强不强。
一颗 checkpoint,四档加载
先拆结构。EmbeddingGemma 2 基于谷歌 Gemma 4 架构,由三块组成:270M 的文本与代码骨干、170M 的视觉编码器、300M 的音频编码器,全量加起来 740M。设计上的聪明处在加载方式:同一个 checkpoint,可以按需只加载其中一部分,形成四档——270M 纯文本、440M 加视觉、570M 加音频、740M 全模态。
这解决的是嵌入模型的一个老矛盾:全模态能力强,但很多业务根本用不上图像和音频,为用不到的能力多付内存和推理成本并不划算。四档加载让纯文本场景只背 270M 的包袱,需要多模态再往上升档,同一套权重不用换模型。对部署方来说还有一层好处:同一个模型在不同业务线上可以按需裁剪,客服知识库走纯文本档,素材库检索走全模态档,向量化口径却是同一个。
四个模态的向量落在同一个 768 维空间里,这是这一代最大的卖点。传统做法里,文本检索用文本嵌入模型,图像检索用图像嵌入模型,两套向量、两套索引、两套维护成本;统一空间意味着一次入库,文搜图、文搜音视频都能直接查——用一句文字描述去搜图库,拿会议纪要的片段去搜录音录像,都不用额外搭桥。
上下文长度从一代的 2048 涨到 8192,正好 4 倍。对 RAG 分块的直接影响是:同样一篇长文档可以切成更少、更完整的块,语义信息被切断的概率随之下降,检索命中的片段更有上下文可用。权重文件是 1.49GB 的 bfloat16 safetensors,一张普通消费级显卡就装得下,下载门槛不高。
两个账本:内存的和存储的
端侧数字先标口径:以下全部来自谷歌自报,目前没有第三方复核。官方给的说法是,在 Pixel 11 Pro 上量化后跑纯文本,活动内存约 191MB;全模态约 567MB。如果数字属实,这意味着手机本地跑一颗多模态嵌入模型不再是概念——照片搜索、离线语音检索这类功能可以不经过云端,数据不出设备。这也解释了为什么同一天 LiteRT/MediaPipe 端侧框架就宣布了支持,谷歌显然是按「装进手机」的标准设计的这颗模型。当然,自报数字看个量级就好,具体到自己的设备表现如何,只能实测说话。
存储侧的账本更实在。EmbeddingGemma 2 支持 MRL 套娃表示——同一个向量像俄罗斯套娃一样,外层是完整的 768 维,往里裁可以取前 512 维、256 维直到 128 维,每一层都保留了可用的语义信息。768 维向量可以裁到 128 维,向量存储最多省 6 倍。
这笔账在 RAG 场景里很好算:百万级向量库,维度从 768 降到 128,索引占用的内存和磁盘直接除以 6,检索延迟也跟着降,向量库的选型压力都小一截。代价是裁维之后精度会有折损,裁得越狠折损越大,128 维够不够用要拿自己的数据验,一般从 512、256 逐步往下试,找到一个精度和存储都能接受的平衡点。好在裁维是在编码之后做的,同一份向量可以按需取不同粒度,试错成本不高。
分数表:值得高兴的只有代码那一行
最能说明这代定位的是基准分数,先把口径说死:以下全部是谷歌自报,没有独立评测,没有论文,MTEB 提交甚至未获接受,公开榜单上查不到成绩,读的时候按厂商宣传材料的规格来。
具体三项。代码检索是唯一显著提升项:MTEB Code 从一代的 68.76 涨到 78.68,加了 9.92 分,代码相关检索需求重的团队可以重点关注——代码库问答、报错信息检索这类场景是这一代实打实的进步。多语言文本较一代只涨了 0.21 分,约等于原地踏步;英文反而略有下降。语言覆盖是 100+ 语言。
把三项摊开,结论不难下:这不是一次冲榜式的换代。嵌入模型的迭代通常拿多语言和英文主榜说事,这一代在这两处基本持平甚至倒退,真正的升级发生在工程维度——四模态统一空间、端侧体积、上下文长度、许可证。
怎么读这个取舍?谷歌把「能力更强」换成了「更能装进设备、更好集成」。冲榜需要堆参数堆数据,装进设备要求的是小、快、省,两个方向天然打架,这一代明显押了后者。对在服务器上跑大规模文本检索的团队,这代未必比一代强多少;对要做端侧检索、多模态检索,或者被向量存储成本卡着的团队,这代给的恰好是他们要的东西。成色如何,最终还是要拿自己的语料跑一遍才知道,别拿厂商的分数当自己场景的结论。
许可证核真:实打实放开,带着两行小字
许可证是这次发布里实际变化最大的部分,逐条核过。
本站 10 月 9 日通过 Hugging Face API 实核仓库状态:gated 为 false,下载不排队不申请;license 标注 apache-2.0,写在仓库 metadata 和模型卡链接里;页面显示 21,148 次下载。对比一代 EmbeddingGemma 的 gated 下载加 Gemma 自定义许可,这一代是实打实的放开:研究不用说了,商用、闭源衍生、修改再分发,Apache 2.0 的标准条款都覆盖,拿去做商业产品的检索底座,法律层面没有额外门槛。
放开的含金量要放在上一代的对照下看。gated 意味着下载之前要先登录、申请、等审批,团队里每个要碰权重的人都要走一遍流程;Gemma 自定义许可则带着品牌标注、行为约束等附加条款,合规团队读起来要比 Apache 费劲得多。一代累计下载超过 2000 万,可见门槛没拦住需求,但从 gated 加自定义许可到 ungated 加 Apache 2.0,姿态上是质的区别。
放开里有两行小字要念。第一行,仓库根目录的 15 个文件清单里没有 LICENSE 文件,许可声明只存在于 metadata 和模型卡——法律效力上以声明为准,但对要做合规审查的团队来说,仓库里没有一份可下载的许可文本,法务过流程时多半会多问一句。第二行,模型卡仍保留一行「须遵守 Gemma Prohibited Use Policy」,也就是谷歌的禁用场景清单。这一行和 Apache 2.0 并存的确切边界,官方没有进一步解释,稳妥的读法是:许可证放开了常规使用,但谷歌保留了对禁用场景的主张。做常规业务无感,做敏感方向先读那份清单。
生态:发布当日全线接住
谷歌在嵌入模型上的生态号召力有底子,一代累计下载超过 2000 万,主流向量库和框架早有适配惯性。这一代的框架支持也快:transformers 5.19.0 在发布当日就给了支持,sentence-transformers 要求 6.1.0 以上;MLX、Ollama、llama.cpp、vLLM、LiteRT/MediaPipe 各端到位——服务器推理有 vLLM,个人电脑本地跑有 Ollama 和 llama.cpp,苹果芯片有 MLX,手机端侧有 LiteRT/MediaPipe,四条路都是现成的;向量库一侧 Qdrant 官方合作做了存储适配,微调有 Unsloth 的指南。
对个人开发者和中小团队来说,这个生态密度意味着上手成本很低:不写代码用 Ollama 拉下来就能跑,写代码两行加载,要定制就照着 Unsloth 的指南微调。嵌入模型这种基础设施类的组件,生态齐不齐往往比分数高不高分更影响选型决策。
上手有一个容易踩的坑要提前说:task prompt prefixes 是硬要求。查询要写成 task: {任务描述} | query: {内容},文档要写成 title: {标题} | text: {正文},检索、问答、事实核查、分类、聚类、语义相似度、代码检索七种任务各有前缀,漏掉了不会报错,只会静默掉精度——检索质量莫名偏低的排查清单里,这个要排第一位。这个坑一代就有人踩过,二代沿用同样口径,完整的前缀表和上手代码,本站的 嵌入模型升级 SOP 有整理。
上车之前
最后给决策视角。嵌入模型有个特殊属性:换模型等于全库重嵌,百万级文档重嵌一遍是真金白银的时间和算力,所以这类决策值得一次做对,而不是每出一颗新模型就跟一次。三句话概括:
正在选型的,注意各家分数口径互不相通,MTEB 各子榜不能跨表比排名,谁的自报分都别直接拿来当比较依据;EmbeddingGemma 2 的四模态统一空间和端侧体积是它独有的牌,纯文本检索的老牌选手各有各的长处,逐项对比本站的 开源 RAG 嵌入模型横评摆了同一张桌子。已经在用一代的,多语言和英文基本没变,升不升级看你要不要多模态和端侧,代码检索需求重的可以直接换。检索质量不对劲的,先加 reranker 再考虑换嵌入模型——前者分钟级接入,后者全库重嵌,先把便宜的路走完再动地基。
从零搭 RAG 的,本站 AI 知识库搭建 SOP 从平台选型讲起,嵌入模型选型是其中一环,配合分块策略和评估两篇食用更完整。
常见问题
Q1: EmbeddingGemma 2 可以商用吗?
A1: 可以。许可为 Apache 2.0,仓库 ungated,下载不用申请,商用、闭源衍生都在标准条款覆盖之内。但有两点小字:仓库根目录没有 LICENSE 文件,许可声明只在 metadata 和模型卡;模型卡保留一行须遵守 Gemma Prohibited Use Policy,敏感方向商用前先读那份清单。
Q2: 191MB 是什么口径的数字?
A2: 谷歌官方口径:Pixel 11 Pro 上量化后跑纯文本的活动内存约 191MB,全模态约 567MB。目前没有第三方复核,自己设备上的表现以实测为准,选型时把这个数字当量级参考,不要当承诺。
Q3: 这一代比一代强多少?
A3: 分指标看,且全部是谷歌自报、无独立评测:MTEB Code 从 68.76 到 78.68,涨 9.92 分,是唯一显著提升;多语言只涨 0.21;英文反而略降。升级重心在多模态、端侧和许可证,不在分数,冲着文本检索精度升级的可以先观望。
Q4: 怎么在本地跑起来?
A4: 服务器走 sentence-transformers 6.1.0 以上或 transformers 5.19.0 以上,推理引擎 vLLM、llama.cpp 都支持;个人电脑走 Ollama 最省事;苹果芯片走 MLX;手机端侧走 LiteRT/MediaPipe。注意查询和文档必须按七种任务加对应前缀,漏了不会报错,只会静默掉精度。
Q5: 它和 Qwen3-Embedding、BGE-M3 怎么选?
A5: 各家自报分数口径不同,不能跨表排名。EmbeddingGemma 2 的差异化在四模态统一向量空间、端侧 191MB 和 MRL 裁维省存储;纯文本长上下文或强中文场景,Qwen3 系列值得看;需要 dense、sparse、multi-vector 一模三吃的看 BGE-M3。逐项对比见本站横评篇。
互动
你的 RAG 库里现在跑的是哪颗嵌入模型?四模态统一空间和 191MB 端侧,哪个更戳你的场景?评论区聊聊。