开源项目
开源项目

嵌入模型开源:谷歌EmbeddingGemma 2把191MB塞进手机

谷歌 2026-10-06 发布开源嵌入模型 EmbeddingGemma 2(HF 仓 google/embeddinggemma-2,API 实核:ungated、license 标 apache-2.0、21,148 下载)。Gemma 4 架构:270M 文本/代码骨干 + 170M 视觉 + 300M 音频编码器 = 全量 740M,同一 checkpoint 四档加载(270M/440M/570M/740M),文本、代码、图像、音频、视频统一进 768 维向量空间,上下文 8192(一代 4 倍)。端侧账本(官方口径):Pixel 11 Pro 量化后纯文本约 191MB、全模态约 567MB;权重 1.49GB bfloat16。基准全是谷歌自报(无独立评测、无论文、MTEB 提交未获接受):MTEB Code 68.76 升至 78.68 是唯一显著提升,多语言文本较一代仅 +0.21,英文略降——卖点不是「处处更强」而是「同等文本质量+新模态+更小部署」。MRL 套娃 768 维可裁至 128,向量存储最多省 6 倍。许可核真如实写:Apache 2.0 声明在 metadata 且 ungated(一代 gated+Gemma 许可,实质放开),但仓库根目录无 LICENSE 文件、模型卡仍保留 Gemma Prohibited Use Policy 一行。生态:sentence-transformers 6.1.0+、transformers 5.19.0、Ollama、llama.cpp、MLX、Qdrant;一代累计超 2000 万下载。

发布于 2026年10月9日10 分钟阅读
<!-- embeddinggemma-2-open-source-resource | open-source | 嵌入模型开源:谷歌EmbeddingGemma 2把191MB塞进手机 -->

10 月 6 日,谷歌把 EmbeddingGemma 2 的完整权重挂上了 Hugging Face:一颗 740M 的全模态嵌入模型,文本、图像、音频共用同一个 768 维向量空间,官方口径下量化之后在 Pixel 11 Pro 上跑纯文本检索,活动内存约 191MB。权重仓库是 google/embeddinggemma-2,仓库地址:huggingface.co/google/embeddinggemma-2,下载不用申请,许可标注 Apache 2.0。

嵌入模型平时不出新闻。它是 RAG 系统的地基,检索质量的上限很大程度在选模型那一刻就被决定了,通常只有检索不对劲的时候,它才会被人想起来。也正因为如此,这个赛道每一次权重级别的发布都值得认真看:换嵌入模型不是改个配置的事,是全库重嵌的事。

谷歌这次发布有意思的地方在于,它把三件不太一样的事打包在了一起:模型做成四档加载,四种模态共用一个向量空间,许可证从上一代的门控加自定义协议换成了 ungated 加 Apache。而另一面,最能反映模型成色的分数表几乎原地踏步。一手信息来自 blog.google 的官方博客,这篇文章把这五个层面逐个拆开,先讲清楚它是什么,再讲清楚它到底强不强。

一颗 checkpoint,四档加载

先拆结构。EmbeddingGemma 2 基于谷歌 Gemma 4 架构,由三块组成:270M 的文本与代码骨干、170M 的视觉编码器、300M 的音频编码器,全量加起来 740M。设计上的聪明处在加载方式:同一个 checkpoint,可以按需只加载其中一部分,形成四档——270M 纯文本、440M 加视觉、570M 加音频、740M 全模态。

这解决的是嵌入模型的一个老矛盾:全模态能力强,但很多业务根本用不上图像和音频,为用不到的能力多付内存和推理成本并不划算。四档加载让纯文本场景只背 270M 的包袱,需要多模态再往上升档,同一套权重不用换模型。对部署方来说还有一层好处:同一个模型在不同业务线上可以按需裁剪,客服知识库走纯文本档,素材库检索走全模态档,向量化口径却是同一个。

四个模态的向量落在同一个 768 维空间里,这是这一代最大的卖点。传统做法里,文本检索用文本嵌入模型,图像检索用图像嵌入模型,两套向量、两套索引、两套维护成本;统一空间意味着一次入库,文搜图、文搜音视频都能直接查——用一句文字描述去搜图库,拿会议纪要的片段去搜录音录像,都不用额外搭桥。

上下文长度从一代的 2048 涨到 8192,正好 4 倍。对 RAG 分块的直接影响是:同样一篇长文档可以切成更少、更完整的块,语义信息被切断的概率随之下降,检索命中的片段更有上下文可用。权重文件是 1.49GB 的 bfloat16 safetensors,一张普通消费级显卡就装得下,下载门槛不高。

两个账本:内存的和存储的

端侧数字先标口径:以下全部来自谷歌自报,目前没有第三方复核。官方给的说法是,在 Pixel 11 Pro 上量化后跑纯文本,活动内存约 191MB;全模态约 567MB。如果数字属实,这意味着手机本地跑一颗多模态嵌入模型不再是概念——照片搜索、离线语音检索这类功能可以不经过云端,数据不出设备。这也解释了为什么同一天 LiteRT/MediaPipe 端侧框架就宣布了支持,谷歌显然是按「装进手机」的标准设计的这颗模型。当然,自报数字看个量级就好,具体到自己的设备表现如何,只能实测说话。

存储侧的账本更实在。EmbeddingGemma 2 支持 MRL 套娃表示——同一个向量像俄罗斯套娃一样,外层是完整的 768 维,往里裁可以取前 512 维、256 维直到 128 维,每一层都保留了可用的语义信息。768 维向量可以裁到 128 维,向量存储最多省 6 倍。

这笔账在 RAG 场景里很好算:百万级向量库,维度从 768 降到 128,索引占用的内存和磁盘直接除以 6,检索延迟也跟着降,向量库的选型压力都小一截。代价是裁维之后精度会有折损,裁得越狠折损越大,128 维够不够用要拿自己的数据验,一般从 512、256 逐步往下试,找到一个精度和存储都能接受的平衡点。好在裁维是在编码之后做的,同一份向量可以按需取不同粒度,试错成本不高。

分数表:值得高兴的只有代码那一行

最能说明这代定位的是基准分数,先把口径说死:以下全部是谷歌自报,没有独立评测,没有论文,MTEB 提交甚至未获接受,公开榜单上查不到成绩,读的时候按厂商宣传材料的规格来。

具体三项。代码检索是唯一显著提升项:MTEB Code 从一代的 68.76 涨到 78.68,加了 9.92 分,代码相关检索需求重的团队可以重点关注——代码库问答、报错信息检索这类场景是这一代实打实的进步。多语言文本较一代只涨了 0.21 分,约等于原地踏步;英文反而略有下降。语言覆盖是 100+ 语言。

把三项摊开,结论不难下:这不是一次冲榜式的换代。嵌入模型的迭代通常拿多语言和英文主榜说事,这一代在这两处基本持平甚至倒退,真正的升级发生在工程维度——四模态统一空间、端侧体积、上下文长度、许可证。

怎么读这个取舍?谷歌把「能力更强」换成了「更能装进设备、更好集成」。冲榜需要堆参数堆数据,装进设备要求的是小、快、省,两个方向天然打架,这一代明显押了后者。对在服务器上跑大规模文本检索的团队,这代未必比一代强多少;对要做端侧检索、多模态检索,或者被向量存储成本卡着的团队,这代给的恰好是他们要的东西。成色如何,最终还是要拿自己的语料跑一遍才知道,别拿厂商的分数当自己场景的结论。

许可证核真:实打实放开,带着两行小字

许可证是这次发布里实际变化最大的部分,逐条核过。

本站 10 月 9 日通过 Hugging Face API 实核仓库状态:gated 为 false,下载不排队不申请;license 标注 apache-2.0,写在仓库 metadata 和模型卡链接里;页面显示 21,148 次下载。对比一代 EmbeddingGemma 的 gated 下载加 Gemma 自定义许可,这一代是实打实的放开:研究不用说了,商用、闭源衍生、修改再分发,Apache 2.0 的标准条款都覆盖,拿去做商业产品的检索底座,法律层面没有额外门槛。

放开的含金量要放在上一代的对照下看。gated 意味着下载之前要先登录、申请、等审批,团队里每个要碰权重的人都要走一遍流程;Gemma 自定义许可则带着品牌标注、行为约束等附加条款,合规团队读起来要比 Apache 费劲得多。一代累计下载超过 2000 万,可见门槛没拦住需求,但从 gated 加自定义许可到 ungated 加 Apache 2.0,姿态上是质的区别。

放开里有两行小字要念。第一行,仓库根目录的 15 个文件清单里没有 LICENSE 文件,许可声明只存在于 metadata 和模型卡——法律效力上以声明为准,但对要做合规审查的团队来说,仓库里没有一份可下载的许可文本,法务过流程时多半会多问一句。第二行,模型卡仍保留一行「须遵守 Gemma Prohibited Use Policy」,也就是谷歌的禁用场景清单。这一行和 Apache 2.0 并存的确切边界,官方没有进一步解释,稳妥的读法是:许可证放开了常规使用,但谷歌保留了对禁用场景的主张。做常规业务无感,做敏感方向先读那份清单。

生态:发布当日全线接住

谷歌在嵌入模型上的生态号召力有底子,一代累计下载超过 2000 万,主流向量库和框架早有适配惯性。这一代的框架支持也快:transformers 5.19.0 在发布当日就给了支持,sentence-transformers 要求 6.1.0 以上;MLX、Ollama、llama.cpp、vLLM、LiteRT/MediaPipe 各端到位——服务器推理有 vLLM,个人电脑本地跑有 Ollama 和 llama.cpp,苹果芯片有 MLX,手机端侧有 LiteRT/MediaPipe,四条路都是现成的;向量库一侧 Qdrant 官方合作做了存储适配,微调有 Unsloth 的指南。

对个人开发者和中小团队来说,这个生态密度意味着上手成本很低:不写代码用 Ollama 拉下来就能跑,写代码两行加载,要定制就照着 Unsloth 的指南微调。嵌入模型这种基础设施类的组件,生态齐不齐往往比分数高不高分更影响选型决策。

上手有一个容易踩的坑要提前说:task prompt prefixes 是硬要求。查询要写成 task: {任务描述} | query: {内容},文档要写成 title: {标题} | text: {正文},检索、问答、事实核查、分类、聚类、语义相似度、代码检索七种任务各有前缀,漏掉了不会报错,只会静默掉精度——检索质量莫名偏低的排查清单里,这个要排第一位。这个坑一代就有人踩过,二代沿用同样口径,完整的前缀表和上手代码,本站的 嵌入模型升级 SOP 有整理。

上车之前

最后给决策视角。嵌入模型有个特殊属性:换模型等于全库重嵌,百万级文档重嵌一遍是真金白银的时间和算力,所以这类决策值得一次做对,而不是每出一颗新模型就跟一次。三句话概括:

正在选型的,注意各家分数口径互不相通,MTEB 各子榜不能跨表比排名,谁的自报分都别直接拿来当比较依据;EmbeddingGemma 2 的四模态统一空间和端侧体积是它独有的牌,纯文本检索的老牌选手各有各的长处,逐项对比本站的 开源 RAG 嵌入模型横评摆了同一张桌子。已经在用一代的,多语言和英文基本没变,升不升级看你要不要多模态和端侧,代码检索需求重的可以直接换。检索质量不对劲的,先加 reranker 再考虑换嵌入模型——前者分钟级接入,后者全库重嵌,先把便宜的路走完再动地基。

从零搭 RAG 的,本站 AI 知识库搭建 SOP 从平台选型讲起,嵌入模型选型是其中一环,配合分块策略和评估两篇食用更完整。

常见问题

Q1: EmbeddingGemma 2 可以商用吗?

A1: 可以。许可为 Apache 2.0,仓库 ungated,下载不用申请,商用、闭源衍生都在标准条款覆盖之内。但有两点小字:仓库根目录没有 LICENSE 文件,许可声明只在 metadata 和模型卡;模型卡保留一行须遵守 Gemma Prohibited Use Policy,敏感方向商用前先读那份清单。

Q2: 191MB 是什么口径的数字?

A2: 谷歌官方口径:Pixel 11 Pro 上量化后跑纯文本的活动内存约 191MB,全模态约 567MB。目前没有第三方复核,自己设备上的表现以实测为准,选型时把这个数字当量级参考,不要当承诺。

Q3: 这一代比一代强多少?

A3: 分指标看,且全部是谷歌自报、无独立评测:MTEB Code 从 68.76 到 78.68,涨 9.92 分,是唯一显著提升;多语言只涨 0.21;英文反而略降。升级重心在多模态、端侧和许可证,不在分数,冲着文本检索精度升级的可以先观望。

Q4: 怎么在本地跑起来?

A4: 服务器走 sentence-transformers 6.1.0 以上或 transformers 5.19.0 以上,推理引擎 vLLM、llama.cpp 都支持;个人电脑走 Ollama 最省事;苹果芯片走 MLX;手机端侧走 LiteRT/MediaPipe。注意查询和文档必须按七种任务加对应前缀,漏了不会报错,只会静默掉精度。

Q5: 它和 Qwen3-Embedding、BGE-M3 怎么选?

A5: 各家自报分数口径不同,不能跨表排名。EmbeddingGemma 2 的差异化在四模态统一向量空间、端侧 191MB 和 MRL 裁维省存储;纯文本长上下文或强中文场景,Qwen3 系列值得看;需要 dense、sparse、multi-vector 一模三吃的看 BGE-M3。逐项对比见本站横评篇。

互动

你的 RAG 库里现在跑的是哪颗嵌入模型?四模态统一空间和 191MB 端侧,哪个更戳你的场景?评论区聊聊。

本文由 AI 辅助生成,经人工审核编辑。最后更新:2026-10-09

常见问题

EmbeddingGemma 2 可以商用吗?
可以。许可为 Apache 2.0,仓库 ungated,下载不用申请,商用、闭源衍生都在标准条款覆盖之内。但有两点小字:仓库根目录没有 LICENSE 文件,许可声明只在 metadata 和模型卡;模型卡保留一行须遵守 Gemma Prohibited Use Policy,敏感方向商用前先读那份清单。
191MB 是什么口径的数字?
谷歌官方口径:Pixel 11 Pro 上量化后跑纯文本的活动内存约 191MB,全模态约 567MB。目前没有第三方复核,自己设备上的表现以实测为准,选型时把这个数字当量级参考,不要当承诺。
这一代比一代强多少?
分指标看,且全部是谷歌自报、无独立评测:MTEB Code 从 68.76 到 78.68,涨 9.92 分,是唯一显著提升;多语言只涨 0.21;英文反而略降。升级重心在多模态、端侧和许可证,不在分数,冲着文本检索精度升级的可以先观望。
怎么在本地跑起来?
服务器走 sentence-transformers 6.1.0 以上或 transformers 5.19.0 以上,推理引擎 vLLM、llama.cpp 都支持;个人电脑走 Ollama 最省事;苹果芯片走 MLX;手机端侧走 LiteRT/MediaPipe。注意查询和文档必须按七种任务加对应前缀,漏了不会报错,只会静默掉精度。
它和 Qwen3-Embedding、BGE-M3 怎么选?
各家自报分数口径不同,不能跨表排名。EmbeddingGemma 2 的差异化在四模态统一向量空间、端侧 191MB 和 MRL 裁维省存储;纯文本长上下文或强中文场景,Qwen3 系列值得看;需要 dense、sparse、multi-vector 一模三吃的看 BGE-M3。逐项对比见本站横评篇。

相关文章

开源项目

Qwen-Image 2.1开源:权重回来了,Apache没回来

阿里 Qwen 团队 2026-09-20 开源 Qwen-Image-2.1:把文生图、图像编辑、原生 RGBA 透明输出塞进一个 7B checkpoint——32 层单流 DiT(混合粒度注意力+prefix KV 复用)+ Qwen3-VL 8B 文本编码器(兼任参考图编码)+ 64 通道 RGBA VAE,BF16 全套约 33GB,Comfy-Org 量化 repack 可压到约 14GB。能力:原生 2048×2048(七种比例至 2752×1536)、40 步推理、单次最多 10 张参考图、圆圈/蒙版局部编辑、透明 PNG 直出(官方给推荐提示词句式),另附两个 9B 提示词重写器。实测口径:vLLM-Omni 1024² 40 步 BF16 峰值 34GB、3.3-4.5 秒/图(单源);官方称 3090 可跑(offload)。零日生态:Diffusers、ComfyUI、vLLM-Omni、SGLang、LightX2V,首日 14 个微调、18 个量化。核真重点(本篇主轴):历代 Qwen-Image 全是 Apache 2.0,2.1 首次改用 Qwen Research License——仅限非商用(research/evaluation),商用需单独向阿里申请,衍生微调继承限制且须标 "Built with Qwen";社区「license trap」争议与 HF 席「License renders this model useless」如实呈现。Qwen-Image-Bench 60.28 第七为厂商自设自测口径。谱系专节:3.0 是纯 API 分叉,2.1 才是可下载线——权重回来了,Apache 没回来。

2026年10月8日10 分钟阅读
开源项目

B站下场做翻译模型:150种语言,35B只激活3B

B站 Index LLM 团队 2026-09-30 开源 Index-Translate 翻译模型家族(HF/ModelScope 权重,Apache-2.0):2B/9B/35B-A3B-preview 三档文本模型,基于 Qwen3.5,覆盖 150 种语言(官方自报口径),35B 总参仅激活约 3B,262,144 token 上下文。三分支各管一摊:Index-Echo 配音保留说话人音色(中↔英/西/日);Index-Homura 音节数控制(9B 在 SandGlass 测试 81.92% 落在目标 ±10% 内,配音对轨用);Index-NativeLong(又称 Index-Nailong)长文档跨段一致(3.2 万 token 幻想文本中人名/王衔双关全程一致,逐块翻译会漂移)。受控翻译 instTrans:硬约束=术语表强制(如 碳纤维:carbon fiber)+ JSON/CSV/代码/占位符结构保留;软约束=语气/领域消歧(plant→工厂)/跨句一致/LaTeX 保留。本地部署一行命令:官方 GGUF(Q4_K_M 21.71GB)+ llama.cpp serve,另附浏览器扩展与视频配音 pipeline。诚实点:全部分数官方自报、暂无第三方独立复现(FLORES COMET-22 0.8794、WMT26 Judge 76.76、低资源 off-target 2.4%),且同一官方表里 DeepSeek-V4.1-Flash 的 WMT26 Judge 83.55 更高——不是全表第一。

2026年10月7日10 分钟阅读
开源项目

NVIDIA给AIagent上锁:运行时开源,看门狗进芯片

NVIDIA Open Agent Safety Platform 深拆(官方资料与多源报道,2026-10-05 口径):核心主张「agent 安全不能只靠模型自己听话」——当 agent 本身就是试图绕过护栏的软件时,应用层护栏失效;agent drift(因提示模糊/工具缺失/策略冲突渐进偏离意图)不触发任何告警。两层结构:OpenShell(Apache 2.0 开源,内核级沙箱安全运行时,策略覆盖文件/进程/凭证/工具/网络/数据库六域,执行前意图对齐+执行中 drift 监控,跑 Vera CPU 可扩展 Arm/Intel);NVIDIA Sentry(BlueField-4 DPU 带外看门狗,基于 DOCA 验身份/出可证明遥测/执行细粒度策略,agent 越界毫秒级隔离叫停,参考设计非开源硬件)。三层分离:应用/运行时/基础设施。100+ 组织参与(Anthropic 集成 Claude Managed Agents、Salesforce 用于 Slack、SpaceXAI 用于 Cursor agent),隶属 Linux Foundation 旗下 Open Secure AI Alliance。批评口径如实写入:Gartner 指出 OpenAI/Amazon/Google 缺席;IDC 估计覆盖企业 agentic 安全问题可能不到 25%;Control Risks 指出只管自家基础设施上的已知 agent(影子/SaaS 内嵌/攻击者投递三类管不到);供应商锁定讨论。与开放模型权重的 Kimi K3 恰为 agent 安全图谱两端。

2026年10月5日10 分钟阅读